CrawlForge MCP
首页Playground应用场景集成价格文档博客
  1. 首页/
  2. 应用案例/
  3. PDF 与文档数据提取

PDF 与文档数据提取

无需自己编写解析器,就能从 PDF、年报和监管备案文件中提取结构化字段。process_document 负责读取文件并输出文本、章节与元数据,extract_with_llm 再按你定义的结构返回带类型的 JSON,默认走本地 Ollama,文档内容不出本机。

快速解答

把 process_document(2 credits)指向一个 PDF URL 或本地文件,即可得到文本、章节和元数据,再把这些文本连同一份 JSON 结构定义交给 extract_with_llm(3 credits),就能拿回带类型的字段。每篇文档大约 5 credits,而且提取默认使用本地 Ollama 模型,内容始终留在你的机器上。

面临的问题

关键数字往往藏在 PDF 里:年报、价目表、监管备案文件、研究论文。手工抄录根本无法规模化,而通用 PDF 库只会返回一大段无法查询的纯文本。

解决方案

CrawlForge 的 process_document 可从 PDF URL 或本地文件中提取文本、章节和元数据,extract_with_llm 再把这些文本转成你指定的 JSON 结构——默认运行在本地 Ollama 上,文档内容永远不会离开你的机器。

代码示例

// Pull structured fields out of a PDF report
const doc = await mcp.process_document({
  source: "https://example.com/2026-annual-report.pdf",
  sourceType: "pdf_url",
  options: { extractText: true, extractMetadata: true },
});

// Ask for exactly the fields you need, as JSON
const fields = await mcp.extract_with_llm({
  content: doc.text,
  prompt: "Extract fiscal year, revenue, operating margin, and headcount.",
  schema: {
    type: "object",
    properties: {
      fiscalYear: { type: "string" },
      revenue: { type: "string" },
      operatingMargin: { type: "string" },
      headcount: { type: "number" },
    },
  },
});

console.log(doc.metadata.pageCount);
console.log(fields.data);

使用的工具

process_document2 credits
extract_with_llm3 credits

预估费用:每篇文档约 5 credits

常见问题

如何自动从 PDF 中提取数据?+

把 process_document 指向 PDF 的 URL 或文件,得到文本、章节和元数据,然后把这些文本连同描述所需字段的 JSON 结构发送给 extract_with_llm。你拿回的是带类型的 JSON,而不是一大段纯文本。

PDF 必须放在网上吗?+

不必。process_document 通过 sourceType 接受 URL 或本地文件路径——url、pdf_url、file 或 pdf_file——并提供 pageRange、maxPages 等选项,让你只处理关心的那几页。

提取使用的是哪个模型?+

extract_with_llm 默认使用本地 Ollama 模型,因此文档内容不会离开你的机器。想改用云端模型时,传入 provider openai 或 anthropic 以及对应的 API key 即可。

文档提取要花多少 credits?+

每篇文档大约 5 credits:process_document 占 2 credits,extract_with_llm 占 3 credits。免费的 1,000-credit 套餐大约可处理 200 篇文档,足够你在升级前用真实的档案库验证整条流水线。

准备好开始了吗?

每个新账户均可获得 1,000 个免费 credits,无需信用卡。

免费领取 1,000 个 credits 开始使用

相关应用案例

RAG 知识库数据接入
把文档站点转换成干净、可直接分块的 markdown,用于检索增强生成(RAG)。先用 map_site 枚举全部页面,再用 scrape 抓取并剥离导航与广告等样板内容,最后用 summarize_content 生成摘要,在向量化之前就把语料整理干净。
map_site (2 cr)scrape (2 cr)summarize_content (4 cr)
实时研究智能体
构建能检索网页、综合信息并输出最新研究结论的 AI 智能体。每条结论均标注来源,确保答案始终可核查。
deep_research (10 cr)search_web (5 cr)

页脚

CrawlForge MCP

面向 AI Agent 的企业级网页抓取。28 个专业 MCP 工具,专为构建智能系统的现代开发者而设计。

产品

  • 功能
  • Playground
  • 价格
  • 应用场景
  • 集成
  • 替代方案
  • 更新日志

资源

  • 快速上手
  • API 参考
  • 模板
  • 指南
  • 博客
  • 术语表
  • 常见问题
  • 网站地图

开发者

  • MCP 协议
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

公司

  • 关于我们
  • 联系我们
  • 隐私政策
  • 服务条款
  • 可接受使用政策
  • Cookie

保持更新

获取新工具和新功能的最新动态。

基于 Next.js 和 MCP 协议构建

© 2025-2026 CrawlForge。保留所有权利。