跳到正文

应用案例

无需自己编写解析器,就能从 PDF、年报和监管备案文件中提取结构化字段。process_document 负责读取文件并输出文本、章节与元数据,extract_with_llm 再按你定义的结构返回带类型的 JSON,默认走本地 Ollama,文档内容不出本机。
预估费用:每篇文档约 5 credits

01快速解答

把 process_document(2 credits)指向一个 PDF URL 或本地文件,即可得到文本、章节和元数据,再把这些文本连同一份 JSON 结构定义交给 extract_with_llm(3 credits),就能拿回带类型的字段。每篇文档大约 5 credits,而且提取默认使用本地 Ollama 模型,内容始终留在你的机器上。

02问题与方案

面临的问题

关键数字往往藏在 PDF 里:年报、价目表、监管备案文件、研究论文。手工抄录根本无法规模化,而通用 PDF 库只会返回一大段无法查询的纯文本。

解决方案

CrawlForge 的 process_document 可从 PDF URL 或本地文件中提取文本、章节和元数据,extract_with_llm 再把这些文本转成你指定的 JSON 结构——默认运行在本地 Ollama 上,文档内容永远不会离开你的机器。

03代码

代码示例

pdf-document-extraction.js
// Pull structured fields out of a PDF reportconst doc = await mcp.process_document({  source: "https://example.com/2026-annual-report.pdf",  sourceType: "pdf_url",  options: { extractText: true, extractMetadata: true },}); // Ask for exactly the fields you need, as JSONconst fields = await mcp.extract_with_llm({  content: doc.text,  prompt: "Extract fiscal year, revenue, operating margin, and headcount.",  schema: {    type: "object",    properties: {      fiscalYear: { type: "string" },      revenue: { type: "string" },      operatingMargin: { type: "string" },      headcount: { type: "number" },    },  },}); console.log(doc.metadata.pageCount);console.log(fields.data);

04工具链

使用的工具

5◆ credits
预估费用:每篇文档约 5 credits
  1. https://…
  2. 01process_document 2 credits
  3. 02extract_with_llm 3 credits
  4. JSON · markdown

05常见问题

常见问题

01如何自动从 PDF 中提取数据?

把 process_document 指向 PDF 的 URL 或文件,得到文本、章节和元数据,然后把这些文本连同描述所需字段的 JSON 结构发送给 extract_with_llm。你拿回的是带类型的 JSON,而不是一大段纯文本。

02PDF 必须放在网上吗?

不必。process_document 通过 sourceType 接受 URL 或本地文件路径——url、pdf_url、file 或 pdf_file——并提供 pageRange、maxPages 等选项,让你只处理关心的那几页。

03提取使用的是哪个模型?

extract_with_llm 默认使用本地 Ollama 模型,因此文档内容不会离开你的机器。想改用云端模型时,传入 provider openai 或 anthropic 以及对应的 API key 即可。

04文档提取要花多少 credits?

每篇文档大约 5 credits:process_document 占 2 credits,extract_with_llm 占 3 credits。免费的 1,000-credit 套餐大约可处理 200 篇文档,足够你在升级前用真实的档案库验证整条流水线。

开始锻造

准备好开始了吗?

每个新账户均可获得 1,000 个免费 credits,无需信用卡。