PDF 与文档数据提取
无需自己编写解析器,就能从 PDF、年报和监管备案文件中提取结构化字段。process_document 负责读取文件并输出文本、章节与元数据,extract_with_llm 再按你定义的结构返回带类型的 JSON,默认走本地 Ollama,文档内容不出本机。
快速解答
把 process_document(2 credits)指向一个 PDF URL 或本地文件,即可得到文本、章节和元数据,再把这些文本连同一份 JSON 结构定义交给 extract_with_llm(3 credits),就能拿回带类型的字段。每篇文档大约 5 credits,而且提取默认使用本地 Ollama 模型,内容始终留在你的机器上。
面临的问题
关键数字往往藏在 PDF 里:年报、价目表、监管备案文件、研究论文。手工抄录根本无法规模化,而通用 PDF 库只会返回一大段无法查询的纯文本。
解决方案
CrawlForge 的 process_document 可从 PDF URL 或本地文件中提取文本、章节和元数据,extract_with_llm 再把这些文本转成你指定的 JSON 结构——默认运行在本地 Ollama 上,文档内容永远不会离开你的机器。
代码示例
// Pull structured fields out of a PDF report
const doc = await mcp.process_document({
source: "https://example.com/2026-annual-report.pdf",
sourceType: "pdf_url",
options: { extractText: true, extractMetadata: true },
});
// Ask for exactly the fields you need, as JSON
const fields = await mcp.extract_with_llm({
content: doc.text,
prompt: "Extract fiscal year, revenue, operating margin, and headcount.",
schema: {
type: "object",
properties: {
fiscalYear: { type: "string" },
revenue: { type: "string" },
operatingMargin: { type: "string" },
headcount: { type: "number" },
},
},
});
console.log(doc.metadata.pageCount);
console.log(fields.data);使用的工具
预估费用:每篇文档约 5 credits
常见问题
如何自动从 PDF 中提取数据?
把 process_document 指向 PDF 的 URL 或文件,得到文本、章节和元数据,然后把这些文本连同描述所需字段的 JSON 结构发送给 extract_with_llm。你拿回的是带类型的 JSON,而不是一大段纯文本。
PDF 必须放在网上吗?
不必。process_document 通过 sourceType 接受 URL 或本地文件路径——url、pdf_url、file 或 pdf_file——并提供 pageRange、maxPages 等选项,让你只处理关心的那几页。
提取使用的是哪个模型?
extract_with_llm 默认使用本地 Ollama 模型,因此文档内容不会离开你的机器。想改用云端模型时,传入 provider openai 或 anthropic 以及对应的 API key 即可。
文档提取要花多少 credits?
每篇文档大约 5 credits:process_document 占 2 credits,extract_with_llm 占 3 credits。免费的 1,000-credit 套餐大约可处理 200 篇文档,足够你在升级前用真实的档案库验证整条流水线。