面临的问题
关键数字往往藏在 PDF 里:年报、价目表、监管备案文件、研究论文。手工抄录根本无法规模化,而通用 PDF 库只会返回一大段无法查询的纯文本。
应用案例
01快速解答
把 process_document(2 credits)指向一个 PDF URL 或本地文件,即可得到文本、章节和元数据,再把这些文本连同一份 JSON 结构定义交给 extract_with_llm(3 credits),就能拿回带类型的字段。每篇文档大约 5 credits,而且提取默认使用本地 Ollama 模型,内容始终留在你的机器上。
02问题与方案
关键数字往往藏在 PDF 里:年报、价目表、监管备案文件、研究论文。手工抄录根本无法规模化,而通用 PDF 库只会返回一大段无法查询的纯文本。
CrawlForge 的 process_document 可从 PDF URL 或本地文件中提取文本、章节和元数据,extract_with_llm 再把这些文本转成你指定的 JSON 结构——默认运行在本地 Ollama 上,文档内容永远不会离开你的机器。
03代码
1// Pull structured fields out of a PDF report2const doc = await mcp.process_document({3 source: "https://example.com/2026-annual-report.pdf",4 sourceType: "pdf_url",5 options: { extractText: true, extractMetadata: true },6});7 8// Ask for exactly the fields you need, as JSON9const fields = await mcp.extract_with_llm({10 content: doc.text,11 prompt: "Extract fiscal year, revenue, operating margin, and headcount.",12 schema: {13 type: "object",14 properties: {15 fiscalYear: { type: "string" },16 revenue: { type: "string" },17 operatingMargin: { type: "string" },18 headcount: { type: "number" },19 },20 },21});22 23console.log(doc.metadata.pageCount);24console.log(fields.data);04工具链
05常见问题
04
把 process_document 指向 PDF 的 URL 或文件,得到文本、章节和元数据,然后把这些文本连同描述所需字段的 JSON 结构发送给 extract_with_llm。你拿回的是带类型的 JSON,而不是一大段纯文本。
不必。process_document 通过 sourceType 接受 URL 或本地文件路径——url、pdf_url、file 或 pdf_file——并提供 pageRange、maxPages 等选项,让你只处理关心的那几页。
extract_with_llm 默认使用本地 Ollama 模型,因此文档内容不会离开你的机器。想改用云端模型时,传入 provider openai 或 anthropic 以及对应的 API key 即可。
每篇文档大约 5 credits:process_document 占 2 credits,extract_with_llm 占 3 credits。免费的 1,000-credit 套餐大约可处理 200 篇文档,足够你在升级前用真实的档案库验证整条流水线。
06继续探索
把文档站点转换成干净、可直接分块的 markdown,用于检索增强生成(RAG)。先用 map_site 枚举全部页面,再用 scrape 抓取并剥离导航与广告等样板内容,最后用 summarize_content 生成摘要,在向量化之前就把语料整理干净。
构建能检索网页、综合信息并输出最新研究结论的 AI 智能体。每条结论均标注来源,确保答案始终可核查。