面临的问题
RAG 系统的效果取决于你喂给它的文本。原始 HTML 中夹杂着导航、广告和标记,既推高 tokens 数量,又会污染向量嵌入;而且每个文档站点的版式都不一样,单一解析器永远无法通吃。
应用案例
01快速解答
用 map_site(2 credits)枚举整个文档站点,用 scrape(2 credits)返回已剥离导航与广告的 markdown,再用 summarize_content(4 credits)为每个分块附上一段简短摘要。每篇文档大约 6 credits,得到的 markdown 可直接送入你的分块器和向量嵌入模型。
02问题与方案
RAG 系统的效果取决于你喂给它的文本。原始 HTML 中夹杂着导航、广告和标记,既推高 tokens 数量,又会污染向量嵌入;而且每个文档站点的版式都不一样,单一解析器永远无法通吃。
CrawlForge 的 scrape 一次调用即可返回 markdown、元数据和链接,样板内容已由 Readability 剥离;summarize_content 则把长页面压缩成简短摘要,可作为分块的元数据存储,从而提升检索效果。
03代码
1// Turn a documentation site into RAG-ready markdown2const pages = await mcp.map_site({3 url: "https://docs.example.com",4 include_sitemap: true,5 max_urls: 200,6});7 8// One call returns markdown, metadata, and links per page9const doc = await mcp.scrape({10 url: pages.urls[0],11 formats: ["markdown", "metadata", "links"],12 onlyMainContent: true,13});14 15// Condense long pages into chunk-level summaries16const digest = await mcp.summarize_content({17 text: doc.markdown,18 options: { summaryLength: "short", summaryType: "abstractive" },19});20 21console.log(doc.markdown); // chunk + embed this22console.log(digest.summary); // store as chunk metadata04工具链
05常见问题
04
用 map_site 列出全部 URL,用 scrape 把每个页面返回为已剥离导航与广告的 markdown,再用 summarize_content 为每个分块附上一段简短摘要。这些 markdown 可直接送入你的分块器和向量嵌入模型。
原始 HTML 会把 tokens 浪费在标记、菜单和广告上,这些噪声最终都会进入你的向量嵌入。scrape 会先跑一遍 Readability,只返回主体内容,因此每个分块在语义上更干净,向量化的成本也更低。
可以。按计划定期重跑 map_site 和 scrape,并搭配 track_changes 找出真正发生变化的页面,这样你只需要对这些页面重新做向量嵌入,而不必重建整个索引。
每篇文档大约 6 credits——scrape 占 2 credits,summarize_content 占 4 credits——每个站点再加上一次 map_site 调用的 2 credits。一个 200 页的文档站点大约需要 1,200 credits,如果跳过摘要环节则可以减半。
06继续探索
通过结构化提取与多源研究,为你的 AI 智能体提供实时网页数据。用 31 个 MCP tools 构建可靠的数据管道,从 fetch_url 到 deep_research 一应俱全,让智能体始终基于最新信息工作。
采集并结构化大规模网页数据集,用于微调和训练 AI 模型。使用 crawl_deep 爬取整站、extract_content 提取干净正文,导出可直接用于 LLM 训练的高质量语料,全程按 credits 计费、成本可预测。