CrawlForge MCP
首页Playground应用场景集成价格文档博客
  1. 首页/
  2. 应用案例/
  3. RAG 知识库数据接入

RAG 知识库数据接入

把文档站点转换成干净、可直接分块的 markdown,用于检索增强生成(RAG)。先用 map_site 枚举全部页面,再用 scrape 抓取并剥离导航与广告等样板内容,最后用 summarize_content 生成摘要,在向量化之前就把语料整理干净。

快速解答

用 map_site(2 credits)枚举整个文档站点,用 scrape(2 credits)返回已剥离导航与广告的 markdown,再用 summarize_content(4 credits)为每个分块附上一段简短摘要。每篇文档大约 6 credits,得到的 markdown 可直接送入你的分块器和向量嵌入模型。

面临的问题

RAG 系统的效果取决于你喂给它的文本。原始 HTML 中夹杂着导航、广告和标记,既推高 tokens 数量,又会污染向量嵌入;而且每个文档站点的版式都不一样,单一解析器永远无法通吃。

解决方案

CrawlForge 的 scrape 一次调用即可返回 markdown、元数据和链接,样板内容已由 Readability 剥离;summarize_content 则把长页面压缩成简短摘要,可作为分块的元数据存储,从而提升检索效果。

代码示例

// Turn a documentation site into RAG-ready markdown
const pages = await mcp.map_site({
  url: "https://docs.example.com",
  include_sitemap: true,
  max_urls: 200,
});

// One call returns markdown, metadata, and links per page
const doc = await mcp.scrape({
  url: pages.urls[0],
  formats: ["markdown", "metadata", "links"],
  onlyMainContent: true,
});

// Condense long pages into chunk-level summaries
const digest = await mcp.summarize_content({
  text: doc.markdown,
  options: { summaryLength: "short", summaryType: "abstractive" },
});

console.log(doc.markdown);       // chunk + embed this
console.log(digest.summary);     // store as chunk metadata

使用的工具

map_site2 credits
scrape2 credits
summarize_content4 credits

预估费用:每篇文档约 6 credits

常见问题

如何为 RAG 流水线抓取一个网站?+

用 map_site 列出全部 URL,用 scrape 把每个页面返回为已剥离导航与广告的 markdown,再用 summarize_content 为每个分块附上一段简短摘要。这些 markdown 可直接送入你的分块器和向量嵌入模型。

做 RAG 时,为什么 markdown 比原始 HTML 更好?+

原始 HTML 会把 tokens 浪费在标记、菜单和广告上,这些噪声最终都会进入你的向量嵌入。scrape 会先跑一遍 Readability,只返回主体内容,因此每个分块在语义上更干净,向量化的成本也更低。

我能让知识库保持最新吗?+

可以。按计划定期重跑 map_site 和 scrape,并搭配 track_changes 找出真正发生变化的页面,这样你只需要对这些页面重新做向量嵌入,而不必重建整个索引。

接入一个文档站点要花多少 credits?+

每篇文档大约 6 credits——scrape 占 2 credits,summarize_content 占 4 credits——每个站点再加上一次 map_site 调用的 2 credits。一个 200 页的文档站点大约需要 1,200 credits,如果跳过摘要环节则可以减半。

准备好开始了吗?

每个新账户均可获得 1,000 个免费 credits,无需信用卡。

免费领取 1,000 个 credits 开始使用

相关应用案例

AI 智能体数据管道
通过结构化提取与多源研究,为你的 AI 智能体提供实时网页数据。用 28 个 MCP tools 构建可靠的数据管道,从 fetch_url 到 deep_research 一应俱全,让智能体始终基于最新信息工作。
deep_research (10 cr)extract_content (2 cr)
AI 训练数据采集
采集并结构化大规模网页数据集,用于微调和训练 AI 模型。使用 crawl_deep 爬取整站、extract_content 提取干净正文,导出可直接用于 LLM 训练的高质量语料,全程按 credits 计费、成本可预测。
batch_scrape (5 cr)extract_content (2 cr)

页脚

CrawlForge MCP

面向 AI Agent 的企业级网页抓取。28 个专业 MCP 工具,专为构建智能系统的现代开发者而设计。

产品

  • 功能
  • Playground
  • 价格
  • 应用场景
  • 集成
  • 替代方案
  • 更新日志

资源

  • 快速上手
  • API 参考
  • 模板
  • 指南
  • 博客
  • 术语表
  • 常见问题
  • 网站地图

开发者

  • MCP 协议
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

公司

  • 关于我们
  • 联系我们
  • 隐私政策
  • 服务条款
  • 可接受使用政策
  • Cookie

保持更新

获取新工具和新功能的最新动态。

基于 Next.js 和 MCP 协议构建

© 2025-2026 CrawlForge。保留所有权利。