CrawlForge MCP
政策

抓取器 运行规则

CrawlForge 代你抓取页面时的行为:八条基本规则、每条规则的理由,以及它们如何在代码中落实。

可接受使用有两份文档 本页说明 CrawlForge 自身抓取时的行为。关于你使用 API 时可以做什么、不可以做什么——禁止的行为、套餐速率限制、违规处理与举报——请参阅可接受使用政策。

八条基本规则

这些规则约束的是我们构建什么,而不只是我们要求客户做什么。破坏其中任何一条的功能都不会发布,无论需求有多大。

G1 — 只抓取公开页面
只抓取无需登录的公开页面。不以凭据方式访问明令禁止此类访问的平台。
G2 — 不绕过访问控制
不破解 CAPTCHA,不伪造挑战令牌,不绕过付费墙。
G3 — 有 API 就不抓页面
只要存在公开文档的 API,就优先使用 API 而非抓取。
G4 — 诚实标识身份
默认使用统一的 User-Agent,包含真实产品名与联系 URL。
G5 — 默认遵守 robots.txt
所有抓取工具默认遵守。任何例外都必须显式声明、按请求生效,并记录在案。
G6 — 温和的请求速率
遵守目标主机自身的 Crawl-delay 与 Retry-After,其下还有保守的默认值。
G7 — 退出请求永久有效
站点所有者的退出与下架请求在平台层生效,任何参数都无法覆盖。
G8 — 不构建个人画像
不收集超出来源公开范围的个人数据,也不把零散信息拼成个人画像。

G1 — 只抓取无需登录的公开页面

不以凭据方式访问其条款禁止此类访问的平台。我们不接收你在目标站点的凭据,不在第三方平台持有账号,也没有任何工具是为代你登录而构建的。

理由:规避身份验证是一条分界线:越过它,抓取就不再是合同问题,而变成《计算机欺诈与滥用法》(CFAA)问题。违反条款是双方之间的纠纷;未经授权的访问则是另一类风险,我们不会为客户承担。

如何落实:没有任何工具把目标站点的凭据作为参数,CrawlForge 也不存储任何凭据。stealth_mode 打开的浏览器上下文是临时的——执行后端会回收它们——因此不存在可复用的持久登录会话。scrape_with_actions 只执行你提供的动作列表:用它登录条款禁止自动化访问的平台,属于违反可接受使用政策,足以导致账号被停用。

G2 — 不破解 CAPTCHA、不伪造令牌、不绕过付费墙

我们不接入 CAPTCHA 破解服务,不伪造或重放反机器人挑战令牌,也不构建付费墙绕过手段。

理由:这些都是技术性访问控制。攻破其中任何一个都不是兼容性修复,而是决定推翻站点所有者已经给出的答复。这不是我们会发布的功能;一旦发布,本页其余每一条规则都会失去可信度。

如何落实:API 与 MCP 服务器都不依赖任何 CAPTCHA 破解服务商。stealth_mode 的作用是让真实浏览器表现得像真实浏览器——真实的请求头、视口与时序——以应对普通 HTTP 请求会失败的站点。它不解挑战:页面返回挑战时,挑战会原样返回给你。

G3 — 优先使用有文档的 API

只要目标站点发布了 API,覆盖该站点的工具就使用该 API。

理由:按条数计算,API 更便宜;结果是精确的而非尽力而为的;不会因页面结构变动而失效;而且天然获得许可——发布方自己决定了对外暴露什么。对提供 API 的来源做抓取,首先是更差的工程选择,其次才是伦理问题。

如何落实:reddit_search 通过公开的 JSON 数据 API 读取 Reddit 内容,而不是抓取封禁自动化访问的 reddit.com。search_web 与 serp_rank 调用搜索 API,而不是抓取结果页。新增覆盖一律先考虑 API:只有在没有 API 覆盖这些数据时,才会写抓取路径。

G4 — 诚实标识身份

每个对外请求都携带同一个诚实的 User-Agent:真实产品名、版本号和一个联系 URL。

理由:想屏蔽我们的站点必须能够做到。轮换或伪装身份会剥夺站点所有者对我们做出判断的能力,也让 G5 与 G7 无法从外部验证——一份无法辨认的屏蔽清单不算屏蔽清单。

如何落实:所有抓取工具都经由同一个共用的抓取辅助函数,它发送下面这个身份标识——产品名、版本号与联系 URL。如果你与目标站点另有协议,可以按请求传入 userAgent 覆盖:那是你对该站点做出的显式声明,而不是产品默认行为。

你不必仅凭请求头就相信:验证 CrawlForge 抓取器说明了站点所有者如何用我们公开的签名密钥核验一次请求、如何用一条 robots.txt 规则屏蔽我们,以及申请永久排除时该写信到哪里。

CrawlForge 如何标识自己

REST API 发送的 User-Agent。MCP 服务器以相同格式发送它自己的软件包版本——两者的版本段不同,CrawlForge 产品令牌相同。

request headersBash
User-Agent: CrawlForge/1.0.0 (+https://crawlforge.dev)

G5 — 默认遵守 robots.txt

每个抓取工具在抓取前都会检查 robots.txt。例外按请求生效,会在响应中返回警告,并记录到提出该请求的 API key 上。

理由:默认值必须是遵守,因为绝大多数流量跑在默认值上。让例外显式且留痕,就把它变成你针对自己了解的目标所做的、有据可查的决定,而不是我们替你在整个产品上悄悄做出的选择。

如何落实:每个来源的规则只获取一次并缓存,然后与我们的产品令牌比对。缺失、无法访问、体积过大或状态码非 200 的 robots.txt 一律视为没有限制——无法提供该文件的站点并未表达任何限制。被禁止的 URL 会被跳过;如果入口地址本身被禁止,请求会在抓取任何内容之前失败,因此被拦截的抓取不消耗 credits。

如何在你的站点上屏蔽 CrawlForge

把这段内容加入你的 robots.txt。组名就是 CrawlForge 产品令牌,REST API 与 MCP 服务器都按它匹配——因此这一条规则即可屏蔽两个接口上的所有 CrawlForge 工具。如果你此前已屏蔽已停用的 CrawlForge-Bot 令牌,该屏蔽依然有效——两个名称中任何一个的 disallow 都会被遵守,你无需做任何改动。

robots.txtBash
User-agent: CrawlForge
Disallow: /

G6 — 默认保持温和的请求速率

并发数与间隔默认取保守值,而目标主机自身的控速信号——robots.txt 中的 Crawl-delay,以及 429 或 503 响应中的 Retry-After——在两个接口上都会被遵守。

理由:我们施加的负载由别人买单——带宽、源站 CPU,以及当班值守者的传呼。忽略刚刚收到的 Retry-After 的抓取器并不算快,只是在同样的吞吐量下更无礼。

`Retry-After`:我们会在每个响应中记录它;只要退避窗口仍然开启,对该主机的后续请求都会被拒绝——错误码 HOST_BACKOFF,HTTP 429,并给出主机名与剩余秒数。这不会扣除你的 credits,respect_robots: false 也触及不到它:该参数是关于 robots.txt 的声明,而 429 是主机对我们的直接答复,调用方无权代表主机推翻它。规范允许的两种时间格式都被接受,等待时长上限为五分钟,以免一个错误的响应头长时间卡住某个主机。

这是两个接口行为唯一不同之处,原因在于运行环境不同,而非政策不同。MCP 服务器会把该时长等满再继续。REST API 则立即拒绝:在有 30 秒上限的无服务器函数中,为两分钟的等待而阻塞会白白耗尽这次请求,最后什么也拿不到——等了、被中止、页面仍未抓取——所以它选择立刻把主机的答复交给你。

`Crawl-delay`:会抓取多个页面的五个工具——crawl_deep、map_site、generate_llms_txt、batch_scrape 和 deep_research——会按目标主机 robots.txt 的要求为发往该主机的请求留出间隔。间隔按主机独立计算,因此某个慢站点不会拖累与它无关的站点。在 batch_scrape 中,声明了间隔的主机实际上会被串行处理,而其他主机仍保持完整并发——这正是该指令的用意;如果你提交了五十个来自同一个有间隔要求的域名的 URL,这一点值得留意。当所需间隔无法放入该路由的时间预算时,该 URL 会被跳过而不是一直等待:结果标记为 skipped 并附上原因,notes 中会有一行汇总,并且不会扣费。只抓取一次的工具没有需要留出的间隔。

crawl_deep 另有自己的 crawl_delay 参数。那是你要求的暂停,与站点要求的间隔是两回事;两者同时存在时会合并为一次等待,取其中较长者。你的套餐速率限制(每秒 1 到 10 个请求)是在这一切之上另一道独立上限,参见常见问题。

G7 — 退出与下架请求永久有效

要求不被抓取的站点所有者会被加入平台级屏蔽清单。任何客户参数都无法覆盖它。

理由:任何客户都能关掉的屏蔽清单不算屏蔽清单。如果退出设置存在于单次请求的选项里,是否遵守就取决于每位客户的选择,也就意味着它根本立不住。它必须位于请求层之下。

如何落实:屏蔽清单在请求发出前检查,对所有工具、所有 API key 和所有套餐生效。没有任何参数可以关闭它,robots.txt 例外也触及不到它。要申请退出或提交下架请求,请发送邮件至 support@crawlforge.dev,并说明域名与涉及的页面。

G8 — 不构建个人画像,不采集非公开个人数据

工具只返回来源公开发布的内容。我们不构建把零散的公开信息拼成某个人画像的功能。

理由:无论 HTML 来自哪里,GDPR 与 CCPA 都适用于个人数据,而「它本来就是公开的」并不构成合法性基础。在 GDPR 下,聚合本身就是一种需要正当理由的处理目的:在某处公开关于自己的一条信息,不等于同意被汇编。

如何落实:没有任何工具跨来源关联身份,我们也不保留以人为中心的索引。当提取模式采集到个人数据时,那是你的模式、你的控制者责任——我们保留的是使用日志,记录的是请求本身而非提取到的内容。为你提取的个人数据确立合法性基础,是你在可接受使用政策下的义务。

明确不在范围内

之所以列出这些,是因为常有人提出。它们都不在路线图上。

  • 对 LinkedIn、Indeed 或任何条款禁止此类访问的平台进行登录态抓取(G1)。
  • 抓取需要登录的 Workday 或其他需要登录的招聘系统租户(G1)。
  • CAPTCHA 破解服务(G2)。
  • 伪造挑战令牌,以及绕过 DataDome、PerimeterX 或 Kasada(G2)。
  • 默认忽略 robots.txt(G5)。
  • 规避专门针对 CrawlForge 的封禁——轮换身份,或换一个 User-Agent 重新进入(G4、G7)。
  • 构建个人画像(G8)。

提出这些需求并不说明产品有缺口,而说明规则正在生效。

退出与下架

如果你运营一个站点且不希望 CrawlForge 抓取它,有两条途径。robots.txt 规则在所有工具上默认被遵守,下一次抓取时即生效。平台级退出则是永久的,任何客户都无法覆盖:请发送邮件至 support@crawlforge.dev,并说明域名与涉及的页面。

相关政策
面向客户的条款,以及其余法律文档。
可接受使用政策
你使用 API 时可以做什么、不可以做什么:禁止的行为、速率限制、违规处理与举报。
服务条款
你与 CrawlForge 之间的合同。
隐私政策
我们收集你的哪些数据,以及保留多久。

页脚

CrawlForge MCP

面向 AI Agent 的企业级网页抓取。29 个专业 MCP 工具,专为构建智能系统的现代开发者而设计。

产品

  • 功能
  • Playground
  • 价格
  • 应用场景
  • 集成
  • 替代方案
  • 更新日志

资源

  • 快速上手
  • API 参考
  • 模板
  • 指南
  • 博客
  • 术语表
  • 常见问题
  • 网站地图

开发者

  • MCP 协议
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

公司

  • 关于我们
  • 联系我们
  • 隐私政策
  • 服务条款
  • 可接受使用政策
  • Cookie

保持更新

获取新工具和新功能的最新动态。

基于 Next.js 和 MCP 协议构建

© 2025-2026 CrawlForge。保留所有权利。