CrawlForge MCP
首页Playground应用场景集成价格文档博客

更新日志

追踪 CrawlForge 的每一次更新

修复v5.6.02026年9月1日
一轮实站回归测试找出的全部缺陷

5.6 系列:对全部 29 个 tools 和 18 个模板做一轮实站回归所发现的全部问题。最主要的修复是行内链接在使用原生嵌套 CSS 的页面上消失——输出看起来像一个完整页面,而不像一次失败。

  • scrape 在使用原生 CSS 嵌套的页面上保留每一个行内链接——此前嵌套规则被误读为全局规则,曾删掉某篇文章 68 个链接中的 56 个
  • batch_scrape、crawl_deep、generate_llms_txt 和 track_changes 会解码非 UTF-8 页面,ISO-8859-1 页面不再出现乱码
  • producthunt-launch 模板重新能读取 Product Hunt 改版后的页面;提取不到任何内容的模板现在会明确说明,而不是返回一条字段全为 null 的记录
改进v5.5.92026年8月31日
提取准确性与安全加固

5.5 系列:全站范围的 Reddit 评论搜索、真正会执行搜索的 localization,以及一长串准确性修复——包括那些在文档页面上悄悄消失的代码示例。

  • reddit_search 可搜索全站评论,localize_search 也会真正执行搜索
  • LLM 返回的每个数字都会与页面源码核对,找不到就返回 null 并附上原因
  • 浏览器与 webhook 路径全面加上 SSRF 防护,页面文本在进入模型前先做隔离
新功能v5.4.32026年8月30日
extract_embedded_state:第 29 个工具

第二层提取:读取页面自带的 JavaScript 状态,而不是渲染后的 HTML。一次请求、取值精确、链路上没有 LLM。同一版本还修复了在真实站点上测试全部 29 个工具时发现的九个缺陷。

  • 新增 extract_embedded_state(2 credits):读取 __NEXT_DATA__、React Server Component 负载、Nuxt 和 Apollo 状态
  • extract_metadata 新增 json_ld_types 过滤器,并且能匹配子类型
  • track_changes 中五个一直只会报错的操作现在可以用了
改进v5.3.12026年8月28日
统一的爬虫身份,每条路径都检查 robots.txt

合规与身份相关的工作:每个会发起请求的工具都检查 robots.txt,被拒绝的请求不收费,出站请求带签名,站点可以验证这次抓取确实来自 CrawlForge。

  • 每个会发起请求的工具都检查 robots.txt,包括此前绕过它的两条 stealth 路径
  • 出站请求按 RFC 9421(Web Bot Auth)签名,并公开密钥目录
  • 因合规而被拒绝是免费的,不再扣除 credits
新功能v5.2.92026年8月26日
Shopify 模板与共享提取器包

shopify-product 模板直接读取店铺自己的 JSON,而不是解析渲染后的页面;支持远程 Ollama;模板提取器拆分为独立的 npm 包,让 CrawlForge 的两个接口共用同一份实现。

  • shopify-product 模板:精确价格、对比价和各变体库存,完全不解析 HTML
  • track_changes 按真实的价格变动评级,而不是按它在页面上占多大篇幅
  • Ollama 正式注册为提供方,并自动选择已安装的最佳模型
新功能v5.1.02026年8月24日
reddit_search:第 28 个工具

尽管 reddit.com 封锁了 CrawlForge 所有直接访问方式,这个工具依然能搜索 Reddit:它从不访问 reddit.com,而是查询社区维护的存档。使用免费,无需凭据。

  • reddit_search(2 credits):按关键词搜索帖子和评论,也可获取完整的评论树
  • 由 Arctic Shift 和 PullPush 存档支撑,其中一方过载时会有一次有限重试
  • 结果统一为真实 permalink 和 ISO 日期,并附上存档新鲜度的说明
新功能v5.0.52026年8月23日
v5.0:采纳 MCP 规范与安全大修

这个大版本包含:SSRF、OAuth、密钥和计费加固,52 项正确性修复(含重写的 crawl_deep),重建的 streamable-HTTP 传输,以及客户端已经开始期待的 MCP 规范特性。

  • 长耗时工具支持结构化输出(outputSchema)和异步任务
  • CRAWLFORGE_TOOLS 和 CRAWLFORGE_TOOL_GROUPS 可只暴露部分工具,减少上下文占用
  • npm audit 漏洞归零,Node 最低版本提升到 20.16
改进v4.10.02026年7月13日
引导客户端优先使用 CrawlForge 处理网页任务

服务器现在会发送 MCP instructions,告诉任何客户端在网页任务上优先使用 CrawlForge 工具,而不是它自带的网页搜索。这是建议而非强制:MCP server 无法关闭客户端自带的工具。

  • 服务器级的 MCP instructions 会在下次启动时到达每个客户端,无需重新安装
  • 在模型真正会读到的 tools/list 中,强化了四个工具的描述
  • serp_rank 会连同目标域名的排名一起返回完整的自然搜索前十名
新功能v4.9.02026年7月1日
serp_rank:真实的 Google 自然排名

第 27 个工具。它给出一个域名在某个关键词的 Google 自然结果中的真实排名——这是搜索 API 给不了的位置——由 DataForSEO 提供,费用记在你自己的账户上。

  • serp_rank(5 credits)返回最佳排名、上榜 URL,以及它占据的全部位置
  • 从不编造排名:未配置 DataForSEO 时会返回 configured:false
  • 计费更严谨:零成本调用不产生用量记录,出错按半价计费
新功能v4.8.12026年6月28日
Agent Skills、真正生效的 SSRF 防护与定时监控

会自动激活的 Claude Agent Skills,两项此前只是写着、实际并未生效的安全控制真正落地,以及真的能定时执行的变更监控。

  • 七个 Claude Agent Skills,描述写得足以让它们自动激活
  • SSRF 防护在真实抓取路径上生效,首次请求和每一次重定向都会校验
  • track_changes 的定时监控会持久化,重启后自动恢复基线

页脚

CrawlForge MCP

面向 AI Agent 的企业级网页抓取。29 个专业 MCP 工具,专为构建智能系统的现代开发者而设计。

产品

  • 功能
  • Playground
  • 价格
  • 应用场景
  • 集成
  • 替代方案
  • 更新日志

资源

  • 快速上手
  • API 参考
  • 模板
  • 指南
  • 博客
  • 术语表
  • 常见问题
  • 网站地图

开发者

  • MCP 协议
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

公司

  • 关于我们
  • 联系我们
  • 隐私政策
  • 服务条款
  • 可接受使用政策
  • Cookie

保持更新

获取新工具和新功能的最新动态。

基于 Next.js 和 MCP 协议构建

© 2025-2026 CrawlForge。保留所有权利。