更新日志
追踪 CrawlForge 的每一次更新
5.6 系列:对全部 29 个 tools 和 18 个模板做一轮实站回归所发现的全部问题。最主要的修复是行内链接在使用原生嵌套 CSS 的页面上消失——输出看起来像一个完整页面,而不像一次失败。
- scrape 在使用原生 CSS 嵌套的页面上保留每一个行内链接——此前嵌套规则被误读为全局规则,曾删掉某篇文章 68 个链接中的 56 个
- batch_scrape、crawl_deep、generate_llms_txt 和 track_changes 会解码非 UTF-8 页面,ISO-8859-1 页面不再出现乱码
- producthunt-launch 模板重新能读取 Product Hunt 改版后的页面;提取不到任何内容的模板现在会明确说明,而不是返回一条字段全为 null 的记录
5.5 系列:全站范围的 Reddit 评论搜索、真正会执行搜索的 localization,以及一长串准确性修复——包括那些在文档页面上悄悄消失的代码示例。
- reddit_search 可搜索全站评论,localize_search 也会真正执行搜索
- LLM 返回的每个数字都会与页面源码核对,找不到就返回 null 并附上原因
- 浏览器与 webhook 路径全面加上 SSRF 防护,页面文本在进入模型前先做隔离
第二层提取:读取页面自带的 JavaScript 状态,而不是渲染后的 HTML。一次请求、取值精确、链路上没有 LLM。同一版本还修复了在真实站点上测试全部 29 个工具时发现的九个缺陷。
- 新增 extract_embedded_state(2 credits):读取 __NEXT_DATA__、React Server Component 负载、Nuxt 和 Apollo 状态
- extract_metadata 新增 json_ld_types 过滤器,并且能匹配子类型
- track_changes 中五个一直只会报错的操作现在可以用了
合规与身份相关的工作:每个会发起请求的工具都检查 robots.txt,被拒绝的请求不收费,出站请求带签名,站点可以验证这次抓取确实来自 CrawlForge。
- 每个会发起请求的工具都检查 robots.txt,包括此前绕过它的两条 stealth 路径
- 出站请求按 RFC 9421(Web Bot Auth)签名,并公开密钥目录
- 因合规而被拒绝是免费的,不再扣除 credits
shopify-product 模板直接读取店铺自己的 JSON,而不是解析渲染后的页面;支持远程 Ollama;模板提取器拆分为独立的 npm 包,让 CrawlForge 的两个接口共用同一份实现。
- shopify-product 模板:精确价格、对比价和各变体库存,完全不解析 HTML
- track_changes 按真实的价格变动评级,而不是按它在页面上占多大篇幅
- Ollama 正式注册为提供方,并自动选择已安装的最佳模型
尽管 reddit.com 封锁了 CrawlForge 所有直接访问方式,这个工具依然能搜索 Reddit:它从不访问 reddit.com,而是查询社区维护的存档。使用免费,无需凭据。
- reddit_search(2 credits):按关键词搜索帖子和评论,也可获取完整的评论树
- 由 Arctic Shift 和 PullPush 存档支撑,其中一方过载时会有一次有限重试
- 结果统一为真实 permalink 和 ISO 日期,并附上存档新鲜度的说明
这个大版本包含:SSRF、OAuth、密钥和计费加固,52 项正确性修复(含重写的 crawl_deep),重建的 streamable-HTTP 传输,以及客户端已经开始期待的 MCP 规范特性。
- 长耗时工具支持结构化输出(outputSchema)和异步任务
- CRAWLFORGE_TOOLS 和 CRAWLFORGE_TOOL_GROUPS 可只暴露部分工具,减少上下文占用
- npm audit 漏洞归零,Node 最低版本提升到 20.16
服务器现在会发送 MCP instructions,告诉任何客户端在网页任务上优先使用 CrawlForge 工具,而不是它自带的网页搜索。这是建议而非强制:MCP server 无法关闭客户端自带的工具。
- 服务器级的 MCP instructions 会在下次启动时到达每个客户端,无需重新安装
- 在模型真正会读到的 tools/list 中,强化了四个工具的描述
- serp_rank 会连同目标域名的排名一起返回完整的自然搜索前十名
第 27 个工具。它给出一个域名在某个关键词的 Google 自然结果中的真实排名——这是搜索 API 给不了的位置——由 DataForSEO 提供,费用记在你自己的账户上。
- serp_rank(5 credits)返回最佳排名、上榜 URL,以及它占据的全部位置
- 从不编造排名:未配置 DataForSEO 时会返回 configured:false
- 计费更严谨:零成本调用不产生用量记录,出错按半价计费
会自动激活的 Claude Agent Skills,两项此前只是写着、实际并未生效的安全控制真正落地,以及真的能定时执行的变更监控。
- 七个 Claude Agent Skills,描述写得足以让它们自动激活
- SSRF 防护在真实抓取路径上生效,首次请求和每一次重定向都会校验
- track_changes 的定时监控会持久化,重启后自动恢复基线