CrawlForge MCP
首页Playground应用场景集成价格文档博客
CrawlForge MCP v5.1.0:无需 API 也能搜索 Reddit
Product Updates
返回博客
产品更新

CrawlForge MCP v5.1.0:无需 API 也能搜索 Reddit

C
CrawlForge Team
工程团队
2026年8月24日
阅读时长 9 分钟

本页内容

快速解答

CrawlForge MCP v5.1.0 新增第 28 个工具 reddit_search:不触碰对抓取器全面封锁的 reddit.com,即可搜索 Reddit 帖子和评论,或读取完整评论串。它不走需要审批的官方 Reddit API,而是查询两个社区归档 — Arctic Shift(近实时、带嵌套评论树)和 PullPush(兼容 Pushshift 的全文搜索)— 因此完全不需要任何 Reddit 凭证。三种模式:posts、comments 和 thread。每次调用 2 credits。使用 npm install -g crawlforge-mcp-server@latest 升级。

问任何一位做抓取的开发者:2026 年最难搞的主流网站是哪个?Reddit 是个稳妥的答案。我们对此深有体会 — reddit.com 挡住了 CrawlForge 的每一条直接访问路径,从普通的 fetch 到完整的隐身浏览器。所以 CrawlForge MCP v5.1.0 不再硬撼这堵墙,而是绕了过去:新的 reddit_search 工具 — 我们的第 28 个工具 — 通过社区运营的归档搜索 Reddit 帖子和评论、读取完整讨论串,不需要 Reddit API key,不需要 OAuth 应用,不需要任何形式的凭证。

目录

  • 本次发布了什么
  • 为什么 reddit.com 无法被抓取
  • 认识 reddit_search
  • 两个归档:Arctic Shift 与 PullPush
  • 路由如何工作
  • 坦诚的注意事项
  • 通过 MCP 和 REST 使用
  • reddit-thread 模板还能用吗?
  • 自 v5.0.4 以来的其他更新
  • credits 成本
  • 如何升级

本次发布了什么

v5.1.0 是一个目标明确的次版本,只有一条头条:

  • reddit_search — 通过 Arctic Shift 和 PullPush 社区归档,搜索 Reddit 帖子(标题 + 正文 selftext)和评论,或读取一个帖子及其嵌套评论树。三种模式、可限定范围的过滤器、规范化的输出。每次调用 2 credits。
  • 工具总数从 27 个增加到 28 个,MCP 服务器卡片、工具说明和入门提示词都已认识这位新成员。
  • 新增 31 个单元测试(套件总数达 1,018 个),全部 28 个工具保持 100% MCP 协议合规,并通过 MCP stdio 实测返回了真实的 r/ClaudeAI 帖子。

为什么 reddit.com 无法被抓取

选择归档并非出于偏好 — 我们先量了量这堵墙。在动手构建这个工具之前,我们把每一条直接路径都对 reddit.com 实测了一遍:

  • 带完整浏览器 User-Agent 的 fetch_url:403
  • 针对 old.reddit.com 的 scrape:403
  • 使用 reddit-thread 模板的 scrape_template:403
  • 开到最高级别的 stealth_mode:403

这套封锁是分层的 — 先是数据中心 IP 信誉,然后是握手阶段的 TLS 指纹识别,最后是 JavaScript 质询 — 这正是服务器上连隐身浏览器都会失败的原因。而那扇"正规的门"也在收窄:2025 年 11 月,Reddit 依据其 Responsible Builder Policy 关闭了自助式 API 注册,新的官方 API 凭证申请要走审批流程,而不再是一张注册表单。大多数 Reddit MCP 服务器封装的正是那个官方 API,这让"拿到凭证"成了它们安装过程中最难的一步。

reddit_search 把这一切都绕开了。它从不向 reddit.com 发送任何一个请求。

认识 reddit_search

一个工具,三种模式:

  • posts(默认)— 对帖子标题和正文 selftext 做关键词搜索,可选限定到某个 subreddit 或作者。支持 "quoted phrases"(引号短语)、OR 和 -exclusion(排除词)。
  • comments — 对评论正文做全文搜索,这是官方 Reddit API 完全做不到的事。
  • thread — 给它一个帖子 ID,就能拿到该帖子及其嵌套评论树,对深到无法展开的分支带有 reddit 风格的折叠标记。

过滤器覆盖 subreddit、author、after/before 日期(ISO 8601、epoch 秒,或 "7d" 这样的偏移量)、limit(最多 100)和 sort。结果以规范化形式返回:完整的 reddit.com 永久链接、ISO 日期、得分、评论数,文本截断到 2,000 字符并带截断标记,这样一份 100 条结果的载荷对 LLM 上下文窗口依然友好。

从 MCP 客户端发起的典型调用长这样:

Json
{
  "tool": "reddit_search",
  "arguments": {
    "query": "best mcp servers",
    "subreddit": "ClaudeAI",
    "mode": "posts",
    "limit": 10
  }
}

从结果中取任意一个帖子的 id,以 link_id 配合 mode: "thread" 传回去,就能拿到整场讨论 — 随时可以交给 summarize_content 或 analyze_content,转成情感、主题和一份简报。

两个归档:Arctic Shift 与 PullPush

如果你还记得 Pushshift — 那个广受喜爱、却在 2023 年失去 API 访问权限的 Reddit 研究归档 — 这两个项目就是它的后继者,也正是 reddit_search 所查询的对象:

  • Arctic Shift 以近实时速度摄取 Reddit。实测期间它返回过一篇当天刚发布的帖子,并提供真正的嵌套评论树。它唯一有文档记载的限制:关键词搜索必须限定到某个 subreddit 或作者。
  • PullPush 兼容 Pushshift,能做 Arctic Shift 不做的事 — 对整个 Reddit 做全文搜索。代价是:其 2023 年之后的归档存在有文档记载的缺口,以及激进的速率限制。

两者都免费、都由社区运营、都不需要凭证。每个响应都附带来源说明,写明是哪个归档作答,下游消费者永远知道数据来自哪里。

路由如何工作

除非你主动想选,否则永远不用挑后端。在默认的 auto 模式下:

  • 限定范围的搜索(带 subreddit 或 author 过滤器)和讨论串读取走 Arctic Shift — 更新鲜的那个归档 — PullPush 仅在出错时作为回退。回退一旦触发,响应会在 fallback_used 字段中如实说明。
  • 面向整个 Reddit 的无限定关键词搜索走 PullPush,因为它是唯一支持这种搜索的归档。

底层管道消化了两个归档的各种怪癖:每个请求都携带能表明身份的 User-Agent(实测显示 Arctic Shift 会把匿名客户端限流进一个共享桶),瞬时限流响应会得到一次有界重试,PullPush 的限流消息原样透传,让你看到真实原因而不是一个笼统的错误。如果你的流水线需要不同的时间预算,环境变量 REDDIT_SEARCH_TIMEOUT_MS 可以覆盖 30 秒的单请求上限。

坦诚的注意事项

归档数据有它的毛边,我们宁愿把它们写进文档,也不想让你自己踩到:

  • 非常新的内容数值偏低。 归档在帖子出现的瞬间就会捕获它们,所以发布不足约 36 小时的内容,得分和评论数经常显示 0 或 1。内容本身在那里,只是票数统计还没跟上。
  • PullPush 在 2023 年之后有缺口。 一次无限定搜索返回空结果,并不能证明内容不存在。能限定就限定到某个 subreddit 或作者 — 这会把你路由到更完整的那个归档。
  • 已删除的内容可能仍留存在归档中。 这是归档运作方式的固有属性,而且是把双刃剑:这也正是研究者使用归档的原因。

通过 MCP 和 REST 使用

在 MCP 客户端 — Claude Desktop、Claude Code、Cursor — 里直接开口问就行:"搜索 r/webdev 最近一个月关于抓取基础设施的讨论,并总结主要的抱怨。" 客户端里的 agent 会自行选中 reddit_search、限定范围,并自己串联出总结。

通过 REST API,只需一个带认证的 POST:

Typescript
const response = await fetch('https://crawlforge.dev/api/v1/tools/reddit_search', {
  method: 'POST',
  headers: {
    'X-API-Key': process.env.CRAWLFORGE_API_KEY!,
    'Content-Type': 'application/json',
  },
  body: JSON.stringify({
    query: 'best mechanical keyboard',
    subreddit: 'MechanicalKeyboards',
    mode: 'posts',
    limit: 10,
  }),
});

const { data } = await response.json();
console.log(`${data.count} posts via ${data.source}`);

你也可以零配置地在 playground 里试用 — reddit_search 已与其余 27 个工具一起上线。

reddit-thread 模板还能用吗?

scrape_template 仍然自带 reddit-thread 模板,但它指向的是 reddit.com — 恰恰是本次版本绕开的那堵墙 — 所以它已无法可靠工作。scrape_template 文档现在把这一点写得明明白白,并把 Reddit 相关的工作指向 reddit_search。其余九个模板(Amazon、GitHub、YouTube、Hacker News 等)不受影响。

自 v5.0.4 以来的其他更新

如果你跳过了两个版本之间的那个补丁:v5.0.5 修正了 serp_rank 一直断言错误的两个数字 — DataForSEO 请求超时(现在默认 120 秒,可通过 DATAFORSEO_TIMEOUT_MS 调整,因为深度 100 的实时 Google 抓取动辄需要 30-60 秒以上),以及文档标注的上游成本(旧数字是深度 10 的价格,比深度 100 默认档实际计费低 10 倍)。它还修复了 Smithery 上的产品列表:工具表现在派生自实时注册表,而不是一张手写卡片。v5.0.x 加固周期的完整故事见 v5.0.4 实测文章。

credits 成本

reddit_search 每次调用 2 credits — 无论是搜索还是完整讨论串读取,同一个价。换算一下:Free 计划的 1,000 个初始 credits 足够 500 次 Reddit 搜索;一次搜索、加一次讨论串读取、再对结果跑一次 summarize_content,端到端 8 credits。一如既往,失败的请求不计费。

如何升级

Bash
npm install -g crawlforge-mcp-server@latest
crawlforge --version   # 5.1.0

或者,如果你的 MCP 客户端用 npx 启动服务器,下次重启时会自动拿到 5.1.0。所有既有工具都没有任何 schema、输出结构或 credits 成本变化 — 这是一次可以直接替换的升级。

准备好不用 API key 就挖掘 Reddit 讨论了吗? 免费开始,赠送 1,000 credits — 足够 500 次搜索 — 并阅读 reddit_search API 参考,了解每个参数和模式。

亲自试一试——无需注册

在 Playground 中运行 CrawlForge 的 28 个抓取与提取工具中的任意一个,然后免费开始,获取 1,000 credits。

1,000 免费 credits • 一次性 • 无需信用卡

标签

releasev5.1.0redditreddit_searchMCPweb scrapingchangelog

关于作者

C

CrawlForge Team

工程团队

我们正在打造功能最全面的 Web 抓取 MCP server。我们开发的工具帮助开发者为 AI 应用提取、分析和转换 Web 数据。

及时获取最新洞察

将教程、产品更新与 Web 抓取技巧直接发送到你的收件箱。

拒绝垃圾邮件,随时可取消订阅。

付诸实践

在任意 URL 上测试 CrawlForge 的工具——免费,无需注册。

本页内容

Frequently Asked Questions

CrawlForge 的 reddit_search 使用官方 Reddit API 吗?+

不使用。reddit_search 从不触碰 reddit.com 或官方的 Reddit Data API。它查询两个社区运营的归档 — 以近实时速度摄取 Reddit 的 Arctic Shift,以及兼容 Pushshift 的 PullPush — 因此不需要 Reddit API key、OAuth 应用,也不需要提交审批申请。这一点在 2025 年 11 月之后尤为重要:Reddit 从那时起关闭了自助式 API 注册,新的官方凭证改为审批制。

为什么我不能直接抓取 reddit.com?+

reddit.com 运行着一套分层封锁:数据中心 IP 信誉、握手阶段评估的 TLS 指纹识别,以及 JavaScript 质询。CrawlForge 做过实测验证 — 带浏览器 User-Agent 的普通 fetch、old.reddit.com、reddit-thread 抓取模板,甚至开到最高级别的 stealth_mode,全部返回 403。这种封锁位于基础设施层面,这正是 reddit_search 改读社区归档、而不与之硬碰的原因。

reddit_search 返回的 Reddit 数据有多新?+

Arctic Shift 以近实时速度摄取内容 — 实测期间它返回过一篇当天刚发布的帖子。一个注意事项:由于归档在帖子出现的瞬间就会捕获它们,发布不足约 36 小时的内容,其投票得分和评论数经常显示 0 或 1,尽管内容本身完全可搜索。每个响应都附带来源说明,写明是哪个归档作答及其新鲜度特征。

reddit_search 能搜索整个 Reddit,还是只能搜单个 subreddit?+

两者都可以。不加限定的关键词查询会通过 PullPush 搜索整个 Reddit,它支持全文搜索,但其 2023 年之后的归档存在有文档记载的缺口。把搜索限定到某个 subreddit 或作者,则会路由到更新鲜、更可靠的 Arctic Shift,并以 PullPush 作为自动回退。想要更完整的结果,在知道讨论所在位置时优先使用限定搜索。

reddit_search 费用多少?如何试用?+

reddit_search 每次调用 2 credits,无论是 posts 搜索、comments 搜索还是完整讨论串读取。失败的请求永不计费。Free 计划包含 1,000 个一次性 credits — 即 500 次搜索 — 该工具可通过 MCP、位于 /api/v1/tools/reddit_search 的 REST API,以及无需任何配置的浏览器 playground 使用。运行 npm install -g crawlforge-mcp-server@latest 升级到 v5.1.0。

reddit-thread 的 scrape_template 模板还能用吗?+

已不可靠。reddit-thread 模板直接指向 reddit.com,而后者现在在基础设施层面对抓取器返回 403 封锁,所以它和其他所有直接路径一样会失败。出于兼容性它仍在列表中,但文档现在把所有 Reddit 提取工作都引导至 reddit_search — 它读取社区归档,返回同样规范化的讨论串数据:帖子、嵌套评论、得分和永久链接。

相关文章

CrawlForge v5.0.4:实测全部 27 个 MCP 工具,修复 34 个缺陷
Product Updates

CrawlForge v5.0.4:实测全部 27 个 MCP 工具,修复 34 个缺陷

一天之内四个补丁版本:我们针对真实网站实测了全部 27 个 MCP 工具和每一个 CLI 子命令,并修复了发现的全部 34 个缺陷。

C
CrawlForge Team
|
8月20日
|
10 分钟
CrawlForge v5.0.0:安全性、正确性与 MCP 规范
Product Updates

CrawlForge v5.0.0:安全性、正确性与 MCP 规范

CrawlForge MCP v5.0.0 汇集了七个阶段的安全与正确性整改:npm audit 零漏洞、914 个测试,以及全面采用 MCP 规范。

C
CrawlForge Team
|
8月13日
|
12 分钟
CrawlForge v4.8.0:可自动激活的 Claude Skills
Product Updates

CrawlForge v4.8.0:可自动激活的 Claude Skills

CrawlForge MCP v4.8.0 为其 26 个工具带来 7 个可自动激活的 Claude Agent Skills、真正强制执行的 SSRF 防护、可用的 screenshot 截图、基于设计令牌的 branding 格式,以及内置的定时变更监控。

C
CrawlForge Team
|
6月28日
|
8 分钟

页脚

CrawlForge MCP

面向 AI Agent 的企业级网页抓取。28 个专业 MCP 工具,专为构建智能系统的现代开发者而设计。

产品

  • 功能
  • Playground
  • 价格
  • 应用场景
  • 集成
  • 替代方案
  • 更新日志

资源

  • 快速上手
  • API 参考
  • 模板
  • 指南
  • 博客
  • 术语表
  • 常见问题
  • 网站地图

开发者

  • MCP 协议
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

公司

  • 关于我们
  • 联系我们
  • 隐私政策
  • 服务条款
  • 可接受使用政策
  • Cookie

保持更新

获取新工具和新功能的最新动态。

基于 Next.js 和 MCP 协议构建

© 2025-2026 CrawlForge。保留所有权利。