CrawlForge MCP
首页Playground应用场景集成价格文档博客
如何不用 API 抓取 Reddit(2026 版)
Tutorials
返回博客
教程

如何不用 API 抓取 Reddit(2026 版)

C
CrawlForge Team
工程团队
2026年8月24日
阅读时长 6 分钟

本页内容

快速解答

2026 年你无法直接抓取 reddit.com — 无论是普通 fetch、old.reddit.com、.json URL 技巧,还是高级隐身浏览器,网站一律返回 403。可行的路线是社区归档:Arctic Shift(近实时、带嵌套讨论串)和 PullPush(全文搜索)。CrawlForge reddit_search 把两者封装成一次调用,无需任何 Reddit 凭证 — 搜索帖子、搜索评论或读取完整讨论串,每次 2 credits — 支持 MCP、REST 和浏览器 playground。

每一篇把 BeautifulSoup 指向 reddit.com 的教程,如今都成了历史文献。如果你想在 2026 年不用 API 抓取 Reddit,首先要明白:战场已经转移 — 问题不再是如何突破 Reddit 的防线,而是数据还存在于哪里。本指南两方面都讲:直接路径为何失败,以及可行的归档路线的分步操作。

为什么直接抓取 reddit.com 会失败

在构建 reddit_search 之前,我们把每一条直接访问路径都对 reddit.com 实测了一遍:

  • 带浏览器 User-Agent 的普通 fetch:403
  • old.reddit.com(传统意义上"好抓"的目标):403
  • 在任意 Reddit URL 后面加 .json 的经典技巧:撞死在同一堵墙上
  • 专门构建的 reddit-thread 抓取模板:403
  • 开启高级指纹规避的 stealth_mode:403

这套封锁是分层的 — 数据中心 IP 信誉、握手阶段评估的 TLS 指纹识别,以及 JavaScript 质询 — 这意味着在你的解析代码运行之前,你的 HTTP 客户端就已经被击败了。任何选择器、请求头或重试策略都修不好一个基础设施层面的 403。

可行的路线:社区归档

Reddit 的内容正被两个社区运营的项目持续归档,它们都是 Pushshift 的后继者:Arctic Shift(近实时摄取、真正的嵌套评论树、搜索需限定到 subreddit 或作者)和 PullPush(对整个 Reddit 做全文搜索,但 2023 年之后有文档记载的缺口)。两者都免费,也都不需要凭证。

reddit_search 会替你查询它们并自动路由 — 限定范围的搜索和讨论串读取走更新鲜的 Arctic Shift,PullPush 仅在出错时作为回退;无限定的关键词搜索走 PullPush,因为它是唯一支持这种搜索的归档。一次调用、规范化的输出、2 credits,而且不向 reddit.com 发送任何一个请求。

第一步:搜索帖子

通过 REST API,搜索一个 subreddit 只需一个带认证的 POST:

Typescript
const response = await fetch('https://crawlforge.dev/api/v1/tools/reddit_search', {
  method: 'POST',
  headers: {
    'X-API-Key': process.env.CRAWLFORGE_API_KEY!,
    'Content-Type': 'application/json',
  },
  body: JSON.stringify({
    query: 'context window',
    subreddit: 'LocalLLaMA',
    mode: 'posts',
    limit: 25,
  }),
});

const { data } = await response.json();
// Each result: title, selftext, score, num_comments, ISO date, permalink

只要有可能,就限定到某个 subreddit 或 author — 这会把你路由到更新鲜、更完整的那个归档。在 Claude Desktop 或 Cursor 这样的 MCP 客户端里则完全不用写代码:直接问 "搜索 r/LocalLLaMA 最近一个月关于上下文窗口的抱怨",agent 会自己发起这个调用。

第二步:读取完整讨论串

从第一步的结果中取任意帖子的 id,以 link_id 配合 mode: "thread" 传回去:

Json
{
  "tool": "reddit_search",
  "arguments": {
    "mode": "thread",
    "link_id": "1vbf4nh",
    "limit": 100
  }
}

你会拿到该帖子及其嵌套评论树 — 得分、永久链接,以及深到无法展开的分支的折叠标记 — 随时可以喂给 summarize_content 或 analyze_content。

第三步:用好关键过滤器

  • 日期:after 和 before 接受 ISO 8601、epoch 秒,或 "7d" 这样的偏移量 — 这是搭建每周监控最简单的方式。
  • 查询语法:"quoted phrases"(引号短语)、OR 和 -exclusion(排除词)在帖子和评论搜索中都可用。
  • **limit:**最多 100。每个文本字段都截断到 2,000 字符并带截断标记,因此即使满满一页结果也对 LLM 保持友好。
  • **mode: "comments":**搜索评论正文而不是帖子 — 真正的观点往往藏在这里。

自己动手直连归档

你可以跳过 CrawlForge,直接访问这两个归档 — 它们免费且文档公开。但要为封装层原本替你消化的那些工作留出预算:按查询形态选择归档、分页、带退避的重试(Arctic Shift 会把匿名客户端限流进一个共享桶,PullPush 的 429 消息则明说不为自动化抓取器提供免费资源)、规范化两套不同的响应 schema,以及处理各归档的缺口。为研究语料库做这些是一个合理的周末项目;但如果 Reddit 数据只是你产品的输入之一,就不值得花这个时间。所有路线的完整对比 — 包括官方 API 的审批流程 — 见 2026 年仍然可用的 Reddit API 替代方案。

坦诚的注意事项

归档数据有它的毛边:发布不足约 36 小时的内容,得分经常显示 0 或 1(内容会被即时捕获,票数统计随后才跟上);PullPush 在 2023 年之后的覆盖存在缺口;已删除的内容可能仍留存在归档中 — 这是把双刃剑,也正是研究者使用归档的原因。

两分钟试用

最快的测试完全不需要配置:reddit_search 已在 playground 上线。当你准备把它接进智能体或流水线时,免费开始,赠送 1,000 credits — 足够 500 次搜索 — 并把 API 参考放在手边随时查阅每个参数。

亲自试一试——无需注册

在 Playground 中运行 CrawlForge 的 28 个抓取与提取工具中的任意一个,然后免费开始,获取 1,000 credits。

1,000 免费 credits • 一次性 • 无需信用卡

标签

redditreddit_searchweb scrapingtutorialno api keyMCP

关于作者

C

CrawlForge Team

工程团队

我们正在打造功能最全面的 Web 抓取 MCP server。我们开发的工具帮助开发者为 AI 应用提取、分析和转换 Web 数据。

及时获取最新洞察

将教程、产品更新与 Web 抓取技巧直接发送到你的收件箱。

拒绝垃圾邮件,随时可取消订阅。

付诸实践

在任意 URL 上测试 CrawlForge 的工具——免费,无需注册。

本页内容

Frequently Asked Questions

抓取 Reddit 的 .json 技巧还能用吗?+

不能了。过去在 Reddit URL 后面加 .json 可以拿到结构化数据形式的页面,但这些请求如今撞上的是和其他所有抓取器相同的基础设施级封锁:数据中心 IP 检查、TLS 指纹识别和 JavaScript 质询。在 CrawlForge 的实测中,普通 fetch 和 old.reddit.com 全部返回 403。2026 年可行的路线是读取社区归档,而不是 reddit.com。

完全不用任何 API key 也能抓取 Reddit 吗?+

可以,方法是直接查询 Arctic Shift 或 PullPush 社区归档 — 两者都免费且无需凭证。代价是工程时间:你要自己处理两套不同的响应 schema、分页、速率限制和各归档特有的缺口,而且 PullPush 会明确对自动化抓取流量限流。CrawlForge reddit_search 只用一个 CrawlForge key,就把两个归档封装成一次规范化调用 — 全程不涉及任何 Reddit 凭证。

不用 API 怎么抓取一个 Reddit 讨论串的全部评论?+

使用 reddit_search 的 thread 模式:把帖子 ID 作为 link_id 传入并把 mode 设为 "thread",它就会返回该帖子及其嵌套评论树 — 包含得分、永久链接和折叠标记 — 数据来自 Arctic Shift 归档而非 reddit.com。无论讨论串多大,一次调用都是 2 credits,输出按评论逐条规范化并截断,保证能在 LLM 上下文窗口内正常使用。

通过归档抓取 Reddit 合法可靠吗?+

这些归档是公开的、社区运营的研究项目 — 它们是 Pushshift 的后继者,而学术界依赖 Pushshift 多年 — 读取它们不涉及规避 reddit.com 的服务条款,因为没有任何请求触碰 Reddit。可靠性方面有坦诚的限制:新内容的投票得分会滞后约 36 小时,PullPush 在 2023 年之后有文档记载的缺口,所以在完整性重要时,把搜索限定到某个 subreddit 或作者。

相关文章

CrawlForge MCP v5.1.0:无需 API 也能搜索 Reddit
Product Updates

CrawlForge MCP v5.1.0:无需 API 也能搜索 Reddit

reddit.com 挡住了我们手上的每一种抓取方式 — 所以 v5.1.0 推出第 28 个工具 reddit_search:通过社区归档搜索帖子和评论、读取完整讨论串。无需 Reddit API key,无需任何凭证,每次调用 2 credits。

C
CrawlForge Team
|
8月24日
|
9 分钟
如何用 MCP server 做关键词差距分析
Tutorials

如何用 MCP server 做关键词差距分析

用 serp_rank 和 search_web 通过 MCP 搭建一套可复现的关键词差距分析:真实自然排名、竞争对手页面类型分类,以及那些让大多数关键词研究出错的陷阱。

C
CrawlForge Team
|
8月23日
|
11 分钟
在 Claude Code 里真正用起来 CrawlForge MCP
Tutorials

在 Claude Code 里真正用起来 CrawlForge MCP

装好了 CrawlForge,Claude 却从来不调用它?本文讲清楚让 MCP tools 在你的终端里稳定触发所需要的提示词、权限规则和 CLAUDE.md 配置。

C
CrawlForge Team
|
8月13日
|
12 分钟

页脚

CrawlForge MCP

面向 AI Agent 的企业级网页抓取。28 个专业 MCP 工具,专为构建智能系统的现代开发者而设计。

产品

  • 功能
  • Playground
  • 价格
  • 应用场景
  • 集成
  • 替代方案
  • 更新日志

资源

  • 快速上手
  • API 参考
  • 模板
  • 指南
  • 博客
  • 术语表
  • 常见问题
  • 网站地图

开发者

  • MCP 协议
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

公司

  • 关于我们
  • 联系我们
  • 隐私政策
  • 服务条款
  • 可接受使用政策
  • Cookie

保持更新

获取新工具和新功能的最新动态。

基于 Next.js 和 MCP 协议构建

© 2025-2026 CrawlForge。保留所有权利。