本页内容
这个行业里大多数关键词研究止步于一个搜索量估算和一个百分制的难度分。那几乎说明不了什么有用的东西,因为它把两个截然不同的问题压缩成了一个数字:有多少人搜索这个词,以及现在谁占据着答案。
所以我们直接测量了第二个问题。我们拉取了一家 web scraping 公司真正想要的那些关键词的真实 Google 自然前十名,用的是实时 SERP 数据,而不是某个搜索 API 自己的排序。结果出来的不是一条难度梯度,而是两个碰巧共用词汇的独立市场。
目录
- 我们测了什么,没测什么
- 老牌词条是一座商业堡垒
- MCP 词条没有商业守卫者
- 六比零
- 每一个关键词 Reddit 都排进前三
- Firecrawl 为自己的替代品词条排名
- llm scraper 里藏着的意图陷阱
- 排名靠前的目录站数据早已过时
- 我们会拿这些做什么
- 这项研究的薄弱之处
- 常见问题
我们测了什么,没测什么
本文中的每一个位置都是真实的 Google 自然排名,于 2026 年 8 月 23 日针对美国桌面端搜索拉取,扫描前十名结果。
这个区别比听上去更重要。搜索 API 返回的是它自己的排序,而不是 Google 的自然排序。CrawlForge 自己的 search_web 会用 BM25、语义相似度、权威度和新鲜度信号对检索到的结果重新排序——用来做调研很有用,用来衡量排名则毫无价值。从搜索 API 读出位置并把它当作排名,是关键词研究悄悄变成虚构的最常见方式之一。
因此下面的域名列表都来自 serp_rank,它报告的是 Google 真实的 rank_group 值。文中提到某个词条有多少页面时,那是 Google 自己的粗略索引估算:它是一个拥挤程度信号,不是搜索量。我们没有搜索量数据,也没有假装有。
老牌词条是一座商业堡垒
以下是 “web scraping api” 经过验证的自然前十名,这个词条大约有 3310 万个已索引页面在竞争:
| # | 域名 | 页面类型 |
|---|---|---|
| 1 | scraperapi.com | 首页 |
| 2 | firecrawl.dev | 首页 |
| 3 | reddit.com | 论坛帖子 |
| 4 | scrapingbee.com | 首页 |
| 5 | docs.apify.com | 厂商文档 |
| 6 | decodo.com | 产品页 |
| 7 | zenrows.com | 厂商博客 |
| 8 | oxylabs.io | 产品页 |
| 9 | scrapingdog.com | 首页 |
九个里有八个是厂商自有资产。六个是首页或产品页——公司争夺最激烈的页面,背后是多年的外链积累,其中好几家还有九位数的融资。
没有什么巧妙的内容角度能挤进去。一篇新博客文章撼动不了 ScraperAPI 的首页。诚实的判断是:这个词条已经关闭了,任何第一步是“为 web scraping api 做排名”的计划都算不上计划。
MCP 词条没有商业守卫者
再看 “mcp scraping” 经过验证的自然前十名,约 61.5 万个已索引页面:
| # | 域名 | 页面类型 |
|---|---|---|
| 1 | mcpservers.org | 目录列表 |
| 2 | reddit.com | 论坛帖子 |
| 3 | github.com/firecrawl/firecrawl-mcp-server | 代码仓库 |
| 4 | brightdata.com | 第三方博客 |
| 5 | skyvern.com | 第三方博客 |
| 6 | scrapling.readthedocs.io | 文档页 |
| 7 | mcpmarket.com | 目录列表 |
| 8 | fastcrw.com | 第三方博客 |
“web scraping mcp server”(约 39 万个页面)顶部呈现出几乎相同的形态:mcpservers.org,然后是 Reddit,然后是 Firecrawl 的 MCP 仓库。
看看缺了什么。没有一个厂商首页。没有一个产品页。没有一个定价页。最高的两个位置属于一个目录站和一个论坛帖子——这些页面存在,是因为有人给这个品类做了编目或者抱怨过它,而不是因为哪家公司决定要占据它。
最接近商业存在的,是一个 GitHub README 和一个 Read the Docs 页面。它们能排上来,是因为它们确实是现有最好的文档,而不是因为有人优化过。
六比零
这就是整项研究的一句话总结。
在“web scraping api”上,前十名中有六个是厂商的商业页面。在“mcp scraping”上,这个数字是零。
买家是同一批人。评估 MCP scraping 服务器的人,正是两年前会搜索“web scraping api”的那个开发者,预算相同,问题也相同。区别在于,一个查询通向一堵从 2016 年就开始守卫阵地的公司高墙,另一个通向一个没人维护的目录站和一个去年七月的 Reddit 帖子。
MCP 词条更小——约 61.5 万个竞争页面,对比 3310 万。但“小而无人防守”永远胜过“大而密不透风”,而且这道缺口不会一直敞着。每过一个季度,某个拿到融资的竞争对手注意到同样这件事的概率就更高一分。
每一个关键词 Reddit 都排进前三
我们检查了四个关键词。Reddit 在四个里都进了前三:
| 关键词 | Reddit 位置 |
|---|---|
| firecrawl alternative | 1 |
| mcp scraping | 2 |
| web scraping mcp server | 2 |
| web scraping api | 3 |
这不是某一个 SERP 的偶然。对于这个品类里的评估类和比较类查询,Google 系统性地更青睐一群开发者争论的帖子,而不是厂商对自己的描述。
现实后果让人不太舒服但很清楚:不管你参不参与,你在那些讨论中的处境都是你搜索存在感的一部分。在“mcp scraping”上排第二的 r/ClaudeAI 帖子标题是“What's the best most reliable MCP to let Claude Code scrape a website?”——一个购买问题,由陌生人回答,排在这个品类所有产品页之上。
Firecrawl 为自己的替代品词条排名
“firecrawl alternative” 的自然前十名里,firecrawl.dev 位于第 4 位。
这是刻意为之,而且有效。与其把这个词条让给写拆台文章的竞争对手,Firecrawl 选择发布能为正在积极寻求离开的人排名的内容。Apify 用一个专门的替代品页面在第 9 位做了同样的事。
不过要注意谁在第 1 位:一个来自 r/LocalLLaMA 的 Reddit 帖子,标题是“What is the best scraper tool right now? Firecrawl is great, but I want to explore more options”。页面其余部分是 Nimbleway、一个 GitHub 主题页、WebCrawlerAPI、Context、Bright Data 和 Thunderbit——六家公司争夺第七家公司不满客户的流量。
品牌比较类词条是这个品类中小厂商能可靠压过大厂商的唯一位置,因为这个词条对巨头来说太具体、不值得费心防守,对其他人来说又太具商业价值、无法忽视。
llm scraper 里藏着的意图陷阱
“llm scraper” 看起来是个显而易见的目标。约 32.9 万个页面,明显切题,明显与 AI 相关。
这是个陷阱。那个结果集里有相当大一部分是想要屏蔽 scraper 的人,而不是想买一个的人:
- 一个 YunoHost 论坛帖子,标题为“Prevent LLM scrapers/trawlers?”
- 一个 r/sysadmin 帖子,“Fighting LLM scrapers is getting harder, and I need some advice”
- Akamai 的文章“The Rise of the LLM AI Scrapers: What It Means for Bot Management”
- Lobsters 上关于 JavaScript 工作量证明反爬系统的讨论
同样三个词,相反的意图,而且那部分受众对这个产品抱有明确敌意。在那里排名会带来转化率约等于零的流量,以及一个会教会 Google“这个页面是个糟糕答案”的跳出率。
搜索量和难度分看不见这些。只有读真实的结果才能看见。
排名靠前的目录站数据早已过时
“mcp scraping”的八个结果里有两个是目录站:mcpservers.org 排第 1,mcpmarket.com 排第 7。
我们在两个上面都有收录。两条收录信息都是错的。其中一条把 CrawlForge 描述为有 18 个 tools;当前数量是 27。目录收录是这里可用的杠杆率最高的修复项,因为那个页面本来就在排名——要做的是订正,不是一场战役。
如果你在这个品类里做销售,现在就去读一遍你自己的目录条目。那些排在你前面的页面,可能已经在描述你了,而且描述得很糟。
我们会拿这些做什么
我们正在执行的五条结论:
- 别再把老牌头部词条当成目标。 它们有助于理解市场,但作为获客渠道毫无用处。在那里竞争,你会花好几年输给一堆首页。
- 发布那个没人写过的商业页面。 MCP 词条的前十名里没有任何厂商落地页。那不是内容空缺,而是一个无人认领的位置。
- 先修目录收录。 它们今天就在排名,今天就在描述你,而订正它们只要一个下午。
- 在锁定一个关键词之前先读 SERP。 “llm scraper”能通过所有自动化筛选,一接触真实结果就露馅。
- 把论坛当作排名阵地。 我们测的每一项 Reddit 都在前三。缺席那些帖子也是一种排名决策,只不过是无意识的。
这项研究的薄弱之处
四条诚实的局限。
它是 2026 年 8 月 23 日的单次快照。SERP 会变动,而由目录站和论坛帖子驱动的 MCP 结果,会比老牌结果变得更快。
它只覆盖美国桌面端。移动端结果和其他地区的结果会有差异,有时差异很大。
它包含四个有验证位置的关键词,外加另外三个只看了哪些域名出现的关键词。这足以确立模式,但不足以量化机会规模。
而且我们没有搜索量数据。这里的一切描述的是谁占据着答案,而不是有多少人在问这个问题。两者都重要。我们只测了其中一个。
自己复现一遍
这里所有的数字都来自两个 CrawlForge tools:search_web 用来发现存在什么,serp_rank 用来获取真实的自然排名位置。方法在如何用 MCP server 做关键词差距分析中有逐步说明,serp_rank 的文档见 API 参考。
如果你想先看这个品类更宽的全貌,我们的 MCP scraping 服务器排名盘点和 MCP web scraping 完全指南覆盖了这些关键词所描述的整体格局。
免费开始,赠 1,000 credits——像这样一次完整的四关键词研究只需 20 credits。
亲自试一试——无需注册
在 Playground 中运行 CrawlForge 的 28 个抓取与提取工具中的任意一个,然后免费开始,获取 1,000 credits。
1,000 免费 credits • 一次性 • 无需信用卡
标签
及时获取最新洞察
将教程、产品更新与 Web 抓取技巧直接发送到你的收件箱。
拒绝垃圾邮件,随时可取消订阅。