跳到正文

CrawlForge Team工程团队

阅读时长 5 分钟

面向顾问的市场调研 API:从零到供应商到位

顾问做市场调研,每接一个新项目都要从头再来。新品类、新的供应商名单,还有一位会在第十四页幻灯片上问那个数字从哪来的客户。上个季度的表格用不上。方法可以沿用。

面向顾问的市场调研 API 必须能从零开始运作,因为第一天根本没有供应商名单可以指给它,而且它交回来的事实必须带有出处和日期,因为"我们查过了"不是合伙人能说出口的答案。它还必须只花掉能记在某一个客户账上的钱,而不是算进管理费用。

还没有供应商名单时,从哪里开始?

用两个返回 URL 而不是答案的调用。search_web 每次查询 5 credits,接受一个 queries 数组,所以六种"谁把 X 卖给 Y"的问法可以在一次调用里跑完,花费 30 credits。摘要通常就足够分辨出谁是真正的供应商、谁只是一篇榜单文章。当你还想要原文段落时,deep_research 每次运行 10 credits:它会搜索、抓取最多十个来源,原样返回匹配度最高的段落,并附带一份 sources 列表,列出每个来源的 URL、标题,以及它究竟被真正抓取过,还是只在摘要里见过。托管 API 上不会对任何内容做综合归纳,这正是重点所在。拿回来的是一份长名单,列着域名和把它们放进名单的那些句子。

下一步是在每个域名里找到正确的页面,而错误的做法是猜测定价信息就在 /pricing。map_site 每个域名 2 credits,读取网站的 sitemap,没有 sitemap 时会退回到有限范围的爬取,于是你拿到 URL 列表,从中挑出定价、产品、客户和招聘页面。三十家供应商是 60 credits,而且你永远不会去抓一个 404。

一个带出处的事实,怎么进到幻灯片里?

每页一次 scrape。同时请求 markdown、metadata 和 links:所有格式都来自同一次抓取,无论请求多少种格式,这次调用都只花 2 credits。响应里带有 scraped_at 时间戳,这正是你的交付物需要的那一列日期。

Bash
curl -X POST https://crawlforge.dev/api/v1/tools/scrape \
  -H "X-API-Key: cf_live_NORTHWIND_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "url": "https://vendor-a.com/pricing",
    "formats": ["markdown", "metadata", "links"]
  }'

你写下的这一行是供应商、页面 URL、结论、它依据的那句话,以及 scraped_at。引用原句,而不是改写它。一个写着"所有套餐都含 SSO"的单元格,在旁边那句话证实之前,只是一个观点,尽职调查那篇文章讲的正是让模型代替填这个单元格时会出什么问题。

如果同一个问题要对每家供应商都问一遍,就多加一个 question 格式,多花 1 credit,调用会返回与之最匹配的五句话,每句都带有在 markdown 中的偏移量。RevOps 那篇文章讲的是在一个品类里反复做这件事;这篇讲的是先把这个品类找出来。

怎样把一个客户的花费和另一个分开?

为每个客户创建一个 API 密钥,并用项目的名字命名它。一个账户最多可以有十个,比大多数事务所同时在跑的项目数量还多。用那个密钥发出的每次调用,都会在请求日志里写下一行,记录工具、目标 URL、扣掉的 credits 以及来自哪个密钥,日志可以按密钥筛选,并导出为 CSV。

这样做带来两个没人会主动要求、却在需要时才发现有多重要的好处。项目的花费从"重新拼凑"变成了"一次查询",而当有人问你手上有他们的哪些资料时,一个客户的调研也能和其他人的分清楚。项目结束时,删除那个密钥。删除会撤销它,但保留那些行记录,所以是为谁抓取了什么的记录,会比项目本身活得更久。

上面的例子把客户名放进密钥名里,原因也是一样:这个名字正是你以后要用来筛选的东西。

一个项目要花多少钱?

按上面的方法,做一份 30 家供应商的调研:

步骤调用次数credits
长名单:六种搜索问法,一次 deep_research1 + 140
找到页面:每家供应商跑一次 map_site3060
每家供应商读四个页面120240
对每个定价页问一个问题3090
项目总计430

免费额度里一次性的 1,000 credits 能覆盖其中两份。之后每包 1,000 credits 收费 $3,5,000 credits 一包收费 $14,可以按项目需要购买,而不必按月订阅,这是另一个话题。按套餐包的价格算,上面整份调研大约花一块五美元,小到可以直接算进服务费里,客户问起这一行花在哪里时也经得起核对。

它不会做什么?

  • 没有市场规模数字。 它不测算任何规模,也不做任何预测。如果幻灯片需要 TAM,那得来自某份报告或某个数据集。
  • 没有联系人或企业属性数据。 它只读你指给它的页面。它不是一个公司数据库,也不会和某个公司数据库重叠。
  • 没有客户登录。 只有一个账户,客户各有各的密钥,客户能看到的只是你发给他们的东西。
  • 默认遵守 robots.txt。 被禁止访问的页面会在抓取任何内容之前就被拒绝,不收取任何费用,而关掉这项检查会被记录在你的密钥名下。

当项目变成长期合作,问题变成"这里一变就告诉我"时,答案是按客户设置监控,而不是把这套流程定时重跑一遍。

免费开始,赠送 1,000 credits,创建一个以你下一个项目命名的密钥,在围绕它搭建任何东西之前,先做出一份调研。

亲自试一试——无需注册

在 Playground 中探索全部 31 个 CrawlForge 抓取与提取工具,然后免费开始,获取 1,000 credits。

1,000 免费 credits • 一次性 • 无需信用卡

标签

  • consultants
  • market research
  • scrape
  • map_site
  • deep_research
  • b2b

关于作者

CrawlForge Team

工程团队

我们正在打造功能最全面的 Web 抓取 MCP server。我们开发的工具帮助开发者为 AI 应用提取、分析和转换 Web 数据。

邮件订阅

及时获取最新洞察

将教程、产品更新与 Web 抓取技巧直接发送到你的收件箱。

拒绝垃圾邮件,随时可取消订阅。

FAQ

常见问题

01CrawlForge 是面向顾问的市场调研数据提供商吗?

不是。它不持有任何市场规模估算、企业属性数据、意向信号或联系人记录。它读取你指给它的公开页面,返回页面上写的内容,并附带 URL 和时间戳。对一个咨询项目来说,这让它成为从供应商自己网站构建并引用全景的那一层,与事务所已经授权使用的任何联合报告或数据集配合使用。

02我从没研究过某个品类,怎么找到里面的供应商?

search_web 每次查询 5 credits,接受一个 queries 数组,所以几种不同的问法可以在一次调用里跑完,按有返回结果的每条查询计费。deep_research 每次运行 10 credits,返回原文段落,外加一份 sources 列表,列出每个来源的 URL、标题以及是否被抓取过。两者都返回 URL,而不是写好的答案,这正是长名单阶段你想要的。之后 map_site 花 2 credits 就能列出每个域名的页面,让你挑出定价页或产品页,而不必去猜路径。

03我能把一个客户的用量和另一个分开吗?

可以。为每个客户创建一个具名的 API 密钥;一个账户最多可以有十个。每次调用都会记录它来自哪个密钥,连同工具、URL 和扣掉的 credits,仪表盘里的请求日志可以按密钥筛选,并导出为 CSV。项目结束时删除密钥会撤销它,但保留它的行记录,所以项目的记录会比密钥活得更久。

04我需要订阅才能做一个项目吗?

不需要。免费额度是一次性的 1,000 credits,按上面算出的成本,够做两份 30 家供应商的调研。超出之后,一次性的 credits 包起价为每 1,000 credits $3、每 5,000 credits $14,所以按阵发式做调研的事务所可以按项目购买,而不必按月付费。付费计划则适合想要每月额度并可结转的事务所。

05为什么不干脆用 batch_scrape 一次处理整份供应商名单?

在托管的 REST API 上,batch_scrape 按每个尝试抓取的 URL 收费 5 credits,返回纯文本,而 scrape 每页收费 2 credits,一次抓取就返回 markdown、metadata 和链接。batch 只需一次往返,并把结果保存 24 小时,这点很方便,但对于一份你会仔细阅读的调研来说,循环调用 scrape 的花费不到一半,还能给你更多可引用的内容。

继续阅读

相关文章