顾问做市场调研,每接一个新项目都要从头再来。新品类、新的供应商名单,还有一位会在第十四页幻灯片上问那个数字从哪来的客户。上个季度的表格用不上。方法可以沿用。
面向顾问的市场调研 API 必须能从零开始运作,因为第一天根本没有供应商名单可以指给它,而且它交回来的事实必须带有出处和日期,因为"我们查过了"不是合伙人能说出口的答案。它还必须只花掉能记在某一个客户账上的钱,而不是算进管理费用。
还没有供应商名单时,从哪里开始?
用两个返回 URL 而不是答案的调用。search_web 每次查询 5 credits,接受一个 queries 数组,所以六种"谁把 X 卖给 Y"的问法可以在一次调用里跑完,花费 30 credits。摘要通常就足够分辨出谁是真正的供应商、谁只是一篇榜单文章。当你还想要原文段落时,deep_research 每次运行 10 credits:它会搜索、抓取最多十个来源,原样返回匹配度最高的段落,并附带一份 sources 列表,列出每个来源的 URL、标题,以及它究竟被真正抓取过,还是只在摘要里见过。托管 API 上不会对任何内容做综合归纳,这正是重点所在。拿回来的是一份长名单,列着域名和把它们放进名单的那些句子。
下一步是在每个域名里找到正确的页面,而错误的做法是猜测定价信息就在 /pricing。map_site 每个域名 2 credits,读取网站的 sitemap,没有 sitemap 时会退回到有限范围的爬取,于是你拿到 URL 列表,从中挑出定价、产品、客户和招聘页面。三十家供应商是 60 credits,而且你永远不会去抓一个 404。
一个带出处的事实,怎么进到幻灯片里?
每页一次 scrape。同时请求 markdown、metadata 和 links:所有格式都来自同一次抓取,无论请求多少种格式,这次调用都只花 2 credits。响应里带有 scraped_at 时间戳,这正是你的交付物需要的那一列日期。
curl -X POST https://crawlforge.dev/api/v1/tools/scrape \
-H "X-API-Key: cf_live_NORTHWIND_KEY" \
-H "Content-Type: application/json" \
-d '{
"url": "https://vendor-a.com/pricing",
"formats": ["markdown", "metadata", "links"]
}'你写下的这一行是供应商、页面 URL、结论、它依据的那句话,以及 scraped_at。引用原句,而不是改写它。一个写着"所有套餐都含 SSO"的单元格,在旁边那句话证实之前,只是一个观点,尽职调查那篇文章讲的正是让模型代替填这个单元格时会出什么问题。
如果同一个问题要对每家供应商都问一遍,就多加一个 question 格式,多花 1 credit,调用会返回与之最匹配的五句话,每句都带有在 markdown 中的偏移量。RevOps 那篇文章讲的是在一个品类里反复做这件事;这篇讲的是先把这个品类找出来。
怎样把一个客户的花费和另一个分开?
为每个客户创建一个 API 密钥,并用项目的名字命名它。一个账户最多可以有十个,比大多数事务所同时在跑的项目数量还多。用那个密钥发出的每次调用,都会在请求日志里写下一行,记录工具、目标 URL、扣掉的 credits 以及来自哪个密钥,日志可以按密钥筛选,并导出为 CSV。
这样做带来两个没人会主动要求、却在需要时才发现有多重要的好处。项目的花费从"重新拼凑"变成了"一次查询",而当有人问你手上有他们的哪些资料时,一个客户的调研也能和其他人的分清楚。项目结束时,删除那个密钥。删除会撤销它,但保留那些行记录,所以是为谁抓取了什么的记录,会比项目本身活得更久。
上面的例子把客户名放进密钥名里,原因也是一样:这个名字正是你以后要用来筛选的东西。
一个项目要花多少钱?
按上面的方法,做一份 30 家供应商的调研:
| 步骤 | 调用次数 | credits |
|---|---|---|
| 长名单:六种搜索问法,一次 deep_research | 1 + 1 | 40 |
| 找到页面:每家供应商跑一次 map_site | 30 | 60 |
| 每家供应商读四个页面 | 120 | 240 |
| 对每个定价页问一个问题 | 30 | 90 |
| 项目总计 | 430 |
免费额度里一次性的 1,000 credits 能覆盖其中两份。之后每包 1,000 credits 收费 $3,5,000 credits 一包收费 $14,可以按项目需要购买,而不必按月订阅,这是另一个话题。按套餐包的价格算,上面整份调研大约花一块五美元,小到可以直接算进服务费里,客户问起这一行花在哪里时也经得起核对。
它不会做什么?
- 没有市场规模数字。 它不测算任何规模,也不做任何预测。如果幻灯片需要 TAM,那得来自某份报告或某个数据集。
- 没有联系人或企业属性数据。 它只读你指给它的页面。它不是一个公司数据库,也不会和某个公司数据库重叠。
- 没有客户登录。 只有一个账户,客户各有各的密钥,客户能看到的只是你发给他们的东西。
- 默认遵守
robots.txt。 被禁止访问的页面会在抓取任何内容之前就被拒绝,不收取任何费用,而关掉这项检查会被记录在你的密钥名下。
当项目变成长期合作,问题变成"这里一变就告诉我"时,答案是按客户设置监控,而不是把这套流程定时重跑一遍。
免费开始,赠送 1,000 credits,创建一个以你下一个项目命名的密钥,在围绕它搭建任何东西之前,先做出一份调研。