CrawlForge MCP
首页Playground应用场景集成价格文档博客
用于尽职调查的 MCP server:AI 代理究竟能核实什么
Use Cases
返回博客
应用场景

用于尽职调查的 MCP server:AI 代理究竟能核实什么

C
CrawlForge Team
工程团队
2026年9月4日
阅读时长 4 分钟

本页内容

快速解答

用于尽职调查的 MCP server,给 AI 代理的是在调查过程中搜索、抓取、解析并复核一手来源的 tools,而不是它自己持有的授权数据集。CrawlForge 不拥有工商登记记录、制裁名单、申报文件或组织架构图——它只读取你指定的页面,因此它是尽职调查服务商的补充,而非替代。这里真正重要的属性是可追溯性:deep_research 返回逐字原文段落,每条发现都附带 source_url;research_scope.domains 可将一次调查锁定在最多 10 个你信任的域名内,使代理无法越出你会在报告中引用的登记机关范围。按一轮调研、两份文件、一次登记信息抽取加上交割后监控计算,每个交易对手约需 23 credits。

搜索用于尽职调查的 MCP server,你会得到工商登记类服务器、一个虚拟数据室,以及一家合规厂商。它们回答的是同一个问题:数据从哪里来。这篇文章回答另一半——一个通用的网页数据 MCP server 在尽职调查流程里究竟做什么,以及那个应当决定你是否信任其输出的失效模式。

用于尽职调查的 MCP server 究竟做什么

它不会交给你一个尽职调查数据库。CrawlForge 不拥有工商登记记录,没有制裁名单,没有申报文件,也没有组织架构图。它读取的是你指定的页面。

它带来的是位于数据源之上的那一层:你的代理可以在撰写备忘录的同一个会话里搜索、抓取、解析并复核一手文件,而不必由你在数据室、浏览器和电子表格之间来回复制。这个说法比多数为该关键词排名的页面都更克制,但它是诚实的。如果你需要一份有授权的制裁名单,就去买一份制裁名单。

每项尽职调查任务对应哪个 tool

任务ToolCredits
梳理关于某个交易对手的公开报道deep_research10
阅读申报文件、年度报告或合同 PDFprocess_document2
从登记页面中抽取指定字段extract_structured3
枚举某家子公司的全部网站资产map_site → crawl_deep2 + 4
签约后持续监控交易对手track_changes3

如何把代理限制在你信任的来源之内

尽职调查的成败取决于来源质量,因此请把每次调查锁定到你真正会引用的登记机关与监管机构。research_scope.domains 最多接受 10 个:

Json
{
  "research_query": "ACME Holdings Ltd filing history and current directors",
  "research_scope": {
    "domains": ["find-and-update.company-information.service.gov.uk", "sec.gov"]
  },
  "max_sources": 10
}

第一次调用前值得知道两个参数陷阱:查询字段叫 research_query,不是 query 也不是 topic,而且至少要有 10 个字符。未知的键会被静默丢弃,所以传 topic 会返回一个 400,抱怨缺少 research_query——完整参数列表见 API 参考文档。

真正要命的失效模式是什么

模型返回了一条看起来合理、却从未出现在页面上的事实。

在大多数抓取工作里,这只是个麻烦。在尽职调查里,这就是全部风险所在——一个编造出来的成立日期,读起来和真实日期一模一样,而下游没有任何环节会标记它。我们确实遇到过 extract_structured 返回一个在源页面上根本不存在的版本号,仅仅因为模型更偏爱它记住的那一个——这类问题只有针对真实站点的实测才能发现,测试套件永远发现不了。

所以真正该围绕其做设计的属性是可追溯性,而不是准确率承诺。deep_research 返回的是带有 source_url 的逐字原文段落,而不是综合改写后的摘要,这意味着备忘录里的每一行都能回溯到它的出处页面。可操作的规则是:让基于 LLM 的抽取去定位事实,然后在它进入任何需要合伙人签字的材料之前,对照原始段落或用 process_document 读取 PDF 加以确认。

一个交易对手要花多少

按上表的费用,一轮现实的调查是这样的:

  • deep_research 限定在两个登记机关内 —— 10
  • 两份文件经 process_document 处理 —— 4
  • 一个登记页面经 extract_structured 抽取 —— 3
  • 为交割后监控,对其定价页和新闻页建立基线 —— 6

也就是每个交易对手 23 credits,因此 Free 方案一次性的 1,000 credits 大约够完整跑完 43 个,足以让你判断这套做法是否值得进入你的技术栈。

监控是最被低估的一环。track_changes 先执行一次 create_baseline,之后按你需要的频率执行 compare,并可用 CSS selector 把 diff 限定在关键区块——一张定价表,或一个管理层名单——这样页面改版就不会被读成实质性变化。

免费开始,赠送 1,000 credits,先拿一个真实的交易对手把上面这一轮跑一遍,再决定要不要投入。

亲自试一试——无需注册

在 Playground 中运行 CrawlForge 的 29 个抓取与提取工具中的任意一个,然后免费开始,获取 1,000 credits。

1,000 免费 credits • 一次性 • 无需信用卡

标签

due diligencemcpdeep_researchtrack_changesb2b

关于作者

C

CrawlForge Team

工程团队

我们正在打造功能最全面的 Web 抓取 MCP server。我们开发的工具帮助开发者为 AI 应用提取、分析和转换 Web 数据。

及时获取最新洞察

将教程、产品更新与 Web 抓取技巧直接发送到你的收件箱。

拒绝垃圾邮件,随时可取消订阅。

付诸实践

在任意 URL 上测试 CrawlForge 的工具——免费,无需注册。

本页内容

Frequently Asked Questions

MCP server 能取代尽职调查服务商吗?+

不能,任何声称可以的页面都值得警惕。通用的网页数据 MCP server 本身不持有任何授权数据——没有工商登记记录,没有制裁名单或政治公众人物名单,也没有经核验的申报文件。它按请求读取公开页面。这使它成为位于你的数据源之上的调研与监控层,适合与登记机关订阅或数据室配合使用,而不是取而代之。

为什么 deep_research 返回 400?+

几乎总是查询字段的问题。参数名是 research_query,不是 query 也不是 topic,并且长度至少要 10 个字符。未知的键会被丢弃而不是拒绝,所以传 topic 会得到一个提示 research_query 缺失的 400;在你知道这条规则之前,这个报错会让人摸不着头脑。

怎样阻止代理到批准范围之外的来源去调查?+

设置 research_scope.domains,它最多接受 10 个域名,并把底层搜索限制在这些域名内。做尽职调查时,值得在每一次调用上都设置它:它把发现结果限定在你会在报告中引用的登记机关、监管机构和申报文件之内,也让输出变得可复核,因为读者可以拿每条发现的 source_url 去对照这份允许清单。

交割之后还能继续监控交易对手吗?+

可以,用 track_changes,每次调用 3 credits。先对关键页面执行一次 create_baseline,之后按计划执行 compare,即可获得变化百分比和一份 diff。传入 CSS selector 把比较范围限定到相关区块——一张定价表、一份董事会名单——这样网站改版就不会浮现为实质性变化。

相关文章

用 CrawlForge 构建 lead enrichment 引擎
Use Cases

用 CrawlForge 构建 lead enrichment 引擎

自动为销售线索补充公司数据、技术栈和联系方式。抓取公开的商业数据来甄别线索并优先安排触达。本指南用 CrawlForge 与 Claude 构建完整的线索增强管道,含完整的代码示例与 credits 成本分析。

C
CrawlForge Team
|
4月14日
|
10 分钟
大规模提取电商产品数据
Use Cases

大规模提取电商产品数据

用 CrawlForge 从成千上万的电商页面中提取产品数据。大规模构建产品目录、监控库存并为比价引擎提供动力。

C
CrawlForge Team
|
4月18日
|
10 分钟
用 CrawlForge Deep Research 构建调研智能体
Use Cases

用 CrawlForge Deep Research 构建调研智能体

使用 CrawlForge deep_research 构建一个 AI 调研智能体,在几分钟内从数十个来源收集、验证并综合信息。

C
CrawlForge Team
|
4月16日
|
10 分钟

页脚

CrawlForge MCP

面向 AI Agent 的企业级网页抓取。29 个专业 MCP 工具,专为构建智能系统的现代开发者而设计。

产品

  • 功能
  • Playground
  • 价格
  • 应用场景
  • 集成
  • 替代方案
  • 更新日志

资源

  • 快速上手
  • API 参考
  • 模板
  • 指南
  • 博客
  • 术语表
  • 常见问题
  • 网站地图

开发者

  • MCP 协议
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

公司

  • 关于我们
  • 联系我们
  • 隐私政策
  • 服务条款
  • 可接受使用政策
  • Cookie

保持更新

获取新工具和新功能的最新动态。

基于 Next.js 和 MCP 协议构建

© 2025-2026 CrawlForge。保留所有权利。