CrawlForge MCP
首页Playground应用场景集成价格文档博客
  1. 首页/
  2. 术语表/
  3. 数据与 API 术语
10 个术语

数据与 API 术语

在系统之间传递抓取结果的 10 种格式与协议——REST 与 GraphQL、JSON 与 Markdown、Webhook,以及搜索引擎读取的结构化数据标记。

本页内容

  • JSON-LD
  • 结构化数据
  • Schema 标记
  • API 端点
  • Webhook
  • REST API
  • GraphQL
  • JSON
  • Markdown
  • HTML 解析

JSON-LD

定义

JSON-LD(JSON for Linking Data)是一种使用 JSON 格式编码结构化数据的方法。它是在网页中嵌入 schema.org 标记以供搜索引擎理解的首选格式。

JSON-LD 作为 script 标签嵌入网页,包含关于页面内容的结构化元数据——产品详情、文章信息、组织数据等。由于它本身就是机器可读的,因此对抓取器而言是干净结构化数据的丰富来源。

CrawlForge 的 extract_metadata 会检测并从页面中提取 JSON-LD,让你能够获取站点所有者已经整理好的结构化数据。由于 JSON-LD 是为机器消费而设计的,这通常比解析可视化元素更可靠。

相关 CrawlForge 工具

extract_metadata2 creditsextract_structured3 credits

相关术语: 结构化数据, Schema 标记, JSON, HTML 解析

结构化数据

定义

结构化数据是以预定义格式组织的信息,便于机器解析和理解。在网络上,它通常指嵌入在 HTML 页面中的 schema.org 标记。

网站上的结构化数据包括以机器可读格式描述内容的 JSON-LD、microdata 和 RDFa 注解。搜索引擎用它来生成富摘要,而抓取器可以利用它实现可靠的数据提取。

CrawlForge 的 extract_metadata 会自动检测并解析任意页面中的结构化数据。这为数据提取提供了一条捷径——你往往无需为每个字段编写 CSS 选择器,即可直接从页面的结构化数据中获取产品价格、评分、库存情况等信息。

相关 CrawlForge 工具

extract_metadata2 creditsscrape_structured3 credits

相关术语: JSON-LD, Schema 标记, JSON, 结构化输出

Schema 标记

定义

Schema 标记是一套(来自 schema.org 的)标签词汇,你将其添加到 HTML 中,以改善搜索引擎读取和呈现你页面的方式。它定义了 Product、Article、Organization 等类型及其属性。

Schema 标记告诉搜索引擎你的内容含义为何,而不仅仅是字面内容。带有 Product schema 标记的页面会明确声明某产品的名称、价格、库存情况和评价,从而支持富搜索结果。

对网页抓取而言,schema 标记是一座金矿。CrawlForge 的 extract_metadata 会从页面中提取 schema 标记,提供结构化的产品数据、文章元数据和企业信息,而不会有基于 CSS 选择器提取那样的脆弱性。

相关 CrawlForge 工具

extract_metadata2 creditsanalyze_content3 credits

相关术语: JSON-LD, 结构化数据, SEO 审计, HTML 解析

API 端点

定义

API 端点是 API 接收请求的特定 URL。每个端点执行特定功能,例如获取数据、创建记录或触发操作。在网页抓取场景中,你通过向 CrawlForge 等服务的端点发送 HTTP 请求来调用抓取工具,并以 JSON 等结构化格式接收返回结果。

许多网站拥有提供与其页面所显示相同数据的 API,且通常以更干净的 JSON 格式提供。发现并使用这些 API 端点,可能比抓取渲染后的 HTML 更高效、更可靠。

CrawlForge 本身就作为一组 API 端点运行——其 29 个工具中的每一个都可通过 REST 端点访问。在抓取时,fetch_url 既可以访问网页,也可以访问 API 端点,返回原始 JSON 响应以供程序化处理。

相关 CrawlForge 工具

fetch_url1 creditextract_structured3 credits

相关术语: REST API, Webhook, JSON, HTTP 请求头

Webhook

定义

Webhook 是一种 HTTP 回调,会在事件发生时将数据投递到指定的 URL。与轮询不同,webhook 实时推送数据,从而支持事件驱动的架构。

Webhook 常用于在发生变化时触发操作——新订单、价格更新或内容修改。它们是网页抓取这种基于拉取方式的、基于推送的对应物。

CrawlForge 的 track_changes 弥合了抓取与 webhook 之间的鸿沟。它会监控页面变化,并能在内容更新时通知你的系统,让你获得类似 webhook 的实时感知能力,而无需目标站点支持 webhook。

相关 CrawlForge 工具

track_changes3 credits

相关术语: API 端点, REST API, JSON, 数据流水线

REST API

定义

REST API(Representational State Transfer,表征状态转移)是一种使用标准 HTTP 方法对资源执行操作的 Web 服务架构。它是 Web 服务最常见的 API 风格。

REST API 使用 GET、POST、PUT 和 DELETE 等 HTTP 方法来与由 URL 标识的资源交互。包括 CrawlForge 在内的大多数现代 Web 服务都通过 REST 端点暴露功能。

CrawlForge 的 29 个工具除了通过 MCP,还可通过 REST API 端点访问。这意味着你可以将 CrawlForge 集成到任何能够发起 HTTP 请求的编程语言或平台中,而不仅限于兼容 MCP 的 AI 客户端。

相关 CrawlForge 工具

fetch_url1 credit

相关术语: API 端点, GraphQL, JSON, HTTP 请求头

GraphQL

定义

GraphQL 是一种 API 查询语言,允许客户端精确请求所需的数据。与 REST 不同,单个 GraphQL 端点即可服务所有查询,由客户端指定数据的结构。

一些网站使用 GraphQL API 来驱动其前端,这可能是高效的抓取目标。GraphQL 响应本身就是结构化的 JSON,而且你可以只请求所需的字段,从而减少数据传输量。

CrawlForge 的 fetch_url 可以直接访问 GraphQL 端点,发送查询并接收结构化响应。对于暴露 GraphQL 的站点,这种方式比抓取渲染后的 HTML 更高效。

相关 CrawlForge 工具

fetch_url1 credit

相关术语: REST API, API 端点, JSON, 结构化输出

JSON

定义

JSON(JavaScript Object Notation)是一种轻量级的数据交换格式,易于人类阅读、便于机器解析。它是 API 响应和结构化数据交换的标准格式。

JSON 是网页数据的通用语言。API 响应、配置文件和结构化数据几乎无一例外地以 JSON 编码。在抓取时,目标通常是将杂乱的 HTML 转换为下游系统可以处理的干净 JSON。

CrawlForge 工具默认以 JSON 格式返回数据。scrape_structured 和 extract_structured 等工具允许你为输出定义 JSON schema,确保提取的数据与你预期的结构完全一致。

相关 CrawlForge 工具

scrape_structured3 creditsextract_structured3 credits

相关术语: JSON-LD, REST API, 结构化输出, 结构化数据

Markdown

定义

Markdown 是一种使用纯文本格式语法的轻量级标记语言。它被广泛用于文档撰写、内容创作,并作为提取网页内容的干净中间格式。

Markdown 在保留内容结构(标题、列表、链接、代码块)的同时剥离了 HTML 的复杂性。当你需要可读的结构化文本而非原始 HTML 或纯文本时,这使其成为网页抓取的理想输出格式。

CrawlForge 的 extract_content 支持以 Markdown 作为输出格式,将网页转换为保留文档结构的干净 Markdown。这对于内容迁移、文档抓取以及向善于处理 Markdown 的 AI 模型提供内容尤为有用。

相关 CrawlForge 工具

extract_content2 creditsextract_text1 credit

相关术语: HTML 解析, JSON, 结构化输出, 内容迁移

HTML 解析

定义

HTML 解析是分析 HTML 标记以提取其结构和内容的过程。解析器将原始 HTML 字符串转换为程序可查询和操作的可导航树形结构。

HTML 解析是网页抓取背后的核心技术操作。来自网页的原始 HTML 必须先被解析为结构化表示,然后才能提取任何数据。解析器的质量决定了它处理网络上常见的格式错误 HTML 的能力。

CrawlForge 在其所有工具中内部处理 HTML 解析,使用能够优雅处理真实世界 HTML 的健壮解析器。你永远无需自己应对解析的怪异之处——只需指定所需数据,工具就会返回干净的结果。

相关 CrawlForge 工具

extract_content2 creditsextract_text1 creditextract_metadata2 credits

相关术语: DOM 解析, CSS 选择器, XPath, JSON-LD

更多术语表指南

网页抓取术语

15 个术语 · 网页抓取

AI 与 MCP 术语

15 个术语 · AI / MCP

网页数据行业术语

10 个术语 · 行业

浏览全部术语表词条

立即领取 1,000 个免费 credits 开始抓取

立即开始使用 CrawlForge,无需信用卡。

领取 1,000 个免费 credits 开始抓取

页脚

CrawlForge MCP

面向 AI Agent 的企业级网页抓取。29 个专业 MCP 工具,专为构建智能系统的现代开发者而设计。

产品

  • 功能
  • Playground
  • 价格
  • 应用场景
  • 集成
  • 替代方案
  • 更新日志

资源

  • 快速上手
  • API 参考
  • 模板
  • 指南
  • 博客
  • 术语表
  • 常见问题
  • 网站地图

开发者

  • MCP 协议
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

公司

  • 关于我们
  • 联系我们
  • 隐私政策
  • 服务条款
  • 可接受使用政策
  • Cookie

保持更新

获取新工具和新功能的最新动态。

基于 Next.js 和 MCP 协议构建

© 2025-2026 CrawlForge。保留所有权利。