CrawlForge MCP
首页Playground应用场景集成价格文档博客
  1. 首页/
  2. 术语表/
  3. 网页抓取术语
15 个术语

网页抓取术语

网页抓取、渲染与解析背后的 15 个核心概念——从 robots.txt、速率限制到无头浏览器和 CSS 选择器。

本页内容

  • 网页抓取
  • 网络爬虫
  • DOM 解析
  • CSS 选择器
  • XPath
  • 无头浏览器
  • 代理轮换
  • 速率限制
  • 验证码破解
  • Robots.txt
  • 站点地图
  • User Agent
  • HTTP 请求头
  • 分页
  • 动态内容

网页抓取

定义

网页抓取是指从网站自动提取数据的过程。它通过程序化方式获取网页并解析其内容,从而采集结构化信息。

网页抓取是 CrawlForge 通过 Model Context Protocol 提供的能力的基础。无需从网站手动复制数据,CrawlForge 的 fetch_url 和 extract_content 等工具会处理整个流程——获取页面、处理 JavaScript 渲染并返回干净的结构化数据。

对 AI 智能体而言,网页抓取对于访问训练数据之外的实时信息至关重要。CrawlForge 通过单一的 MCP 接口让这一切变得简单,无需构建和维护自定义的抓取基础设施。

相关 CrawlForge 工具

fetch_url1 creditextract_content2 creditsbatch_scrape5 credits

相关术语: 网络爬虫, DOM 解析, 无头浏览器, 动态内容

网络爬虫

定义

网络爬虫是一种通过在页面之间跟随链接来系统性地浏览网络的程序。爬虫可以在整个网站或域名范围内发现并索引内容。

网络爬虫与抓取器的区别在于,它侧重于发现——找出站点上的所有页面,而非从单个页面提取特定数据。CrawlForge 提供 crawl_deep 用于按指定深度跟随内部链接,并提供 map_site 用于生成域名的完整 URL 清单。

这些工具对于内容迁移、SEO 审计以及构建全面数据集等场景至关重要——在这些场景中,你需要处理站点上的每一个页面,而不仅仅是已知的 URL。

相关 CrawlForge 工具

crawl_deep5 creditsmap_site3 credits

相关术语: 网页抓取, 站点地图, Robots.txt, 分页

DOM 解析

定义

DOM 解析是将原始 HTML 转换为结构化文档对象模型(DOM)树的过程。这种树形表示让程序能够导航并从网页中提取特定元素。

CrawlForge 在获取网页时会解析 DOM,以在提取内容之前理解页面结构。正是这一点让 extract_structured 等工具能够基于 CSS 选择器或 schema 定义提取特定数据字段。

DOM 解析对于动态内容尤为重要,因为这类页面初始 HTML 与你在浏览器中看到的内容并不相同。CrawlForge 会在需要时使用无头浏览器渲染页面来处理这一问题,确保解析得到的 DOM 与真实用户所见一致。

相关 CrawlForge 工具

extract_structured3 creditsextract_content2 credits

相关术语: CSS 选择器, XPath, HTML 解析, 动态内容

CSS 选择器

定义

CSS 选择器是一种用于选取并定位网页上特定 HTML 元素的模式。在网页抓取中,选择器精确指明要从页面结构中提取哪些数据。

CSS 选择器是告诉抓取器要提取哪些元素的主要方式。例如,".product-price" 会选取 class 为 "product-price" 的元素,而 "h1.title" 会选取带有 "title" class 的 h1 元素。CrawlForge 的 scrape_structured 等工具接受 CSS 选择器,精确锁定你需要的数据。

使用精确的选择器是构建可靠抓取流水线的关键。CrawlForge 支持完整的 CSS 选择器语法,使得定位深层嵌套或动态生成的元素成为可能。

相关 CrawlForge 工具

scrape_structured3 creditsextract_structured3 credits

相关术语: XPath, DOM 解析, HTML 解析, 结构化数据

XPath

定义

XPath(XML Path Language)是一种用于从 XML 或 HTML 文档中选取节点的查询语言。相比单独使用 CSS 选择器,它提供了更强大、更灵活的文档树导航方式。

XPath 表达式可以在文档树中向上、向下和横向导航,因而适用于复杂的提取场景。例如,你可以根据某个价格元素的同级文本内容来选取它——这是 CSS 选择器无法做到的。

CrawlForge 在其提取工具中同时支持 XPath 和 CSS 选择器。当抓取 HTML 结构混乱的老旧站点,或需要根据文本内容而非 class 名称提取数据时,XPath 尤为有用。

相关 CrawlForge 工具

scrape_structured3 creditsextract_structured3 credits

相关术语: CSS 选择器, DOM 解析, HTML 解析, 结构化数据

无头浏览器

定义

无头浏览器是一种没有图形用户界面、可通过程序控制的网页浏览器。它像普通浏览器一样执行 JavaScript 并渲染页面,但在后台运行。

许多现代网站高度依赖 JavaScript 来渲染内容。简单的 HTTP 请求只能获取初始 HTML,会遗漏任何动态加载的内容。无头浏览器通过完整渲染页面(包括执行 JavaScript、加载 AJAX 请求和处理 CSS)解决了这一问题。

CrawlForge 在 stealth_mode 和 scrape_with_actions 等工具的幕后使用无头浏览器。这意味着你无需自行管理浏览器基础设施,即可获得完整渲染后的页面内容。

相关 CrawlForge 工具

stealth_mode5 creditsscrape_with_actions5 credits

相关术语: 动态内容, 网页抓取, 验证码破解, User Agent

代理轮换

定义

代理轮换是指在发起网页请求时循环使用多个代理 IP 地址的做法。它将请求分散到不同的 IP,以规避速率限制和基于 IP 的封禁。

网站通过监控 IP 地址来检测和封禁抓取器。如果来自单个 IP 的请求过多,站点就会将其封禁。代理轮换通过让每个请求经由不同的 IP 地址路由来解决这一问题,使流量看起来像是来自许多不同的用户。

CrawlForge 通过 stealth_mode 自动处理代理轮换,它使用住宅代理和智能轮换策略。对于站点会主动防御抓取的竞争情报和大规模数据采集场景,这一点至关重要。

相关 CrawlForge 工具

stealth_mode5 creditsbatch_scrape5 credits

相关术语: 速率限制, 验证码破解, User Agent

速率限制

定义

速率限制是网站和 API 用来控制客户端在给定时间段内可发起请求数量的一种技术。它可防止服务器过载,并抵御滥用性抓取。

负责任的网页抓取需要遵守速率限制。在过短时间内发起过多请求会压垮服务器,并导致你的 IP 被永久封禁。速率限制也是一种常见的反爬虫措施,会返回 429(请求过多)HTTP 状态码。

CrawlForge 工具会通过限流请求并在触及限制时实施指数退避,自动处理速率限制。这意味着你的抓取任务能够可靠完成,无需人工干预来管理请求时机。

相关 CrawlForge 工具

batch_scrape5 creditscrawl_deep5 credits

相关术语: 代理轮换, Robots.txt, HTTP 请求头, 验证码破解

验证码破解

定义

验证码破解是指用于绕过网站用来区分人类与机器人的验证码(CAPTCHA)挑战的自动化技术。这包括图像识别、基于令牌的破解以及浏览器指纹模拟。

验证码是最常见的反爬虫防御手段之一。它们的形式从简单的文本挑战,到复杂的图像谜题,再到无形的行为分析不一而足。对于价格监控和竞争分析等正当的抓取场景,绕过它们往往是必要的。

CrawlForge 的 stealth_mode 将验证码处理作为其反检测能力的一部分。通过结合浏览器指纹随机化与住宅代理,它从一开始就降低了触发验证码的可能性。

相关 CrawlForge 工具

stealth_mode5 credits

相关术语: 无头浏览器, 代理轮换, User Agent

Robots.txt

定义

Robots.txt 是放置在网站根目录的标准文本文件,它告诉网络爬虫哪些页面允许或禁止访问。它是机器人排除协议(Robots Exclusion Protocol)的一部分。

robots.txt 文件相当于一套面向爬虫的准则。尽管它不具法律约束力,但遵守它被视为合乎道德的抓取的标准做法。它规定了哪些路径禁止访问、抓取延迟偏好以及指向 XML 站点地图的链接。

CrawlForge 工具默认遵守 robots.txt 指令。在使用 crawl_deep 或 map_site 时,爬虫会在访问页面前检查 robots.txt,确保你的抓取活动符合站点所有者声明的偏好。

相关 CrawlForge 工具

crawl_deep5 creditsmap_site3 credits

相关术语: 网络爬虫, 站点地图, 速率限制, User Agent

站点地图

定义

站点地图是一个列出网站上所有 URL 的 XML 文件,同时附带最后修改日期和优先级等元数据。它帮助搜索引擎和爬虫高效地发现并索引所有页面。

站点地图无需通过跟随链接来发现页面,即可提供网站页面的完整清单。这使其对于全面抓取、SEO 审计和内容迁移等需要处理每一个页面的场景极具价值。

CrawlForge 的 map_site 可为任意域名生成站点地图,通过跟随链接和现有站点地图文件两种方式发现 URL。这为使用 batch_scrape 进行批量操作提供了可靠的起点。

相关 CrawlForge 工具

map_site3 creditsbatch_scrape5 credits

相关术语: 网络爬虫, Robots.txt, SEO 审计, Schema 标记

User Agent

定义

User Agent 是在 HTTP 请求头中发送的字符串,用于标识发起请求的客户端软件。网站借此检测浏览器、机器人和抓取器。

每个 HTTP 请求都包含一个 User-Agent 请求头。网站会分析该请求头,以向不同客户端提供不同内容,并识别自动化流量。使用抓取库的默认 User Agent 是被封禁的捷径。

CrawlForge 会自动轮换 User Agent 字符串,并使其与真实浏览器配置相匹配。在 stealth_mode 中,User Agent 会与一致的浏览器指纹配对,以躲避高级反爬虫系统的检测。

相关 CrawlForge 工具

stealth_mode5 creditsfetch_url1 credit

相关术语: HTTP 请求头, 无头浏览器, 代理轮换, 验证码破解

HTTP 请求头

定义

HTTP 请求头是随 HTTP 请求和响应一同发送的键值对,提供有关本次通信的元数据。在抓取中,User-Agent、Accept 和 Cookie 等请求头对请求成功与否至关重要。正确设置请求头能让抓取工具模拟真实浏览器行为,降低被目标网站拦截的概率。

正确的 HTTP 请求头决定了一次抓取是成功还是被拦截。反爬虫系统会将缺失或不一致的请求头视为自动化流量的信号。真实浏览器会发送数十个请求头,而粗糙的抓取器可能只发送寥寥几个。

CrawlForge 会在每个请求中自动发送逼真的请求头集合。fetch_url 和 stealth_mode 等工具包含与真实浏览器行为相匹配的完整请求头配置,从而降低被检测的几率。

相关 CrawlForge 工具

fetch_url1 creditstealth_mode5 credits

相关术语: User Agent, 速率限制, REST API, API 端点

分页

定义

分页是将内容分散到多个页面的做法。在网页抓取中处理分页,意味着自动遍历所有页面以采集完整的数据集。

大多数网站会将大型数据集拆分为分页列表——搜索结果、产品目录、文章归档等。只抓取第一页的抓取器会遗漏大部分数据。分页可以是基于 URL 的(?page=2)、基于按钮的,或采用无限滚动。

CrawlForge 的 crawl_deep 会自动跟随分页链接,而 scrape_with_actions 可以处理基于 JavaScript 的分页,例如无限滚动和"加载更多"按钮。这确保了完整的数据采集,无需手动管理页面。

相关 CrawlForge 工具

crawl_deep5 creditsscrape_with_actions5 credits

相关术语: 网页抓取, 动态内容, 网络爬虫, CSS 选择器

动态内容

定义

动态内容是指在页面初始加载之后由 JavaScript 加载或生成的网页内容。这包括单页应用、通过 AJAX 加载的数据以及客户端渲染的内容。抓取动态内容需要能执行 JavaScript 的无头浏览器,例如通过 scrape_with_actions 模拟点击、滚动与等待。

越来越多的网站使用 React、Vue 或 Angular 等 JavaScript 框架在客户端渲染内容。对这类页面发起简单的 HTTP GET 请求只会返回一个空的 HTML 框架,因为实际内容是在页面加载后由 JavaScript 注入的。

CrawlForge 通过在无头浏览器中渲染页面来处理动态内容。extract_content 和 scrape_with_actions 等工具会等待 JavaScript 执行完成后再提取数据,确保你获得与真实用户所见相同的内容。

相关 CrawlForge 工具

extract_content2 creditsscrape_with_actions5 credits

相关术语: 无头浏览器, DOM 解析, 网页抓取, 分页

更多术语表指南

AI 与 MCP 术语

15 个术语 · AI / MCP

数据与 API 术语

10 个术语 · 数据

网页数据行业术语

10 个术语 · 行业

浏览全部术语表词条

立即领取 1,000 个免费 credits 开始抓取

立即开始使用 CrawlForge,无需信用卡。

领取 1,000 个免费 credits 开始抓取

页脚

CrawlForge MCP

面向 AI Agent 的企业级网页抓取。29 个专业 MCP 工具,专为构建智能系统的现代开发者而设计。

产品

  • 功能
  • Playground
  • 价格
  • 应用场景
  • 集成
  • 替代方案
  • 更新日志

资源

  • 快速上手
  • API 参考
  • 模板
  • 指南
  • 博客
  • 术语表
  • 常见问题
  • 网站地图

开发者

  • MCP 协议
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

公司

  • 关于我们
  • 联系我们
  • 隐私政策
  • 服务条款
  • 可接受使用政策
  • Cookie

保持更新

获取新工具和新功能的最新动态。

基于 Next.js 和 MCP 协议构建

© 2025-2026 CrawlForge。保留所有权利。