网页抓取
定义
网页抓取是指从网站自动提取数据的过程。它通过程序化方式获取网页并解析其内容,从而采集结构化信息。
网页抓取是 CrawlForge 通过 Model Context Protocol 提供的能力的基础。无需从网站手动复制数据,CrawlForge 的 fetch_url 和 extract_content 等工具会处理整个流程——获取页面、处理 JavaScript 渲染并返回干净的结构化数据。
对 AI 智能体而言,网页抓取对于访问训练数据之外的实时信息至关重要。CrawlForge 通过单一的 MCP 接口让这一切变得简单,无需构建和维护自定义的抓取基础设施。
相关术语: 网络爬虫, DOM 解析, 无头浏览器, 动态内容
网络爬虫
定义
网络爬虫是一种通过在页面之间跟随链接来系统性地浏览网络的程序。爬虫可以在整个网站或域名范围内发现并索引内容。
网络爬虫与抓取器的区别在于,它侧重于发现——找出站点上的所有页面,而非从单个页面提取特定数据。CrawlForge 提供 crawl_deep 用于按指定深度跟随内部链接,并提供 map_site 用于生成域名的完整 URL 清单。
这些工具对于内容迁移、SEO 审计以及构建全面数据集等场景至关重要——在这些场景中,你需要处理站点上的每一个页面,而不仅仅是已知的 URL。
相关术语: 网页抓取, 站点地图, Robots.txt, 分页
DOM 解析
定义
DOM 解析是将原始 HTML 转换为结构化文档对象模型(DOM)树的过程。这种树形表示让程序能够导航并从网页中提取特定元素。
CrawlForge 在获取网页时会解析 DOM,以在提取内容之前理解页面结构。正是这一点让 extract_structured 等工具能够基于 CSS 选择器或 schema 定义提取特定数据字段。
DOM 解析对于动态内容尤为重要,因为这类页面初始 HTML 与你在浏览器中看到的内容并不相同。CrawlForge 会在需要时使用无头浏览器渲染页面来处理这一问题,确保解析得到的 DOM 与真实用户所见一致。
相关术语: CSS 选择器, XPath, HTML 解析, 动态内容
CSS 选择器
定义
CSS 选择器是一种用于选取并定位网页上特定 HTML 元素的模式。在网页抓取中,选择器精确指明要从页面结构中提取哪些数据。
CSS 选择器是告诉抓取器要提取哪些元素的主要方式。例如,".product-price" 会选取 class 为 "product-price" 的元素,而 "h1.title" 会选取带有 "title" class 的 h1 元素。CrawlForge 的 scrape_structured 等工具接受 CSS 选择器,精确锁定你需要的数据。
使用精确的选择器是构建可靠抓取流水线的关键。CrawlForge 支持完整的 CSS 选择器语法,使得定位深层嵌套或动态生成的元素成为可能。
相关术语: XPath, DOM 解析, HTML 解析, 结构化数据
XPath
定义
XPath(XML Path Language)是一种用于从 XML 或 HTML 文档中选取节点的查询语言。相比单独使用 CSS 选择器,它提供了更强大、更灵活的文档树导航方式。
XPath 表达式可以在文档树中向上、向下和横向导航,因而适用于复杂的提取场景。例如,你可以根据某个价格元素的同级文本内容来选取它——这是 CSS 选择器无法做到的。
CrawlForge 在其提取工具中同时支持 XPath 和 CSS 选择器。当抓取 HTML 结构混乱的老旧站点,或需要根据文本内容而非 class 名称提取数据时,XPath 尤为有用。
相关术语: CSS 选择器, DOM 解析, HTML 解析, 结构化数据
无头浏览器
定义
无头浏览器是一种没有图形用户界面、可通过程序控制的网页浏览器。它像普通浏览器一样执行 JavaScript 并渲染页面,但在后台运行。
许多现代网站高度依赖 JavaScript 来渲染内容。简单的 HTTP 请求只能获取初始 HTML,会遗漏任何动态加载的内容。无头浏览器通过完整渲染页面(包括执行 JavaScript、加载 AJAX 请求和处理 CSS)解决了这一问题。
CrawlForge 在 stealth_mode 和 scrape_with_actions 等工具的幕后使用无头浏览器。这意味着你无需自行管理浏览器基础设施,即可获得完整渲染后的页面内容。
相关术语: 动态内容, 网页抓取, 验证码破解, User Agent
代理轮换
定义
代理轮换是指在发起网页请求时循环使用多个代理 IP 地址的做法。它将请求分散到不同的 IP,以规避速率限制和基于 IP 的封禁。
网站通过监控 IP 地址来检测和封禁抓取器。如果来自单个 IP 的请求过多,站点就会将其封禁。代理轮换通过让每个请求经由不同的 IP 地址路由来解决这一问题,使流量看起来像是来自许多不同的用户。
CrawlForge 通过 stealth_mode 自动处理代理轮换,它使用住宅代理和智能轮换策略。对于站点会主动防御抓取的竞争情报和大规模数据采集场景,这一点至关重要。
相关术语: 速率限制, 验证码破解, User Agent
速率限制
定义
速率限制是网站和 API 用来控制客户端在给定时间段内可发起请求数量的一种技术。它可防止服务器过载,并抵御滥用性抓取。
负责任的网页抓取需要遵守速率限制。在过短时间内发起过多请求会压垮服务器,并导致你的 IP 被永久封禁。速率限制也是一种常见的反爬虫措施,会返回 429(请求过多)HTTP 状态码。
CrawlForge 工具会通过限流请求并在触及限制时实施指数退避,自动处理速率限制。这意味着你的抓取任务能够可靠完成,无需人工干预来管理请求时机。
相关术语: 代理轮换, Robots.txt, HTTP 请求头, 验证码破解
验证码破解
定义
验证码破解是指用于绕过网站用来区分人类与机器人的验证码(CAPTCHA)挑战的自动化技术。这包括图像识别、基于令牌的破解以及浏览器指纹模拟。
验证码是最常见的反爬虫防御手段之一。它们的形式从简单的文本挑战,到复杂的图像谜题,再到无形的行为分析不一而足。对于价格监控和竞争分析等正当的抓取场景,绕过它们往往是必要的。
CrawlForge 的 stealth_mode 将验证码处理作为其反检测能力的一部分。通过结合浏览器指纹随机化与住宅代理,它从一开始就降低了触发验证码的可能性。
相关术语: 无头浏览器, 代理轮换, User Agent
Robots.txt
定义
Robots.txt 是放置在网站根目录的标准文本文件,它告诉网络爬虫哪些页面允许或禁止访问。它是机器人排除协议(Robots Exclusion Protocol)的一部分。
robots.txt 文件相当于一套面向爬虫的准则。尽管它不具法律约束力,但遵守它被视为合乎道德的抓取的标准做法。它规定了哪些路径禁止访问、抓取延迟偏好以及指向 XML 站点地图的链接。
CrawlForge 工具默认遵守 robots.txt 指令。在使用 crawl_deep 或 map_site 时,爬虫会在访问页面前检查 robots.txt,确保你的抓取活动符合站点所有者声明的偏好。
相关术语: 网络爬虫, 站点地图, 速率限制, User Agent
站点地图
定义
站点地图是一个列出网站上所有 URL 的 XML 文件,同时附带最后修改日期和优先级等元数据。它帮助搜索引擎和爬虫高效地发现并索引所有页面。
站点地图无需通过跟随链接来发现页面,即可提供网站页面的完整清单。这使其对于全面抓取、SEO 审计和内容迁移等需要处理每一个页面的场景极具价值。
CrawlForge 的 map_site 可为任意域名生成站点地图,通过跟随链接和现有站点地图文件两种方式发现 URL。这为使用 batch_scrape 进行批量操作提供了可靠的起点。
相关术语: 网络爬虫, Robots.txt, SEO 审计, Schema 标记
User Agent
定义
User Agent 是在 HTTP 请求头中发送的字符串,用于标识发起请求的客户端软件。网站借此检测浏览器、机器人和抓取器。
每个 HTTP 请求都包含一个 User-Agent 请求头。网站会分析该请求头,以向不同客户端提供不同内容,并识别自动化流量。使用抓取库的默认 User Agent 是被封禁的捷径。
CrawlForge 会自动轮换 User Agent 字符串,并使其与真实浏览器配置相匹配。在 stealth_mode 中,User Agent 会与一致的浏览器指纹配对,以躲避高级反爬虫系统的检测。
相关术语: HTTP 请求头, 无头浏览器, 代理轮换, 验证码破解
动态内容
定义
动态内容是指在页面初始加载之后由 JavaScript 加载或生成的网页内容。这包括单页应用、通过 AJAX 加载的数据以及客户端渲染的内容。抓取动态内容需要能执行 JavaScript 的无头浏览器,例如通过 scrape_with_actions 模拟点击、滚动与等待。
越来越多的网站使用 React、Vue 或 Angular 等 JavaScript 框架在客户端渲染内容。对这类页面发起简单的 HTTP GET 请求只会返回一个空的 HTML 框架,因为实际内容是在页面加载后由 JavaScript 注入的。
CrawlForge 通过在无头浏览器中渲染页面来处理动态内容。extract_content 和 scrape_with_actions 等工具会等待 JavaScript 执行完成后再提取数据,确保你获得与真实用户所见相同的内容。
相关术语: 无头浏览器, DOM 解析, 网页抓取, 分页