Model Context Protocol (MCP)
定义
Model Context Protocol 是一项开放标准,使 AI 模型能够通过统一接口与外部工具和数据源交互。它为 LLM 提供了一种结构化的方式来调用函数、访问 API 和获取实时信息。
MCP 是 CrawlForge 架构的基础。CrawlForge 无需为每个 AI 平台构建自定义集成,而是通过 MCP 标准暴露其 29 个网页抓取工具。任何兼容 MCP 的 AI 客户端——Claude、GPT 或自定义智能体——都能立即发现并使用这些工具。
这意味着你的 AI 智能体只需连接到 CrawlForge MCP server,即可获得网页抓取能力,无需任何自定义代码或 API 封装。该协议会自动处理工具发现、参数校验和响应格式化。
相关术语: MCP Server, MCP Client, 工具使用, 函数调用
MCP Server
定义
MCP server 是一种通过 Model Context Protocol 暴露工具和资源的服务。它注册可用函数,处理来自 AI 客户端的传入工具调用,并返回结构化结果。CrawlForge 就是一个专注于网页抓取的 MCP server,向 AI 助手提供 29 个专业工具。
CrawlForge 是一个提供 29 个网页抓取和数据提取工具的 MCP server。当 AI 智能体连接到 CrawlForge 时,服务器会公布其可用工具——fetch_url、extract_content、deep_research 等——以及它们的参数和预期输出。
服务器处理网页抓取的所有复杂性(浏览器渲染、代理管理、速率限制),同时向 AI 客户端呈现一个简洁的工具接口。这种关注点分离让 AI 开发者能够专注于应用逻辑,而非抓取基础设施。
相关术语: Model Context Protocol (MCP), MCP Client, 工具使用, AI 智能体
MCP Client
定义
MCP client 是连接到 MCP server 以发现并调用工具的应用程序或 AI 模型。它发送工具调用请求,并处理服务器返回的结构化响应。常见的 MCP client 包括 Claude Desktop、Claude Code 和 Cursor,它们让 AI 助手能直接使用网页抓取等外部能力。
MCP client 包括 Claude 等 AI 助手、Cursor 等开发环境,以及使用 MCP SDK 构建的自定义应用。任何 MCP client 都可以连接到 CrawlForge,并立即获得对全部 29 个网页抓取工具的访问权限,无需额外配置。
客户端-服务器架构意味着你可以在任何兼容 MCP 的环境中使用 CrawlForge。无论你是在构建聊天机器人、自主智能体还是数据流水线,都可以通过同一协议使用同样的工具。
相关术语: Model Context Protocol (MCP), MCP Server, AI 智能体, 函数调用
AI 智能体
定义
AI 智能体是由大语言模型驱动的自主系统,能够对任务进行推理、做出决策,并通过使用工具来采取行动。智能体超越了简单的聊天机器人,能够规划并执行多步骤工作流。
AI 智能体是 CrawlForge 工具的主要使用者。例如,一个负责市场调研的智能体可能会使用 search_web 查找相关来源、使用 extract_content 从每个来源获取干净数据,并使用 deep_research 综合发现——整个过程无需人工干预。
CrawlForge 专为智能体工作流而设计。工具返回智能体可推理的结构化数据,credits 成本可预测便于预算规划,而 MCP 接口意味着智能体可以动态地发现和使用工具。
相关术语: 大语言模型 (LLM), 工具使用, 函数调用, Model Context Protocol (MCP)
大语言模型 (LLM)
定义
大语言模型是一种在海量文本数据上训练的神经网络,能够理解并生成人类语言。LLM 为 AI 助手、代码生成器和自主智能体提供动力。
Claude、GPT 和 Llama 等 LLM 是强大的推理者,但存在一个根本性限制:它们无法访问实时网络。它们的知识在训练时就被冻结,因而对于需要最新信息的任务并不可靠。
CrawlForge 通过 MCP 工具为 LLM 提供实时网页访问能力,弥合了这一差距。当 LLM 需要最新数据——实时价格、近期新闻、更新后的文档——时,它会调用 CrawlForge 工具来获取并提取这些信息,然后对新鲜数据进行推理。
相关术语: AI 智能体, Token, 上下文窗口, 检索增强生成 (RAG)
检索增强生成 (RAG)
定义
RAG 是一种将信息检索与文本生成相结合的 AI 架构。它先从外部来源检索相关文档,再将其作为上下文供语言模型生成准确且有依据的回答。
RAG 系统需要高质量的源内容才能良好运作。垃圾进则垃圾出——如果检索到的文档是夹杂导航菜单和广告的杂乱 HTML,生成的答案就会受影响。干净的内容提取是任何 RAG 流水线的关键组成部分。
CrawlForge 的 extract_content 和 extract_text 等工具会返回剥离样板内容的干净结构化内容。这使它们成为构建需要摄入网页内容的 RAG 流水线的理想选择。将它们与 deep_research 搭配,即可实现内置冲突检测的多源检索。
相关术语: 嵌入向量, 向量数据库, 大语言模型 (LLM), 上下文窗口
嵌入向量
定义
嵌入向量是文本、图像或其他数据的稠密数值向量表示。它们以一种支持相似度搜索、聚类及其他机器学习操作的格式捕捉语义含义。
嵌入向量是原始文本与机器理解之间的桥梁。当你将网页内容转换为嵌入向量后,就可以将其与其他文档进行比较,从而查找相似内容、构建推荐系统或驱动语义搜索。
CrawlForge 的 extract_content 提供能产出更高质量嵌入向量的干净文本。夹杂导航、页脚和广告的原始 HTML 会产生降低搜索质量的嘈杂嵌入向量。通过只提取有意义的内容,CrawlForge 提升了下游嵌入向量的表现。
相关术语: 向量数据库, 检索增强生成 (RAG), 大语言模型 (LLM), 结构化输出
向量数据库
定义
向量数据库是一种专门设计用于存储和高效查询高维向量嵌入的数据库。它支持在数百万条嵌入文档之间进行快速相似度搜索。
Pinecone、Weaviate 和 pgvector 等向量数据库是 RAG 系统和语义搜索的核心组件。它们存储文档嵌入向量,并在查询到来时根据向量相似度检索最相关的文档。
CrawlForge 作为内容摄入层融入向量数据库工作流。使用 batch_scrape 大规模采集页面,使用 extract_content 获取干净文本,然后将结果嵌入并存入你的向量数据库。这一流水线能让你的知识库始终保持最新的网页数据。
相关术语: 嵌入向量, 检索增强生成 (RAG), 结构化数据, 数据流水线
结构化输出
定义
结构化输出是指以 JSON 等可预测、机器可读格式(而非自由文本)返回的数据。它使 AI 智能体和数据流水线能够进行可靠的下游处理。
AI 智能体需要结构化数据来做决策。非结构化文本需要额外解析,且容易被误读。结构化输出确保每个数据字段都处于已知的位置和格式,从而实现可靠的自动化处理。
CrawlForge 的 scrape_structured 和 extract_structured 等工具会以符合你指定 schema 的干净 JSON 格式返回数据。这意味着你的智能体和流水线可以直接消费输出,无需后处理或正则提取。
相关术语: JSON, Schema 标记, 结构化数据, 函数调用
提示词工程
定义
提示词工程是设计和优化给语言模型的指令以获得预期输出的实践。它涉及编写系统提示词、少样本示例和结构化查询。
良好的提示词工程决定了 AI 智能体能否有效地使用工具。一个设计精良的提示词会告诉智能体何时使用 CrawlForge 工具、为每项任务选择哪个工具,以及如何解读结果。
在将 CrawlForge 与 AI 智能体配合使用时,提示词工程有助于优化 credits 用量。例如,当无需完整研究时,指示智能体使用 extract_text(1 credit)来进行简单的内容获取,而非使用 deep_research(10 credits),可以显著降低成本。
相关术语: 大语言模型 (LLM), AI 智能体, 上下文窗口, Token
微调
定义
微调是在特定数据集上对预训练语言模型进行进一步训练,以使其行为针对特定任务或领域专门化的过程。它将通用模型适配到有针对性的使用场景。
微调需要大量高质量的领域专属文本数据集。从网络上采集这些数据是大规模网页抓取最常见的用途之一。训练数据的质量直接影响微调后模型的表现。
CrawlForge 的 batch_scrape 和 extract_content 正是为这一工作流而设计。使用 batch_scrape 并行处理数百个 URL,使用 extract_content 获取适合训练的干净结构化文本。这一流水线能够从文档站点、论坛、学术论文或任何网络来源构建数据集。
相关术语: 大语言模型 (LLM), Token, 嵌入向量, AI 智能体
Token
定义
token 是语言模型处理的基本文本单位。文本在被模型处理前会被切分为 token(每个 token 大约 4 个字符或 0.75 个单词)。token 数量决定了成本和上下文限制。
在将 CrawlForge 与 AI 智能体配合使用时,理解 token 很重要,因为抓取到的内容会占用上下文窗口空间。一个很长的网页可能产生数千个 token,有可能填满智能体的上下文并增加 API 成本。
CrawlForge 的 extract_text 和 summarize_content 等工具有助于管理 token 用量。extract_text 只返回不含样板内容的正文,而 summarize_content 会将长页面浓缩为简明摘要,从而减少发送给 LLM 的 token 占用。
相关术语: 上下文窗口, 大语言模型 (LLM), 提示词工程, 微调
上下文窗口
定义
上下文窗口是语言模型在单次请求中能够处理的最大文本量(以 token 计)。它同时包含输入提示词和生成的输出。
上下文窗口大小决定了 AI 智能体一次能处理多少抓取内容。Claude 的 200K token 上下文窗口大约可容纳 150,000 个单词,而较小的模型可能被限制在 4K-32K token。超出上下文窗口意味着数据会被截断或丢失。
CrawlForge 通过 summarize_content(浓缩长页面)和 extract_text(剥离样板内容)等工具帮助应对上下文窗口约束。对于大规模研究,deep_research 会将多个来源综合为简明摘要,而非将所有原始内容塞入上下文。
相关术语: Token, 大语言模型 (LLM), 提示词工程, 检索增强生成 (RAG)
函数调用
定义
函数调用是语言模型在对话过程中调用外部函数或 API 的能力。模型决定何时调用函数、生成相应的参数,并处理返回的结果。
函数调用是让 AI 智能体能够使用 CrawlForge 工具的机制。当智能体判断需要网页数据时,它会生成一个带有相应工具名称和参数的函数调用。MCP server 执行该调用并将结果返回给智能体。
CrawlForge 工具的设计便于通过函数调用接口被发现。每个工具都有清晰的参数定义和返回类型,使模型能够轻松选择正确的工具并提供有效的参数。
相关术语: 工具使用, Model Context Protocol (MCP), AI 智能体, 结构化输出
工具使用
定义
工具使用是 AI 模型与外部工具、API 和服务交互以完成文本生成之外任务的能力。它将模型能力扩展到包括网页浏览、代码执行、数据获取等。
工具使用将语言模型从被动的文本生成器转变为主动的问题解决者。具备工具使用能力的模型不会凭空编造关于时事的答案,而是可以搜索网络、获取页面并提取数据,从而提供有依据、准确的回答。
CrawlForge 提供 29 个专门的网页抓取工具供 AI 模型使用。每个工具都有特定用途——从简单的 URL 获取到复杂的多源研究——让模型能够细粒度地控制其访问网页数据的方式。
相关术语: 函数调用, Model Context Protocol (MCP), AI 智能体, MCP Server