AI 工程
用 Web 数据构建 AI 应用.
在你的产品里内置 MCP server:五个决策
二十九个 tools 里只开放十个、默认关闭、锁定版本、可随时替换——让 AI 功能引用真实打开过的页面的架构。
网页搜索 MCP server 搭配本地 LLM:实际运行的是哪个模型
search_web 负责找到网页,本地 Ollama 模型负责读取。CrawlForge 按实测准确率而非参数量来挑选模型——4B 模型胜过 20B 模型。
自托管的网页搜索 MCP server
大多数号称“自托管”的搜索 MCP server 只是把进程跑在本地。CrawlForge 可以让 search_web 指向你自己的 SearXNG 实例——以及,哪一部分仍然不是自托管的。
AI Crawler List 2026: Every Bot + Should You Block Them?
Every AI crawler that matters in 2026: 31 bots, their robots.txt tokens, and what blocking each one actually costs you. Copy-paste file included.
为 AI 智能体提供 Reddit 数据:MCP 路线
未经修饰的真实观点都在 Reddit 上,而它又是全网对智能体最不友好的主流网站。本文讲解如何通过一个 MCP 工具,让你的 AI 智能体获得真正可用的 Reddit 搜索 — 帖子、评论和完整讨论串。
智能体爬虫:它是什么,以及如何构建一个
智能体爬虫追的是目标,不是选择器。这意味着什么、构建它的三种方式、可用代码、真实的失败模式,以及一笔用 credits 算清的成本账。
MCP server 中的 SSRF:抓取工具为何泄露云密钥
2026 年 7 月的一项研究发现,91.8% 的受审 MCP server 没有认证。本文解释网页抓取服务器为何会泄露云凭据,以及如何加以阻止。
2026 年面向 AI 智能体的最佳网页爬取工具
按智能体就绪程度排名的 2026 年面向 AI 智能体的最佳网页爬取工具:MCP 原生工具发现、类型化 schema 与高 token 效率的输出。逐项对比 CrawlForge、Firecrawl、Apify 等主流方案的能力与定价。
用本地 LLM 提取网页数据(Ollama + CrawlForge)
无需 API key,无需云端,数据不离开你的机器。用 extract_with_llm 配合本地 Ollama 从任何网站提取结构化数据。本教程涵盖本地模型选择、schema 定义、性能对比与完整代码示例。
MCP 协议详解:2026 开发者指南
了解 Model Context Protocol 的工作原理、它为何对 AI 智能体至关重要,以及如何借助架构图和代码示例构建 MCP server 与客户端。一篇面向开发者的 MCP 深入入门指南。
如何用网页数据构建 RAG 流水线
构建一个生产级 RAG 流水线:爬取网站、提取内容、对文本分块、生成 embedding,并提供检索增强的回答。
隐身模式爬取:CrawlForge 如何绕过反爬虫检测
深入剖析反爬虫检测系统,以及 CrawlForge 的隐身模式功能如何帮助你合规、高效地爬取受保护的网站。
为 AI 训练数据做网页抓取:2026 完整指南
学习如何为 AI 训练采集、清洗和构建网页数据。涵盖合乎道德的抓取、数据质量以及 LLM 微调准备的最佳实践,并给出用 CrawlForge 构建训练语料管道的完整流程,从数据采集、清洗到格式化导出一步到位。