AI 工程
用 Web 数据构建 AI 应用.
AI Engineering
智能体爬虫:它是什么,以及如何构建一个
智能体爬虫追的是目标,不是选择器。这意味着什么、构建它的三种方式、可用代码、真实的失败模式,以及一笔用 credits 算清的成本账。
C
CrawlForge Team13 分钟
AI Engineering
MCP server 中的 SSRF:抓取工具为何泄露云密钥
2026 年 7 月的一项研究发现,91.8% 的受审 MCP server 没有认证。本文解释网页抓取服务器为何会泄露云凭据,以及如何加以阻止。
C
CrawlForge Team9 分钟
AI Engineering
2026 年面向 AI 智能体的最佳网页爬取工具
按智能体就绪程度排名的 2026 年面向 AI 智能体的最佳网页爬取工具:MCP 原生工具发现、类型化 schema 与高 token 效率的输出。逐项对比 CrawlForge、Firecrawl、Apify 等主流方案的能力与定价。
C
CrawlForge Team11 分钟
AI Engineering
用本地 LLM 提取网页数据(Ollama + CrawlForge)
无需 API key,无需云端,数据不离开你的机器。用 extract_with_llm 配合本地 Ollama 从任何网站提取结构化数据。本教程涵盖本地模型选择、schema 定义、性能对比与完整代码示例。
C
CrawlForge Team9 分钟
AI Engineering
MCP 协议详解:2026 开发者指南
了解 Model Context Protocol 的工作原理、它为何对 AI 智能体至关重要,以及如何借助架构图和代码示例构建 MCP server 与客户端。一篇面向开发者的 MCP 深入入门指南。
C
CrawlForge Team10 分钟
AI Engineering
如何用网页数据构建 RAG 流水线
构建一个生产级 RAG 流水线:爬取网站、提取内容、对文本分块、生成 embedding,并提供检索增强的回答。
C
CrawlForge Team11 分钟
AI Engineering
隐身模式爬取:CrawlForge 如何绕过反爬虫检测
深入剖析反爬虫检测系统,以及 CrawlForge 的隐身模式功能如何帮助你合规、高效地爬取受保护的网站。
C
CrawlForge Team14 分钟
AI Engineering
为 AI 训练数据做网页抓取:2026 完整指南
学习如何为 AI 训练采集、清洗和构建网页数据。涵盖合乎道德的抓取、数据质量以及 LLM 微调准备的最佳实践,并给出用 CrawlForge 构建训练语料管道的完整流程,从数据采集、清洗到格式化导出一步到位。
C
CrawlForge Team14 分钟