跳到正文

博客

用 Web 数据构建 AI 应用.

13 ai 工程

  • AI 工程

    4 分钟

    自托管的网页搜索 MCP server

    大多数号称“自托管”的搜索 MCP server 只是把进程跑在本地。CrawlForge 可以让 search_web 指向你自己的 SearXNG 实例——以及,哪一部分仍然不是自托管的。

  • AI 工程

    6 分钟

    为 AI 智能体提供 Reddit 数据:MCP 路线

    未经修饰的真实观点都在 Reddit 上,而它又是全网对智能体最不友好的主流网站。本文讲解如何通过一个 MCP 工具,让你的 AI 智能体获得真正可用的 Reddit 搜索 — 帖子、评论和完整讨论串。

  • AI 工程

    11 分钟

    2026 年面向 AI 智能体的最佳网页爬取工具

    按智能体就绪程度排名的 2026 年面向 AI 智能体的最佳网页爬取工具:MCP 原生工具发现、类型化 schema 与高 token 效率的输出。逐项对比 CrawlForge、Firecrawl、Apify 等主流方案的能力与定价。

  • AI 工程

    9 分钟

    用本地 LLM 提取网页数据(Ollama + CrawlForge)

    无需 API key,无需云端,数据不离开你的机器。用 extract_with_llm 配合本地 Ollama 从任何网站提取结构化数据。本教程涵盖本地模型选择、schema 定义、性能对比与完整代码示例。

  • AI 工程

    10 分钟

    MCP 协议详解:2026 开发者指南

    了解 Model Context Protocol 的工作原理、它为何对 AI 智能体至关重要,以及如何借助架构图和代码示例构建 MCP server 与客户端。一篇面向开发者的 MCP 深入入门指南。

  • AI 工程

    11 分钟

    如何用网页数据构建 RAG 流水线

    构建一个生产级 RAG 流水线:爬取网站、提取内容、对文本分块、生成 embedding,并提供检索增强的回答。

  • AI 工程

    14 分钟

    为 AI 训练数据做网页抓取:2026 完整指南

    学习如何为 AI 训练采集、清洗和构建网页数据。涵盖合乎道德的抓取、数据质量以及 LLM 微调准备的最佳实践,并给出用 CrawlForge 构建训练语料管道的完整流程,从数据采集、清洗到格式化导出一步到位。