面临的问题
AI 答案引擎如今已经在带来真实流量,但它们看到的站点和 Google 看到的并不相同。如果没有一份精心整理的重要页面清单和使用条款,爬虫就只能靠猜——于是总结错了页面,或者干脆跳过你。
应用案例
01快速解答
对你的域名运行 generate_llms_txt(5 credits),生成 llms.txt 和 llms-full.txt——一份精心整理的重点页面清单,外加面向 AI 爬虫的使用指引——再用 map_site(2 credits)确认这些爬虫实际能抓到什么。每个站点大约 7 credits,站点有变动时重新跑一次即可。
02问题与方案
AI 答案引擎如今已经在带来真实流量,但它们看到的站点和 Google 看到的并不相同。如果没有一份精心整理的重要页面清单和使用条款,爬虫就只能靠猜——于是总结错了页面,或者干脆跳过你。
CrawlForge 的 generate_llms_txt 会爬取你的站点,并写出 llms.txt 和更详尽的 llms-full.txt,其中包含你的组织名称、联系方式和自定义指引。随后 map_site 会在你发布之前,先告诉你 AI 爬虫实际能够抓到什么。
03代码
1// Generate llms.txt and llms-full.txt for your site2const llms = await mcp.generate_llms_txt({3 url: "https://example.com",4 format: "both",5 complianceLevel: "standard",6 analysisOptions: { maxPages: 200, maxDepth: 3, respectRobots: true },7 outputOptions: {8 organizationName: "Example Inc",9 contactEmail: "ai@example.com",10 customGuidelines: ["Cite the canonical URL", "Pricing changes monthly"],11 },12});13 14// Confirm what an AI crawler can actually reach15const map = await mcp.map_site({16 url: "https://example.com",17 include_sitemap: true,18 max_urls: 500,19});20 21console.log(llms.llmsTxt);22console.log(`Discoverable pages: ${map.urls.length}`);04工具链
05常见问题
04
llms.txt 是放在站点根目录下的一个纯文本文件,用来把 AI 爬虫指向你的重要页面,并说明内容可以如何被使用。它目前只是一项提案性标准,并不保证排名,但发布成本很低,而且能用一份精心整理的清单取代爬虫的猜测。
对你的域名运行 generate_llms_txt。它最多爬取 500 个页面,遵守 robots 指令,并写出 llms.txt 以及更详尽的 llms-full.txt,其中包含你的组织名称、联系邮箱,以及你传入的任何自定义指引。
llms.txt 是简短的索引——只有章节和关键链接。llms-full.txt 则为能够容纳更多内容的模型内联了远为详尽的细节。传入 format "both" 可同时得到两个文件,也可以用 "llms-txt" 或 "llms-full-txt" 只取其一。
带上 include_sitemap 运行 map_site,列出所有可达的 URL,再把结果与 llms.txt 中列出的页面作对照。两者的差异之处,就是爬虫会漏掉内容的地方,或者说明你的站点地图已经过期。
06继续探索
审计你的网站及竞争对手的元数据、失效链接、内容缺口与排名机会。返回覆盖每个抓取页面的结构化报告,便于逐项排查修复。
把文档站点转换成干净、可直接分块的 markdown,用于检索增强生成(RAG)。先用 map_site 枚举全部页面,再用 scrape 抓取并剥离导航与广告等样板内容,最后用 summarize_content 生成摘要,在向量化之前就把语料整理干净。