内容迁移
从旧版网站提取并重构内容,迁移至现代化平台。
快速解答
用 CrawlForge crawl_deep(4 credits)沿内部链接遍历整个旧站点,再用 extract_text(每页 1 credit)提取去除导航和广告后的干净、易读内容。一次自动化运行即可迁移数百个页面,同时保留结构和元数据,并可随时重新运行。
面临的问题
从旧版 CMS 平台迁移内容意味着要在保留结构、元数据和格式的同时提取数千个页面。手动复制粘贴既容易出错又极其缓慢。
解决方案
CrawlForge 的 crawl_deep 会沿着内部链接遍历整个网站,extract_text 则从每个页面提取干净的内容。一次自动化运行即可迁移数百个页面。
代码示例
// Crawl legacy site and extract all content for migration
const crawl = await mcp.crawl_deep({
url: "https://legacy-site.com/blog",
max_depth: 3,
follow_links: true,
include_patterns: ["/blog/*"],
});
// Extract clean text from each discovered page
const pages = await Promise.all(
crawl.urls.map(url =>
mcp.extract_text({ url, preserve_structure: true })
)
);
console.log(`Migrated ${pages.length} pages`);使用的工具
crawl_deep4 credits
extract_text1 credits
预估费用:每个页面约 5 credits
常见问题
如何把内容从老旧的 CMS 迁移出来?
使用 CrawlForge 的 crawl_deep 沿着内部链接遍历整个网站,再用 extract_text 从每个页面提取干净、可读的内容。一次自动化运行就能迁移数百个页面,同时保留结构和元数据。
crawl_deep 会保留页面结构和元数据吗?
crawl_deep 会返回每个页面的内容,你还可以搭配 extract_metadata 来保留标题、描述和 canonical。extract_text 和 extract_content 会剥离样板内容,让你迁移的是真正的正文,而不是导航和广告。
一次运行能迁移多少个页面?
crawl_deep 会按照你设定的深度和页面数量上限,沿内部链接遍历整个网站或某个板块,因此一个作业就能处理数百到数千个页面。成本为每次 crawl 调用 4 credits,再加上每页的提取费用。
一次内容迁移会用掉哪些 credits?
crawl_deep 为 4 credits,extract_text 为每页 1 credit。迁移几百个页面通常花费几百 credits——只是手动复制粘贴所耗时间的一小部分,而且如果需要重新运行也可以重复执行。