面临的问题
客户的评价散落在 Amazon 商品页、Reddit 帖子和 Hacker News 评论里。靠人工阅读,往往要等评论风向变了好几周之后才发现质量问题;而且电商平台一改版,基于选择器的爬虫就会不断失效。
应用案例
01快速解答
用 scrape_template(1 credit)从 Amazon、YouTube 或 Hacker News 拉取评论,无需维护选择器;用 reddit_search(5 credits)通过社区存档获取 Reddit 讨论;用 analyze_content(3 credits)分析情感、话题和实体;再用 summarize_content(4 credits)生成简报。每个产品大约 13 credits,成本低到可以每周跑一次。
02问题与方案
客户的评价散落在 Amazon 商品页、Reddit 帖子和 Hacker News 评论里。靠人工阅读,往往要等评论风向变了好几周之后才发现质量问题;而且电商平台一改版,基于选择器的爬虫就会不断失效。
CrawlForge 的 scrape_template 可以从已知站点——Amazon 商品、YouTube、Hacker News——拉取干净的数据,无需维护任何选择器;reddit_search 则通过社区存档读取 Reddit 讨论,因为 reddit.com 会屏蔽抓取工具。analyze_content 负责给出情感、话题和实体,summarize_content 则把这一堆内容变成一份简报。
03代码
1// Pull reviews from known sites without writing selectors2const product = await mcp.scrape_template({3 template: "amazon-product",4 url: "https://www.amazon.com/dp/B0EXAMPLE",5});6 7// reddit.com blocks scrapers -- reddit_search reads the community archives8const reddit = await mcp.reddit_search({9 query: "Example Gadget",10 subreddit: "gadgets",11 limit: 10,12});13 14const voices = product.reviews.map(r => r.text).join("\n");15 16// Sentiment, topics, and entities across every review17const analysis = await mcp.analyze_content({18 text: voices,19 options: { includeSentiment: true, extractTopics: true, extractEntities: true },20});21 22// One briefing for the product team23const digest = await mcp.summarize_content({24 text: voices,25 options: { summaryLength: "medium", summaryType: "abstractive" },26});27 28console.log(reddit.count, reddit.results[0]?.num_comments); // discussion volume29console.log(analysis.sentiment, analysis.topics);30console.log(digest.summary);04工具链
05常见问题
04
使用 scrape_template 并选择内置模板(例如 amazon-product),Reddit 讨论则使用 reddit_search——reddit.com 屏蔽直接抓取,因此 reddit_search 改为读取社区存档。提取规则由 CrawlForge 维护,因此电商平台改版时,不会像自定义选择器那样悄无声息地弄坏你的流水线。
Amazon 商品、LinkedIn 个人主页、GitHub 仓库、YouTube 视频、推文、Reddit 帖子、Hacker News 首页、Product Hunt 上线项目、Stack Overflow 问题以及 npm 包。调用 scrape_template 时传入 template "list",即可查看当前的完整清单。对于 Reddit,请优先使用 reddit_search——reddit.com 屏蔽直接抓取,reddit-thread 模板已无法稳定工作。
对于你传入的文本,analyze_content 会返回情感分值、检测到的语言、话题、命名实体和可读性指标。把汇总后的评论喂给它,然后再跑一次 summarize_content,就能得到一份关于变化的简短简报。
每个产品每次运行大约 13 credits:每次 scrape_template 调用 1 credit,reddit_search 5 credits,analyze_content 3 credits,summarize_content 4 credits。每周监测 10 个产品,一个月大约 560 credits。