Pada halaman ini
Tanya mana-mana pembangun scraper apakah laman arus perdana paling sukar pada 2026, dan Reddit ialah jawapan yang selamat. Kami sendiri tahu — reddit.com menyekat setiap laluan akses terus yang CrawlForge ada, daripada fetch biasa hinggalah pelayar senyap penuh. Jadi CrawlForge MCP v5.1.0 berhenti melawan tembok itu dan memilih jalan keliling: alat reddit_search baharu — alat kami yang ke-28 — mencari post dan komen Reddit serta membaca keseluruhan thread melalui arkib kendalian komuniti, tanpa API key Reddit, tanpa aplikasi OAuth, dan tanpa sebarang kelayakan.
Isi kandungan
- Apa yang dihantar
- Mengapa reddit.com tidak boleh di-scrape
- Berkenalan dengan reddit_search
- Arkib: Arctic Shift dan PullPush
- Cara penghalaan berfungsi
- Kaveat yang jujur
- Menggunakannya daripada MCP dan REST
- Bagaimana dengan templat thread Reddit
- Turut dihantar sejak v5.0.4
- Kos credits
- Cara menaik taraf
Apa yang dihantar
v5.1.0 ialah keluaran minor berfokus dengan satu tajuk utama:
reddit_search— cari post Reddit (tajuk + selftext) dan komen, atau baca sesuatu post berserta pepohon komen bersarangnya, melalui arkib komuniti Arctic Shift dan PullPush. Tiga mod, penapis berskop, output ternormal. 2 credits setiap panggilan.- Jumlah alat meningkat daripada 27 kepada 28, dan kad pelayan MCP, arahan alat serta prom permulaan semuanya mengenali pendatang baharu ini.
- 31 ujian unit baharu (1,018 kesemuanya dalam suite) dan pematuhan protokol MCP 100% merentasi kesemua 28 alat, disahkan secara langsung melalui MCP stdio yang memulangkan post r/ClaudeAI sebenar.
Mengapa reddit.com tidak boleh di-scrape
Kami tidak memilih arkib kerana citarasa — kami mengukur tembok itu dahulu. Sebelum membina alat ini, kami menjalankan setiap laluan terus terhadap reddit.com, secara langsung:
fetch_urldengan User-Agent pelayar penuh: 403scrapeterhadap old.reddit.com: 403scrape_templatedengan templat reddit-thread: 403stealth_modepada tahap paling canggihnya: 403
Sekatan itu berlapis — reputasi IP pusat data dahulu, cap jari TLS semasa handshake, kemudian cabaran JavaScript — itulah sebabnya pelayar senyap di atas pelayan pun gagal. Dan pintu rasmi turut menyempit: Reddit menutup pendaftaran API layan diri pada November 2025 di bawah Responsible Builder Policy-nya, jadi permohonan baharu untuk kelayakan API rasmi kini melalui permintaan kelulusan dan bukannya borang pendaftaran. Kebanyakan pelayan MCP Reddit membalut API rasmi itu, yang kini menjadikan "dapatkan kelayakan" langkah paling sukar dalam persediaan mereka.
reddit_search memintas semuanya. Ia tidak pernah menghantar walau satu permintaan ke reddit.com.
Berkenalan dengan reddit_search
Satu alat, tiga mod:
posts(lalai) — carian kata kunci merentasi tajuk dan selftext post, dengan pilihan skop kepada sesuatu subreddit atau pengarang. Menyokong"quoted phrases",ORdan-exclusion.comments— carian teks penuh merentasi badan komen, sesuatu yang langsung tidak mampu dilakukan oleh API Reddit rasmi.thread— hulurkan ID sesuatu post dan dapatkan post itu berserta pepohon komen bersarangnya, dengan penanda lipat gaya reddit untuk cabang yang terlalu dalam untuk dikembangkan.
Penapis merangkumi subreddit, author, tarikh after/before (ISO 8601, saat epoch, atau ofset seperti "7d"), limit (sehingga 100) dan sort. Hasil dipulangkan dalam bentuk ternormal: permalink reddit.com penuh, tarikh ISO, skor, kiraan komen, dan teks dihadkan pada 2,000 aksara dengan bendera pemotongan supaya muatan 100 hasil kekal mesra kepada tetingkap konteks LLM.
Panggilan tipikal daripada klien MCP kelihatan seperti ini:
{
"tool": "reddit_search",
"arguments": {
"query": "best mcp servers",
"subreddit": "ClaudeAI",
"mode": "posts",
"limit": 10
}
}Ambil mana-mana id post daripada hasil carian, hantarkannya semula sebagai link_id dengan mode: "thread", dan anda memperoleh keseluruhan perbincangan — sedia untuk summarize_content atau analyze_content mengubahnya menjadi sentimen, topik dan taklimat.
Arkib: Arctic Shift dan PullPush
Jika anda masih ingat Pushshift — arkib penyelidikan Reddit yang disayangi dan hilang akses API-nya pada 2023 — dua projek ini ialah penggantinya, dan merekalah yang ditanya oleh reddit_search:
- Arctic Shift menyerap Reddit hampir masa nyata. Semasa ujian langsung ia memulangkan post yang dicipta pada hari yang sama, dan ia menyajikan pepohon komen bersarang yang sebenar. Satu kekangannya yang didokumenkan: carian kata kunci mesti diskopkan kepada sesuatu subreddit atau pengarang.
- PullPush serasi dengan Pushshift dan melakukan apa yang Arctic Shift tidak mahu lakukan — carian teks penuh merentasi seluruh Reddit. Tolak ansurnya: jurang yang didokumenkan dalam arkibnya selepas 2023 dan had kadar yang agresif.
Kedua-duanya percuma, kedua-duanya dikendalikan komuniti, dan kedua-duanya tidak memerlukan kelayakan. Setiap respons menyertakan nota provenans yang menamakan arkib yang menjawab, jadi pengguna hiliran sentiasa tahu dari mana datangnya data itu.
Cara penghalaan berfungsi
Anda tidak perlu memilih backend melainkan anda mahu. Dalam mod auto lalai:
- Carian berskop (penapis
subredditatauauthor) dan bacaan thread pergi ke Arctic Shift — arkib yang lebih segar — dengan PullPush sebagai sandaran khusus ralat sahaja. Apabila sandaran itu digunakan, respons menyatakannya dalam medanfallback_used. - Carian kata kunci tanpa skop merentasi seluruh Reddit pergi ke PullPush, kerana itulah satu-satunya arkib yang menyokongnya.
Paip dalamannya menyerap kerenah arkib: setiap permintaan membawa User-Agent yang mengenal pasti diri (ujian langsung menunjukkan Arctic Shift menghimpunkan klien tanpa nama ke dalam satu baldi had kadar kongsi), respons sekatan kadar sementara mendapat satu percubaan semula terhad, dan mesej had kadar PullPush diteruskan verbatim supaya anda melihat sebab sebenar dan bukannya ralat generik. Pemboleh ubah persekitaran REDDIT_SEARCH_TIMEOUT_MS mengatasi had 30 saat setiap permintaan jika saluran paip anda memerlukan bajet yang berbeza.
Kaveat yang jujur
Data arkib ada tepi-tepinya, dan kami lebih rela mendokumenkannya daripada membiarkan anda menemuinya sendiri:
- Kandungan yang sangat baharu terbaca rendah. Arkib menangkap post sebaik sahaja ia muncul, jadi skor dan kiraan komen kandungan yang berumur kurang ~36 jam sering terbaca 0 atau 1. Kandungannya ada; jumlah undian sahaja yang belum mengejar.
- PullPush ada jurang selepas 2023. Carian tanpa skop yang kosong tidak membuktikan kandungan itu tidak wujud. Skopkan kepada subreddit atau pengarang apabila boleh — ia menghalakan anda ke arkib yang lebih lengkap.
- Kandungan yang dipadam mungkin kekal dalam arkib. Itu sifat semula jadi arkib, dan ia memotong dua arah: itu jugalah sebabnya penyelidik menggunakannya.
Menggunakannya daripada MCP dan REST
Dalam klien MCP — Claude Desktop, Claude Code, Cursor — cukup sekadar minta: "Cari perbincangan tentang infrastruktur scraping di r/webdev dari bulan lalu dan ringkaskan aduan utama." Ejen akan memilih reddit_search, menetapkan skopnya, dan merangkaikan ringkasan itu sendiri.
Daripada REST API, ia satu POST berpengesahan:
const response = await fetch('https://crawlforge.dev/api/v1/tools/reddit_search', {
method: 'POST',
headers: {
'X-API-Key': process.env.CRAWLFORGE_API_KEY!,
'Content-Type': 'application/json',
},
body: JSON.stringify({
query: 'best mechanical keyboard',
subreddit: 'MechanicalKeyboards',
mode: 'posts',
limit: 10,
}),
});
const { data } = await response.json();
console.log(`${data.count} posts via ${data.source}`);Anda juga boleh mencubanya tanpa sebarang persediaan di playground — reddit_search sudah tersedia di sana bersama 27 alat yang lain.
Bagaimana dengan templat thread Reddit
scrape_template masih menyertakan templat reddit-thread, tetapi templat itu menyasarkan reddit.com — tembok yang dielakkan oleh keluaran ini — jadi ia tidak lagi berfungsi dengan boleh dipercayai. Dokumentasi scrape_template kini menyatakan hal itu dengan jelas dan menghalakan kerja Reddit kepada reddit_search. Sembilan templat yang lain (Amazon, GitHub, YouTube, Hacker News dan rakan-rakannya) tidak terjejas.
Turut dihantar sejak v5.0.4
Jika anda terlepas tampalan antara keluaran, v5.0.5 membaiki dua angka yang selama ini dinyatakan salah oleh serp_rank: tamat masa permintaan DataForSEO (kini 120 saat secara lalai, boleh ditala melalui DATAFORSEO_TIMEOUT_MS, kerana scrape Google langsung pada kedalaman 100 lazimnya mengambil 30-60+ saat) dan kos huluan yang didokumenkan (angka lama ialah harga kedalaman 10, 10× lebih rendah daripada apa yang sebenarnya dibilkan oleh lalai kedalaman 100). Ia turut membaiki penyenaraian Smithery, yang kini menerbitkan jadual alatnya daripada pendaftaran langsung dan bukannya kad tulisan tangan. Kisah penuh kitaran pengukuhan v5.0.x ada dalam catatan ujian langsung v5.0.4.
Kos credits
reddit_search berharga 2 credits setiap panggilan — carian mahupun bacaan thread penuh, harga yang sama. Sebagai gambaran skala: 1,000 credits permulaan pelan Free mencukupi untuk 500 carian Reddit, dan satu carian ditambah satu bacaan thread ditambah summarize_content atas hasilnya ialah 8 credits hujung ke hujung. Seperti biasa, permintaan yang gagal tidak dicaj.
Cara menaik taraf
npm install -g crawlforge-mcp-server@latest
crawlforge --version # 5.1.0Atau, jika klien MCP anda melancarkan pelayan dengan npx, ia mengambil 5.1.0 secara automatik pada mulaan semula berikutnya. Tiada skema, bentuk output mahupun kos credits yang berubah pada mana-mana alat sedia ada — keluaran ini boleh terus dinaik taraf.
Sedia untuk melombong perbincangan Reddit tanpa API key? Mulakan percuma dengan 1,000 credits — mencukupi untuk 500 carian — dan baca rujukan API reddit_search untuk setiap parameter dan mod.
Cuba sendiri — tiada pendaftaran diperlukan
Jalankan mana-mana daripada 28 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.
1,000 credits percuma • Sekali sahaja • Tiada kad kredit diperlukan
Tag
Tentang Penulis
Kekal dikemas kini dengan pandangan terkini
Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.
Tiada spam. Berhenti melanggan bila-bila masa.