CrawlForge MCP
Laman UtamaPlaygroundKes PenggunaanIntegrasiHargaDokumentasiBlog
CrawlForge MCP v5.1.0: cari Reddit tanpa API
Product Updates
Kembali ke Blog
Kemas Kini Produk

CrawlForge MCP v5.1.0: cari Reddit tanpa API

C
CrawlForge Team
Pasukan Kejuruteraan
24 Ogos 2026
9 min bacaan

Pada halaman ini

Jawapan Pantas

CrawlForge MCP v5.1.0 menambah reddit_search, alatnya yang ke-28: cari post dan komen Reddit atau baca thread komen penuh tanpa menyentuh reddit.com, yang menyekat scraper sepenuhnya. Alih-alih API Reddit rasmi yang berpagar kelulusan, ia menanyakan dua arkib komuniti — Arctic Shift (hampir masa nyata, pepohon komen bersarang) dan PullPush (carian teks penuh serasi Pushshift) — jadi ia langsung tidak memerlukan kelayakan Reddit. Tiga mod: posts, comments dan thread. Berharga 2 credits setiap panggilan. Naik taraf dengan npm install -g crawlforge-mcp-server@latest.

Tanya mana-mana pembangun scraper apakah laman arus perdana paling sukar pada 2026, dan Reddit ialah jawapan yang selamat. Kami sendiri tahu — reddit.com menyekat setiap laluan akses terus yang CrawlForge ada, daripada fetch biasa hinggalah pelayar senyap penuh. Jadi CrawlForge MCP v5.1.0 berhenti melawan tembok itu dan memilih jalan keliling: alat reddit_search baharu — alat kami yang ke-28 — mencari post dan komen Reddit serta membaca keseluruhan thread melalui arkib kendalian komuniti, tanpa API key Reddit, tanpa aplikasi OAuth, dan tanpa sebarang kelayakan.

Isi kandungan

  • Apa yang dihantar
  • Mengapa reddit.com tidak boleh di-scrape
  • Berkenalan dengan reddit_search
  • Arkib: Arctic Shift dan PullPush
  • Cara penghalaan berfungsi
  • Kaveat yang jujur
  • Menggunakannya daripada MCP dan REST
  • Bagaimana dengan templat thread Reddit
  • Turut dihantar sejak v5.0.4
  • Kos credits
  • Cara menaik taraf

Apa yang dihantar

v5.1.0 ialah keluaran minor berfokus dengan satu tajuk utama:

  • reddit_search — cari post Reddit (tajuk + selftext) dan komen, atau baca sesuatu post berserta pepohon komen bersarangnya, melalui arkib komuniti Arctic Shift dan PullPush. Tiga mod, penapis berskop, output ternormal. 2 credits setiap panggilan.
  • Jumlah alat meningkat daripada 27 kepada 28, dan kad pelayan MCP, arahan alat serta prom permulaan semuanya mengenali pendatang baharu ini.
  • 31 ujian unit baharu (1,018 kesemuanya dalam suite) dan pematuhan protokol MCP 100% merentasi kesemua 28 alat, disahkan secara langsung melalui MCP stdio yang memulangkan post r/ClaudeAI sebenar.

Mengapa reddit.com tidak boleh di-scrape

Kami tidak memilih arkib kerana citarasa — kami mengukur tembok itu dahulu. Sebelum membina alat ini, kami menjalankan setiap laluan terus terhadap reddit.com, secara langsung:

  • fetch_url dengan User-Agent pelayar penuh: 403
  • scrape terhadap old.reddit.com: 403
  • scrape_template dengan templat reddit-thread: 403
  • stealth_mode pada tahap paling canggihnya: 403

Sekatan itu berlapis — reputasi IP pusat data dahulu, cap jari TLS semasa handshake, kemudian cabaran JavaScript — itulah sebabnya pelayar senyap di atas pelayan pun gagal. Dan pintu rasmi turut menyempit: Reddit menutup pendaftaran API layan diri pada November 2025 di bawah Responsible Builder Policy-nya, jadi permohonan baharu untuk kelayakan API rasmi kini melalui permintaan kelulusan dan bukannya borang pendaftaran. Kebanyakan pelayan MCP Reddit membalut API rasmi itu, yang kini menjadikan "dapatkan kelayakan" langkah paling sukar dalam persediaan mereka.

reddit_search memintas semuanya. Ia tidak pernah menghantar walau satu permintaan ke reddit.com.

Berkenalan dengan reddit_search

Satu alat, tiga mod:

  • posts (lalai) — carian kata kunci merentasi tajuk dan selftext post, dengan pilihan skop kepada sesuatu subreddit atau pengarang. Menyokong "quoted phrases", OR dan -exclusion.
  • comments — carian teks penuh merentasi badan komen, sesuatu yang langsung tidak mampu dilakukan oleh API Reddit rasmi.
  • thread — hulurkan ID sesuatu post dan dapatkan post itu berserta pepohon komen bersarangnya, dengan penanda lipat gaya reddit untuk cabang yang terlalu dalam untuk dikembangkan.

Penapis merangkumi subreddit, author, tarikh after/before (ISO 8601, saat epoch, atau ofset seperti "7d"), limit (sehingga 100) dan sort. Hasil dipulangkan dalam bentuk ternormal: permalink reddit.com penuh, tarikh ISO, skor, kiraan komen, dan teks dihadkan pada 2,000 aksara dengan bendera pemotongan supaya muatan 100 hasil kekal mesra kepada tetingkap konteks LLM.

Panggilan tipikal daripada klien MCP kelihatan seperti ini:

Json
{
  "tool": "reddit_search",
  "arguments": {
    "query": "best mcp servers",
    "subreddit": "ClaudeAI",
    "mode": "posts",
    "limit": 10
  }
}

Ambil mana-mana id post daripada hasil carian, hantarkannya semula sebagai link_id dengan mode: "thread", dan anda memperoleh keseluruhan perbincangan — sedia untuk summarize_content atau analyze_content mengubahnya menjadi sentimen, topik dan taklimat.

Arkib: Arctic Shift dan PullPush

Jika anda masih ingat Pushshift — arkib penyelidikan Reddit yang disayangi dan hilang akses API-nya pada 2023 — dua projek ini ialah penggantinya, dan merekalah yang ditanya oleh reddit_search:

  • Arctic Shift menyerap Reddit hampir masa nyata. Semasa ujian langsung ia memulangkan post yang dicipta pada hari yang sama, dan ia menyajikan pepohon komen bersarang yang sebenar. Satu kekangannya yang didokumenkan: carian kata kunci mesti diskopkan kepada sesuatu subreddit atau pengarang.
  • PullPush serasi dengan Pushshift dan melakukan apa yang Arctic Shift tidak mahu lakukan — carian teks penuh merentasi seluruh Reddit. Tolak ansurnya: jurang yang didokumenkan dalam arkibnya selepas 2023 dan had kadar yang agresif.

Kedua-duanya percuma, kedua-duanya dikendalikan komuniti, dan kedua-duanya tidak memerlukan kelayakan. Setiap respons menyertakan nota provenans yang menamakan arkib yang menjawab, jadi pengguna hiliran sentiasa tahu dari mana datangnya data itu.

Cara penghalaan berfungsi

Anda tidak perlu memilih backend melainkan anda mahu. Dalam mod auto lalai:

  • Carian berskop (penapis subreddit atau author) dan bacaan thread pergi ke Arctic Shift — arkib yang lebih segar — dengan PullPush sebagai sandaran khusus ralat sahaja. Apabila sandaran itu digunakan, respons menyatakannya dalam medan fallback_used.
  • Carian kata kunci tanpa skop merentasi seluruh Reddit pergi ke PullPush, kerana itulah satu-satunya arkib yang menyokongnya.

Paip dalamannya menyerap kerenah arkib: setiap permintaan membawa User-Agent yang mengenal pasti diri (ujian langsung menunjukkan Arctic Shift menghimpunkan klien tanpa nama ke dalam satu baldi had kadar kongsi), respons sekatan kadar sementara mendapat satu percubaan semula terhad, dan mesej had kadar PullPush diteruskan verbatim supaya anda melihat sebab sebenar dan bukannya ralat generik. Pemboleh ubah persekitaran REDDIT_SEARCH_TIMEOUT_MS mengatasi had 30 saat setiap permintaan jika saluran paip anda memerlukan bajet yang berbeza.

Kaveat yang jujur

Data arkib ada tepi-tepinya, dan kami lebih rela mendokumenkannya daripada membiarkan anda menemuinya sendiri:

  • Kandungan yang sangat baharu terbaca rendah. Arkib menangkap post sebaik sahaja ia muncul, jadi skor dan kiraan komen kandungan yang berumur kurang ~36 jam sering terbaca 0 atau 1. Kandungannya ada; jumlah undian sahaja yang belum mengejar.
  • PullPush ada jurang selepas 2023. Carian tanpa skop yang kosong tidak membuktikan kandungan itu tidak wujud. Skopkan kepada subreddit atau pengarang apabila boleh — ia menghalakan anda ke arkib yang lebih lengkap.
  • Kandungan yang dipadam mungkin kekal dalam arkib. Itu sifat semula jadi arkib, dan ia memotong dua arah: itu jugalah sebabnya penyelidik menggunakannya.

Menggunakannya daripada MCP dan REST

Dalam klien MCP — Claude Desktop, Claude Code, Cursor — cukup sekadar minta: "Cari perbincangan tentang infrastruktur scraping di r/webdev dari bulan lalu dan ringkaskan aduan utama." Ejen akan memilih reddit_search, menetapkan skopnya, dan merangkaikan ringkasan itu sendiri.

Daripada REST API, ia satu POST berpengesahan:

Typescript
const response = await fetch('https://crawlforge.dev/api/v1/tools/reddit_search', {
  method: 'POST',
  headers: {
    'X-API-Key': process.env.CRAWLFORGE_API_KEY!,
    'Content-Type': 'application/json',
  },
  body: JSON.stringify({
    query: 'best mechanical keyboard',
    subreddit: 'MechanicalKeyboards',
    mode: 'posts',
    limit: 10,
  }),
});

const { data } = await response.json();
console.log(`${data.count} posts via ${data.source}`);

Anda juga boleh mencubanya tanpa sebarang persediaan di playground — reddit_search sudah tersedia di sana bersama 27 alat yang lain.

Bagaimana dengan templat thread Reddit

scrape_template masih menyertakan templat reddit-thread, tetapi templat itu menyasarkan reddit.com — tembok yang dielakkan oleh keluaran ini — jadi ia tidak lagi berfungsi dengan boleh dipercayai. Dokumentasi scrape_template kini menyatakan hal itu dengan jelas dan menghalakan kerja Reddit kepada reddit_search. Sembilan templat yang lain (Amazon, GitHub, YouTube, Hacker News dan rakan-rakannya) tidak terjejas.

Turut dihantar sejak v5.0.4

Jika anda terlepas tampalan antara keluaran, v5.0.5 membaiki dua angka yang selama ini dinyatakan salah oleh serp_rank: tamat masa permintaan DataForSEO (kini 120 saat secara lalai, boleh ditala melalui DATAFORSEO_TIMEOUT_MS, kerana scrape Google langsung pada kedalaman 100 lazimnya mengambil 30-60+ saat) dan kos huluan yang didokumenkan (angka lama ialah harga kedalaman 10, 10× lebih rendah daripada apa yang sebenarnya dibilkan oleh lalai kedalaman 100). Ia turut membaiki penyenaraian Smithery, yang kini menerbitkan jadual alatnya daripada pendaftaran langsung dan bukannya kad tulisan tangan. Kisah penuh kitaran pengukuhan v5.0.x ada dalam catatan ujian langsung v5.0.4.

Kos credits

reddit_search berharga 2 credits setiap panggilan — carian mahupun bacaan thread penuh, harga yang sama. Sebagai gambaran skala: 1,000 credits permulaan pelan Free mencukupi untuk 500 carian Reddit, dan satu carian ditambah satu bacaan thread ditambah summarize_content atas hasilnya ialah 8 credits hujung ke hujung. Seperti biasa, permintaan yang gagal tidak dicaj.

Cara menaik taraf

Bash
npm install -g crawlforge-mcp-server@latest
crawlforge --version   # 5.1.0

Atau, jika klien MCP anda melancarkan pelayan dengan npx, ia mengambil 5.1.0 secara automatik pada mulaan semula berikutnya. Tiada skema, bentuk output mahupun kos credits yang berubah pada mana-mana alat sedia ada — keluaran ini boleh terus dinaik taraf.

Sedia untuk melombong perbincangan Reddit tanpa API key? Mulakan percuma dengan 1,000 credits — mencukupi untuk 500 carian — dan baca rujukan API reddit_search untuk setiap parameter dan mod.

Cuba sendiri — tiada pendaftaran diperlukan

Jalankan mana-mana daripada 28 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.

1,000 credits percuma • Sekali sahaja • Tiada kad kredit diperlukan

Tag

releasev5.1.0redditreddit_searchMCPweb scrapingchangelog

Tentang Penulis

C

CrawlForge Team

Pasukan Kejuruteraan

Membina MCP server web scraping yang paling menyeluruh. Kami mencipta alatan yang membantu pembangun mengekstrak, menganalisis dan mengubah data web untuk aplikasi AI.

Kekal dikemas kini dengan pandangan terkini

Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.

Tiada spam. Berhenti melanggan bila-bila masa.

Praktikkan ini

Uji alat CrawlForge pada mana-mana URL — percuma, tanpa pendaftaran.

Pada halaman ini

Frequently Asked Questions

Adakah CrawlForge menggunakan API Reddit rasmi untuk reddit_search?+

Tidak. reddit_search tidak pernah menyentuh reddit.com mahupun Reddit Data API rasmi. Ia menanyakan dua arkib kendalian komuniti — Arctic Shift, yang menyerap Reddit hampir masa nyata, dan PullPush, arkib serasi Pushshift — jadi ia tidak memerlukan API key Reddit, aplikasi OAuth mahupun permintaan kelulusan. Perkara itu semakin penting sejak November 2025, apabila Reddit menutup pendaftaran API layan diri dan menjadikan kelayakan rasmi baharu berpagar kelulusan.

Mengapa saya tidak boleh scrape reddit.com secara terus?+

reddit.com menjalankan sekatan berlapis: reputasi IP pusat data, cap jari TLS yang dinilai semasa handshake, dan cabaran JavaScript. CrawlForge mengesahkannya secara langsung — fetch biasa dengan User-Agent pelayar, old.reddit.com, templat scrape reddit-thread, malah stealth_mode pada tahap paling canggihnya semuanya memulangkan 403. Sekatan itu di peringkat infrastruktur, itulah sebabnya reddit_search membaca arkib komuniti dan bukannya melawannya.

Sesegar manakah data Reddit daripada reddit_search?+

Arctic Shift menyerap kandungan hampir masa nyata — semasa ujian langsung ia memulangkan post yang dicipta pada hari yang sama. Satu kaveat: kerana arkib menangkap post sebaik sahaja ia muncul, skor undian dan kiraan komen kandungan yang berumur kurang kira-kira 36 jam sering terbaca 0 atau 1 walaupun kandungannya sendiri boleh dicari sepenuhnya. Setiap respons membawa nota provenans yang menyatakan arkib mana yang menjawab serta ciri kesegarannya.

Bolehkah reddit_search mencari merentasi seluruh Reddit, atau satu subreddit sahaja?+

Kedua-duanya. Pertanyaan kata kunci tanpa skop mencari seluruh Reddit melalui PullPush, yang menyokong carian teks penuh tetapi mempunyai jurang yang didokumenkan dalam arkibnya selepas 2023. Menskopkan carian kepada subreddit atau pengarang menghalakannya ke Arctic Shift, arkib yang lebih segar dan lebih boleh dipercayai, dengan PullPush sebagai sandaran automatik. Untuk hasil yang teliti, utamakan carian berskop apabila anda tahu di mana perbincangan itu berada.

Berapakah kos reddit_search dan bagaimana saya boleh mencubanya?+

reddit_search berharga 2 credits setiap panggilan, sama ada carian posts, carian comments, atau bacaan thread penuh. Permintaan yang gagal tidak pernah dicaj. Pelan Free menyertakan 1,000 credits sekali sahaja — 500 carian — dan alat ini tersedia melalui MCP, REST API di /api/v1/tools/reddit_search, dan playground pelayar tanpa sebarang persediaan. Naik taraf ke v5.1.0 dengan npm install -g crawlforge-mcp-server@latest.

Adakah templat scrape_template reddit-thread masih berfungsi?+

Tidak dengan boleh dipercayai. Templat reddit-thread menyasarkan reddit.com secara terus, yang kini menyekat scraper dengan 403 di peringkat infrastruktur, jadi ia gagal sama seperti setiap laluan terus yang lain. Ia kekal disenaraikan demi keserasian, tetapi dokumentasi kini menghalakan semua pengekstrakan Reddit kepada reddit_search, yang membaca arkib komuniti dan memulangkan jenis data thread ternormal yang sama — post, komen bersarang, skor dan permalink.

Artikel Berkaitan

CrawlForge v5.0.4: 34 pembaikan daripada ujian langsung 27 alat MCP
Product Updates

CrawlForge v5.0.4: 34 pembaikan daripada ujian langsung 27 alat MCP

Empat tampalan dalam sehari: kami menguji secara langsung semua 27 alat MCP dan setiap subarahan CLI terhadap laman sebenar dan membaiki 34 kecacatan.

C
CrawlForge Team
|
20 Ogo
|
10m
CrawlForge v5.0.0: keselamatan, ketepatan, spesifikasi MCP
Product Updates

CrawlForge v5.0.0: keselamatan, ketepatan, spesifikasi MCP

CrawlForge MCP v5.0.0 menghimpunkan pemulihan keselamatan dan ketepatan tujuh fasa: sifar kerentanan npm audit, 914 ujian, dan penggunaan penuh spesifikasi MCP.

C
CrawlForge Team
|
13 Ogo
|
12m
CrawlForge v4.8.0: Claude Skills yang Aktif Secara Automatik
Product Updates

CrawlForge v4.8.0: Claude Skills yang Aktif Secara Automatik

CrawlForge MCP v4.8.0 menghadirkan 7 Claude Agent Skills yang aktif secara automatik untuk 26 alatnya, perlindungan SSRF yang dikuatkuasakan, screenshot yang berfungsi, format branding berasaskan design tokens, dan pemantauan perubahan berjadual terbina dalam.

C
CrawlForge Team
|
28 Jun
|
8m

Footer

CrawlForge MCP

Web scraping gred perusahaan untuk Ejen AI. 28 alat MCP khusus yang direka untuk pembangun moden yang membina sistem pintar.

Produk

  • Ciri
  • Playground
  • Harga
  • Kes Penggunaan
  • Integrasi
  • Alternatif
  • Changelog

Sumber

  • Mula Bekerja
  • Rujukan API
  • Templat
  • Panduan
  • Blog
  • Glosari
  • Soalan Lazim
  • Peta Laman

Pembangun

  • Protokol MCP
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

Syarikat

  • Tentang
  • Hubungi
  • Privasi
  • Terma
  • Penggunaan Boleh Diterima
  • Cookies

Kekal dikemas kini

Dapatkan kemas kini terkini tentang alat dan ciri baharu.

Dibina dengan Next.js dan protokol MCP

© 2025-2026 CrawlForge. Hak cipta terpelihara.