CrawlForge MCP
Laman UtamaPlaygroundKes PenggunaanIntegrasiHargaDokumentasiBlog
Cara Scrape Reddit Tanpa API (2026)
Tutorials
Kembali ke Blog
Tutorial

Cara Scrape Reddit Tanpa API (2026)

C
CrawlForge Team
Pasukan Kejuruteraan
24 Ogos 2026
6 min bacaan

Pada halaman ini

Jawapan Pantas

Anda tidak boleh scrape reddit.com secara terus pada 2026 — laman itu memulangkan 403 kepada fetch biasa, old.reddit.com, helah URL .json, malah pelayar senyap canggih. Laluan yang berfungsi ialah arkib komuniti: Arctic Shift (hampir masa nyata, thread bersarang) dan PullPush (carian teks penuh). CrawlForge reddit_search membalut kedua-duanya dalam satu panggilan tanpa kelayakan Reddit — cari post, cari komen, atau baca thread penuh dengan 2 credits — melalui MCP, REST, atau playground pelayar.

Setiap tutorial yang menunjukkan BeautifulSoup dihalakan ke reddit.com kini menjadi dokumen sejarah. Jika anda mahu scrape Reddit tanpa API pada 2026, perkara pertama yang perlu diketahui ialah medan pertarungannya sudah berpindah: soalannya bukan lagi bagaimana menembusi pertahanan Reddit tetapi di mana lagi data itu berada. Panduan ini merangkumi kedua-duanya — mengapa laluan terus gagal, dan laluan arkib yang berfungsi, langkah demi langkah.

Mengapa Scrape reddit.com Secara Terus Gagal

Sebelum membina reddit_search, kami menjalankan setiap laluan akses terus terhadap reddit.com, secara langsung:

  • fetch biasa dengan User-Agent pelayar: 403
  • old.reddit.com (sasaran "mudah" tradisional): 403
  • Helah klasik menambahkan .json pada mana-mana URL Reddit: mati di tembok yang sama
  • Templat scrape reddit-thread yang dibina khusus: 403
  • stealth_mode dengan pengelakan cap jari canggih: 403

Sekatan itu berlapis — reputasi IP pusat data, cap jari TLS yang dinilai semasa handshake, dan cabaran JavaScript — bermakna ia menewaskan klien HTTP anda sebelum kod penghuraian anda sempat berjalan. Tiada selector, header mahupun strategi percubaan semula yang dapat membaiki 403 di peringkat infrastruktur.

Laluan yang Berfungsi: Arkib Komuniti

Kandungan Reddit diarkibkan secara berterusan oleh dua projek kendalian komuniti, pengganti kepada Pushshift: Arctic Shift (penyerapan hampir masa nyata, pepohon komen bersarang yang sebenar, carian berskop kepada subreddit atau pengarang) dan PullPush (carian teks penuh merentasi seluruh Reddit, dengan jurang selepas 2023 yang didokumenkan). Kedua-duanya percuma dan tidak memerlukan kelayakan.

reddit_search menanyakan kedua-duanya untuk anda dengan penghalaan automatik — carian berskop dan bacaan thread pergi ke Arctic Shift yang lebih segar dengan PullPush sebagai sandaran khusus ralat; carian kata kunci tanpa skop pergi ke PullPush, satu-satunya arkib yang menyokongnya. Satu panggilan, output ternormal, 2 credits, dan tiada satu pun permintaan ke reddit.com.

Langkah 1: Cari Post

Daripada REST API, mencari sesuatu subreddit ialah satu POST berpengesahan:

Typescript
const response = await fetch('https://crawlforge.dev/api/v1/tools/reddit_search', {
  method: 'POST',
  headers: {
    'X-API-Key': process.env.CRAWLFORGE_API_KEY!,
    'Content-Type': 'application/json',
  },
  body: JSON.stringify({
    query: 'context window',
    subreddit: 'LocalLLaMA',
    mode: 'posts',
    limit: 25,
  }),
});

const { data } = await response.json();
// Each result: title, selftext, score, num_comments, ISO date, permalink

Skopkan kepada subreddit atau author setiap kali boleh — ia menghalakan anda ke arkib yang lebih segar dan lebih lengkap. Dalam klien MCP seperti Claude Desktop atau Cursor, tiada kod langsung: minta "cari aduan tentang context window di r/LocalLLaMA sepanjang bulan lalu" dan ejen membuat panggilan ini sendiri.

Langkah 2: Baca Thread Penuh

Ambil mana-mana id post daripada langkah 1 dan hantarkannya semula sebagai link_id dengan mode: "thread":

Json
{
  "tool": "reddit_search",
  "arguments": {
    "mode": "thread",
    "link_id": "1vbf4nh",
    "limit": 100
  }
}

Anda mendapat post itu berserta pepohon komen bersarangnya — skor, permalink, penanda lipat untuk cabang yang terlalu dalam untuk dikembangkan — sedia disuap ke dalam summarize_content atau analyze_content.

Langkah 3: Gunakan Penapis yang Penting

  • Tarikh: after dan before menerima ISO 8601, saat epoch, atau ofset seperti "7d" — cara paling mudah untuk membina pemantau mingguan.
  • Sintaks pertanyaan: "quoted phrases", OR dan -exclusion semuanya berfungsi dalam carian posts dan comments.
  • limit: sehingga 100. Setiap medan teks dihadkan pada 2,000 aksara dengan bendera pemotongan, jadi satu halaman penuh hasil pun kekal mesra LLM.
  • mode: "comments": mencari badan komen dan bukannya post — selalunya di situlah pendapat sebenar berada.

Melakukannya Sendiri

Anda boleh melangkau CrawlForge dan menanyakan arkib secara terus — kedua-duanya percuma dan didokumenkan secara terbuka. Peruntukkan masa untuk apa yang biasanya diserap oleh pembalut ini: memilih arkib mengikut bentuk pertanyaan, penomboran halaman, percubaan semula dengan backoff (Arctic Shift menyekat klien tanpa nama ke dalam satu baldi kongsi, dan mesej 429 PullPush menyatakan ia tidak menyediakan sumber percuma untuk scraper automatik), menormalkan dua skema respons yang berbeza, dan menangani jurang setiap arkib. Itu projek hujung minggu yang munasabah untuk korpus penyelidikan, dan pembaziran masa jika data Reddit hanyalah satu input kepada produk anda. Perbandingan penuh setiap laluan — termasuk proses kelulusan API rasmi — ada dalam Alternatif API Reddit yang Masih Berfungsi pada 2026.

Kaveat yang Jujur

Data arkib ada tepi-tepinya: skor kandungan yang berumur kurang ~36 jam sering terbaca 0 atau 1 (kandungan ditangkap serta-merta; jumlah undian mengejar kemudian), liputan PullPush selepas 2023 ada jurangnya, dan kandungan yang dipadam mungkin kekal — yang memotong dua arah, dan itulah sebabnya penyelidik menggunakan arkib.

Cuba dalam Dua Minit

Ujian terpantas tidak memerlukan sebarang persediaan: reddit_search sudah tersedia di playground. Apabila anda bersedia menyambungkannya ke dalam ejen atau saluran paip, mulakan percuma dengan 1,000 credits — 500 carian — dan biarkan rujukan API terbuka untuk setiap parameter.

Cuba sendiri — tiada pendaftaran diperlukan

Jalankan mana-mana daripada 28 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.

1,000 credits percuma • Sekali sahaja • Tiada kad kredit diperlukan

Tag

redditreddit_searchweb scrapingtutorialno api keyMCP

Tentang Penulis

C

CrawlForge Team

Pasukan Kejuruteraan

Membina MCP server web scraping yang paling menyeluruh. Kami mencipta alatan yang membantu pembangun mengekstrak, menganalisis dan mengubah data web untuk aplikasi AI.

Kekal dikemas kini dengan pandangan terkini

Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.

Tiada spam. Berhenti melanggan bila-bila masa.

Praktikkan ini

Uji alat CrawlForge pada mana-mana URL — percuma, tanpa pendaftaran.

Pada halaman ini

Frequently Asked Questions

Adakah helah .json masih berfungsi untuk scrape Reddit?+

Tidak. Menambahkan .json pada URL Reddit dahulunya memulangkan halaman sebagai data berstruktur, tetapi permintaan itu kini melanggar sekatan peringkat infrastruktur yang sama seperti setiap scraper lain: semakan IP pusat data, cap jari TLS, dan cabaran JavaScript. Dalam ujian langsung CrawlForge, fetch biasa dan old.reddit.com kedua-duanya memulangkan 403 tanpa pengecualian. Laluan yang berfungsi pada 2026 ialah membaca arkib komuniti dan bukannya reddit.com.

Bolehkah saya scrape Reddit tanpa sebarang API key langsung?+

Ya, dengan menanyakan arkib komuniti Arctic Shift atau PullPush secara terus — kedua-duanya percuma dan tanpa kelayakan. Kosnya ialah masa kejuruteraan: anda mesti menangani dua skema respons yang berbeza, penomboran halaman, had kadar, dan jurang khusus setiap arkib sendiri, dan PullPush secara eksplisit mengenakan had kadar terhadap trafik scraping automatik. CrawlForge reddit_search membalut kedua-dua arkib di sebalik satu panggilan ternormal menggunakan kunci CrawlForge sahaja — tiada kelayakan Reddit terlibat.

Bagaimana saya scrape semua komen daripada sesuatu thread Reddit tanpa API?+

Gunakan reddit_search dalam mod thread: hantarkan ID post sebagai link_id dengan mode ditetapkan kepada "thread" dan ia memulangkan post itu berserta pepohon komen bersarangnya — skor, permalink dan penanda lipat disertakan — bersumberkan arkib Arctic Shift dan bukannya reddit.com. Satu panggilan berharga 2 credits tanpa mengira saiz thread, dan outputnya dinormalkan dan dipotong setiap komen supaya kekal berguna dalam tetingkap konteks LLM.

Adakah scrape Reddit melalui arkib sah dan boleh dipercayai?+

Arkib itu ialah projek penyelidikan awam kendalian komuniti — pengganti kepada Pushshift, yang menjadi sandaran dunia akademik bertahun-tahun lamanya — dan membacanya tidak melibatkan sebarang pengelakan terma perkhidmatan terhadap reddit.com, kerana tiada permintaan yang pernah menyentuh Reddit. Kebolehpercayaannya ada had yang jujur: skor undian ketinggalan kira-kira 36 jam pada kandungan baharu, dan PullPush mempunyai jurang selepas 2023 yang didokumenkan, jadi skopkan carian kepada subreddit atau pengarang apabila kelengkapan penting.

Artikel Berkaitan

CrawlForge MCP v5.1.0: cari Reddit tanpa API
Product Updates

CrawlForge MCP v5.1.0: cari Reddit tanpa API

reddit.com menyekat setiap scraper kami — jadi v5.1.0 menghantar reddit_search, alat ke-28 yang mencari post dan komen serta membaca thread penuh melalui arkib komuniti. Tanpa API key Reddit, tanpa kelayakan, 2 credits.

C
CrawlForge Team
|
24 Ogo
|
9m
Cara menjalankan analisis jurang kata kunci dengan MCP server
Tutorials

Cara menjalankan analisis jurang kata kunci dengan MCP server

Bina analisis jurang kata kunci yang boleh dihasilkan semula menggunakan serp_rank dan search_web melalui MCP -- kedudukan organik sebenar, pengelasan jenis halaman pesaing, dan perangkap yang menyebabkan kebanyakan penyelidikan kata kunci tersilap.

C
CrawlForge Team
|
23 Ogo
|
11m
Cara Sebenar Menggunakan CrawlForge MCP dalam Claude Code
Tutorials

Cara Sebenar Menggunakan CrawlForge MCP dalam Claude Code

Sudah pasang CrawlForge tetapi Claude tidak pernah memanggilnya? Prompt, peraturan kebenaran dan konfigurasi CLAUDE.md yang membuatkan MCP tools berfungsi dengan konsisten dalam terminal anda.

C
CrawlForge Team
|
13 Ogo
|
12m

Footer

CrawlForge MCP

Web scraping gred perusahaan untuk Ejen AI. 28 alat MCP khusus yang direka untuk pembangun moden yang membina sistem pintar.

Produk

  • Ciri
  • Playground
  • Harga
  • Kes Penggunaan
  • Integrasi
  • Alternatif
  • Changelog

Sumber

  • Mula Bekerja
  • Rujukan API
  • Templat
  • Panduan
  • Blog
  • Glosari
  • Soalan Lazim
  • Peta Laman

Pembangun

  • Protokol MCP
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

Syarikat

  • Tentang
  • Hubungi
  • Privasi
  • Terma
  • Penggunaan Boleh Diterima
  • Cookies

Kekal dikemas kini

Dapatkan kemas kini terkini tentang alat dan ciri baharu.

Dibina dengan Next.js dan protokol MCP

© 2025-2026 CrawlForge. Hak cipta terpelihara.