Pada halaman ini
Setiap tutorial yang menunjukkan BeautifulSoup dihalakan ke reddit.com kini menjadi dokumen sejarah. Jika anda mahu scrape Reddit tanpa API pada 2026, perkara pertama yang perlu diketahui ialah medan pertarungannya sudah berpindah: soalannya bukan lagi bagaimana menembusi pertahanan Reddit tetapi di mana lagi data itu berada. Panduan ini merangkumi kedua-duanya — mengapa laluan terus gagal, dan laluan arkib yang berfungsi, langkah demi langkah.
Mengapa Scrape reddit.com Secara Terus Gagal
Sebelum membina reddit_search, kami menjalankan setiap laluan akses terus terhadap reddit.com, secara langsung:
fetchbiasa dengan User-Agent pelayar: 403- old.reddit.com (sasaran "mudah" tradisional): 403
- Helah klasik menambahkan
.jsonpada mana-mana URL Reddit: mati di tembok yang sama - Templat scrape reddit-thread yang dibina khusus: 403
stealth_modedengan pengelakan cap jari canggih: 403
Sekatan itu berlapis — reputasi IP pusat data, cap jari TLS yang dinilai semasa handshake, dan cabaran JavaScript — bermakna ia menewaskan klien HTTP anda sebelum kod penghuraian anda sempat berjalan. Tiada selector, header mahupun strategi percubaan semula yang dapat membaiki 403 di peringkat infrastruktur.
Laluan yang Berfungsi: Arkib Komuniti
Kandungan Reddit diarkibkan secara berterusan oleh dua projek kendalian komuniti, pengganti kepada Pushshift: Arctic Shift (penyerapan hampir masa nyata, pepohon komen bersarang yang sebenar, carian berskop kepada subreddit atau pengarang) dan PullPush (carian teks penuh merentasi seluruh Reddit, dengan jurang selepas 2023 yang didokumenkan). Kedua-duanya percuma dan tidak memerlukan kelayakan.
reddit_search menanyakan kedua-duanya untuk anda dengan penghalaan automatik — carian berskop dan bacaan thread pergi ke Arctic Shift yang lebih segar dengan PullPush sebagai sandaran khusus ralat; carian kata kunci tanpa skop pergi ke PullPush, satu-satunya arkib yang menyokongnya. Satu panggilan, output ternormal, 2 credits, dan tiada satu pun permintaan ke reddit.com.
Langkah 1: Cari Post
Daripada REST API, mencari sesuatu subreddit ialah satu POST berpengesahan:
const response = await fetch('https://crawlforge.dev/api/v1/tools/reddit_search', {
method: 'POST',
headers: {
'X-API-Key': process.env.CRAWLFORGE_API_KEY!,
'Content-Type': 'application/json',
},
body: JSON.stringify({
query: 'context window',
subreddit: 'LocalLLaMA',
mode: 'posts',
limit: 25,
}),
});
const { data } = await response.json();
// Each result: title, selftext, score, num_comments, ISO date, permalinkSkopkan kepada subreddit atau author setiap kali boleh — ia menghalakan anda ke arkib yang lebih segar dan lebih lengkap. Dalam klien MCP seperti Claude Desktop atau Cursor, tiada kod langsung: minta "cari aduan tentang context window di r/LocalLLaMA sepanjang bulan lalu" dan ejen membuat panggilan ini sendiri.
Langkah 2: Baca Thread Penuh
Ambil mana-mana id post daripada langkah 1 dan hantarkannya semula sebagai link_id dengan mode: "thread":
{
"tool": "reddit_search",
"arguments": {
"mode": "thread",
"link_id": "1vbf4nh",
"limit": 100
}
}Anda mendapat post itu berserta pepohon komen bersarangnya — skor, permalink, penanda lipat untuk cabang yang terlalu dalam untuk dikembangkan — sedia disuap ke dalam summarize_content atau analyze_content.
Langkah 3: Gunakan Penapis yang Penting
- Tarikh:
afterdanbeforemenerima ISO 8601, saat epoch, atau ofset seperti"7d"— cara paling mudah untuk membina pemantau mingguan. - Sintaks pertanyaan:
"quoted phrases",ORdan-exclusionsemuanya berfungsi dalam carian posts dan comments. limit: sehingga 100. Setiap medan teks dihadkan pada 2,000 aksara dengan bendera pemotongan, jadi satu halaman penuh hasil pun kekal mesra LLM.mode: "comments": mencari badan komen dan bukannya post — selalunya di situlah pendapat sebenar berada.
Melakukannya Sendiri
Anda boleh melangkau CrawlForge dan menanyakan arkib secara terus — kedua-duanya percuma dan didokumenkan secara terbuka. Peruntukkan masa untuk apa yang biasanya diserap oleh pembalut ini: memilih arkib mengikut bentuk pertanyaan, penomboran halaman, percubaan semula dengan backoff (Arctic Shift menyekat klien tanpa nama ke dalam satu baldi kongsi, dan mesej 429 PullPush menyatakan ia tidak menyediakan sumber percuma untuk scraper automatik), menormalkan dua skema respons yang berbeza, dan menangani jurang setiap arkib. Itu projek hujung minggu yang munasabah untuk korpus penyelidikan, dan pembaziran masa jika data Reddit hanyalah satu input kepada produk anda. Perbandingan penuh setiap laluan — termasuk proses kelulusan API rasmi — ada dalam Alternatif API Reddit yang Masih Berfungsi pada 2026.
Kaveat yang Jujur
Data arkib ada tepi-tepinya: skor kandungan yang berumur kurang ~36 jam sering terbaca 0 atau 1 (kandungan ditangkap serta-merta; jumlah undian mengejar kemudian), liputan PullPush selepas 2023 ada jurangnya, dan kandungan yang dipadam mungkin kekal — yang memotong dua arah, dan itulah sebabnya penyelidik menggunakan arkib.
Cuba dalam Dua Minit
Ujian terpantas tidak memerlukan sebarang persediaan: reddit_search sudah tersedia di playground. Apabila anda bersedia menyambungkannya ke dalam ejen atau saluran paip, mulakan percuma dengan 1,000 credits — 500 carian — dan biarkan rujukan API terbuka untuk setiap parameter.
Cuba sendiri — tiada pendaftaran diperlukan
Jalankan mana-mana daripada 28 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.
1,000 credits percuma • Sekali sahaja • Tiada kad kredit diperlukan
Tag
Tentang Penulis
Kekal dikemas kini dengan pandangan terkini
Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.
Tiada spam. Berhenti melanggan bila-bila masa.