Pada halaman ini
Setiap tutorial yang menunjukkan BeautifulSoup dihalakan ke reddit.com kini menjadi dokumen sejarah. Jika anda mahu scrape Reddit tanpa API pada 2026, perkara pertama yang perlu diketahui ialah medan pertarungannya sudah berpindah: soalannya bukan lagi bagaimana menembusi pertahanan Reddit tetapi di mana lagi data itu berada. Panduan ini merangkumi kedua-duanya — mengapa laluan terus gagal, dan laluan arkib yang berfungsi, langkah demi langkah.
Mengapa Scrape reddit.com Secara Terus Gagal
Sebelum membina reddit_search, kami menjalankan setiap laluan akses terus terhadap reddit.com, secara langsung:
fetchbiasa dengan User-Agent pelayar: 403- old.reddit.com (sasaran "mudah" tradisional): 403
- Helah klasik menambahkan
.jsonpada mana-mana URL Reddit: mati di tembok yang sama - Templat scrape reddit-thread yang dibina khusus: 403
stealth_modedengan pengelakan cap jari canggih: 403
Sekatan itu berlapis — reputasi IP pusat data, cap jari TLS yang dinilai semasa handshake, dan cabaran JavaScript — bermakna ia menewaskan klien HTTP anda sebelum kod penghuraian anda sempat berjalan. Tiada selector, header mahupun strategi percubaan semula yang dapat membaiki 403 di peringkat infrastruktur.
Laluan yang Berfungsi: Arkib Komuniti
Kandungan Reddit diarkibkan secara berterusan oleh dua projek kendalian komuniti, pengganti kepada Pushshift: Arctic Shift (penyerapan hampir masa nyata, pepohon komen bersarang yang sebenar, carian berskop kepada subreddit atau pengarang) dan PullPush (carian teks penuh serasi Pushshift, dengan jurang selepas 2023 yang didokumenkan — tetapi ia berhenti melayan klien automatik pada Ogos 2026). Kedua-duanya percuma dan tidak memerlukan kelayakan.
reddit_search menanyakan kedua-duanya untuk anda dengan penghalaan automatik — carian berskop dan bacaan thread pergi ke Arctic Shift yang lebih segar. Carian kata kunci tanpa skop mengambil laluan yang berbeza: tiada arkib boleh membuat carian kata kunci merentasi seluruh Reddit, jadi carian web terhad tapak mencari post yang sepadan dan ID itu kemudiannya dibaca keluar dari Arctic Shift. PullPush tidak lagi dicuba secara automatik — sejak Ogos 2026 ia menjawab klien automatik dengan 429 atau cabaran Cloudflare — dan kekal tersedia hanya atas permintaan yang eksplisit. Satu panggilan, output ternormal, 5 credits, dan tiada satu pun permintaan ke reddit.com.
Langkah 1: Cari Post
Daripada REST API, mencari sesuatu subreddit ialah satu POST berpengesahan:
const response = await fetch('https://crawlforge.dev/api/v1/tools/reddit_search', {
method: 'POST',
headers: {
'X-API-Key': process.env.CRAWLFORGE_API_KEY!,
'Content-Type': 'application/json',
},
body: JSON.stringify({
query: 'context window',
subreddit: 'LocalLLaMA',
mode: 'posts',
limit: 25,
}),
});
const { data } = await response.json();
// Each result: title, selftext, score, num_comments, ISO date, permalinkSkopkan kepada subreddit atau author setiap kali boleh — ia menghalakan anda ke arkib yang lebih segar dan lebih lengkap. Dalam klien MCP seperti Claude Desktop atau Cursor, tiada kod langsung: minta "cari aduan tentang context window di r/LocalLLaMA sepanjang bulan lalu" dan ejen membuat panggilan ini sendiri.
Langkah 2: Baca Thread Penuh
Ambil mana-mana id post daripada langkah 1 dan hantarkannya semula sebagai link_id dengan mode: "thread":
{
"tool": "reddit_search",
"arguments": {
"mode": "thread",
"link_id": "1vbf4nh",
"limit": 100
}
}Anda mendapat post itu berserta pepohon komen bersarangnya — skor, permalink, penanda lipat untuk cabang yang terlalu dalam untuk dikembangkan — sedia disuap ke dalam summarize_content atau analyze_content.
Langkah 3: Gunakan Penapis yang Penting
- Tarikh:
afterdanbeforemenerima ISO 8601, saat epoch, atau ofset seperti"7d"— cara paling mudah untuk membina pemantau mingguan. Ia digunakan apabila carian diskopkan kepada subreddit atau pengarang; carian kata kunci tanpa skop dilayan oleh penemuan web, yang tidak boleh menapis mengikut tarikh, dan respons menyatakannya dan bukannya memulangkan keputusan yang anda percaya sudah ditapis. - Sintaks pertanyaan:
"quoted phrases",ORdan-exclusionsemuanya berfungsi dalam carian posts dan comments. limit: sehingga 100. Setiap medan teks dihadkan pada 2,000 aksara dengan bendera pemotongan, jadi satu halaman penuh hasil pun kekal mesra LLM.mode: "comments": mencari badan komen dan bukannya post — selalunya di situlah pendapat sebenar berada.
Melakukannya Sendiri
Anda boleh melangkau CrawlForge dan menanyakan arkib secara terus — kedua-duanya percuma dan didokumenkan secara terbuka. Peruntukkan masa untuk apa yang biasanya diserap oleh pembalut ini: memilih arkib mengikut bentuk pertanyaan, penomboran halaman, percubaan semula dengan backoff (Arctic Shift menyekat klien tanpa nama ke dalam satu baldi kongsi, dan mesej 429 PullPush menyatakan ia tidak menyediakan sumber percuma untuk scraper automatik), menormalkan dua skema respons yang berbeza, dan menangani jurang setiap arkib. Itu projek hujung minggu yang munasabah untuk korpus penyelidikan, dan pembaziran masa jika data Reddit hanyalah satu input kepada produk anda. Perbandingan penuh setiap laluan — termasuk proses kelulusan API rasmi — ada dalam Alternatif API Reddit yang Masih Berfungsi pada 2026.
Kaveat yang Jujur
Data arkib ada tepi-tepinya: skor kandungan yang berumur kurang ~36 jam sering terbaca 0 atau 1 (kandungan ditangkap serta-merta; jumlah undian mengejar kemudian), liputan PullPush selepas 2023 ada jurangnya, dan kandungan yang dipadam mungkin kekal — yang memotong dua arah, dan itulah sebabnya penyelidik menggunakan arkib.
Cuba dalam Dua Minit
Ujian terpantas tidak memerlukan sebarang persediaan: reddit_search sudah tersedia di playground. Apabila anda bersedia menyambungkannya ke dalam ejen atau saluran paip, mulakan percuma dengan 1,000 credits — 200 carian — dan biarkan rujukan API terbuka untuk setiap parameter.
Cuba sendiri — tiada pendaftaran diperlukan
Jalankan mana-mana daripada 30 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.
1,000 credits percuma • Sekali sahaja • Tiada kad kredit diperlukan
Tag
Tentang Penulis
Kekal dikemas kini dengan pandangan terkini
Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.
Tiada spam. Berhenti melanggan bila-bila masa.