En esta página
Todo tutorial que muestra BeautifulSoup apuntando a reddit.com es hoy un documento histórico. Si quieres scrapear Reddit sin la API en 2026, lo primero que hay que saber es que la pelea se ha desplazado: la pregunta ya no es cómo superar las defensas de Reddit sino dónde más vive el dato. Esta guía cubre ambas cosas — por qué fallan las vías directas, y la ruta de archivos que funciona, paso a paso.
Por qué scrapear reddit.com directamente falla
Antes de construir reddit_search, ejecutamos en vivo todas las vías de acceso directo contra reddit.com:
- Un
fetchsimple con User-Agent de navegador: 403 - old.reddit.com (el objetivo "fácil" tradicional): 403
- El truco clásico de añadir
.jsona cualquier URL de Reddit: muere contra el mismo muro - Una plantilla de scraping reddit-thread construida a propósito: 403
stealth_modecon evasión avanzada de fingerprint: 403
El bloqueo tiene capas — reputación de IP de datacenter, fingerprinting TLS evaluado en el handshake y un desafío JavaScript — lo que significa que derrota a tu cliente HTTP antes de que tu código de parsing llegue siquiera a ejecutarse. Ningún selector, cabecera o estrategia de reintentos arregla un 403 a nivel de infraestructura.
La ruta que funciona: archivos comunitarios
El contenido de Reddit se archiva continuamente mediante dos proyectos mantenidos por la comunidad, los sucesores de Pushshift: Arctic Shift (ingesta casi en tiempo real, árboles de comentarios anidados como es debido, búsqueda acotada a un subreddit o autor) y PullPush (búsqueda de texto completo en todo Reddit, con huecos documentados posteriores a 2023). Ambos son gratuitos y no necesitan credenciales.
reddit_search los consulta por ti con enrutamiento automático — las búsquedas acotadas y las lecturas de hilos van al más fresco Arctic Shift, con PullPush como fallback solo ante errores; las búsquedas por palabras clave sin acotar van a PullPush, el único archivo que las admite. Una llamada, salida normalizada, 2 credits, y ni una sola petición a reddit.com.
Paso 1: buscar posts
Desde la API REST, buscar en un subreddit es un único POST autenticado:
const response = await fetch('https://crawlforge.dev/api/v1/tools/reddit_search', {
method: 'POST',
headers: {
'X-API-Key': process.env.CRAWLFORGE_API_KEY!,
'Content-Type': 'application/json',
},
body: JSON.stringify({
query: 'context window',
subreddit: 'LocalLLaMA',
mode: 'posts',
limit: 25,
}),
});
const { data } = await response.json();
// Each result: title, selftext, score, num_comments, ISO date, permalinkAcota a un subreddit o author siempre que puedas — te enruta al archivo más fresco y completo. En un cliente MCP como Claude Desktop o Cursor no hay código en absoluto: pide "busca en r/LocalLLaMA quejas sobre la ventana de contexto del último mes" y el agente hace esta llamada por su cuenta.
Paso 2: leer un hilo completo
Toma cualquier id de post del paso 1 y pásalo de vuelta como link_id con mode: "thread":
{
"tool": "reddit_search",
"arguments": {
"mode": "thread",
"link_id": "1vbf4nh",
"limit": 100
}
}Obtienes el post más su árbol de comentarios anidados — puntuaciones, permalinks, marcadores de colapso para las ramas demasiado profundas de expandir — listo para pasarlo a summarize_content o analyze_content.
Paso 3: usa los filtros que importan
- Fechas:
afterybeforeaceptan ISO 8601, segundos epoch u offsets como"7d"— la forma más fácil de construir un monitor semanal. - Sintaxis de consulta:
"frases entre comillas",ORy-exclusiónfuncionan en las búsquedas de posts y comentarios. limit: hasta 100. Cada campo de texto está limitado a 2.000 caracteres con un indicador de truncado, así que incluso una página completa de resultados sigue siendo amigable con el LLM.mode: "comments": busca en el cuerpo de los comentarios en lugar de en los posts — a menudo donde viven las opiniones reales.
Hacerlo tú mismo en su lugar
Puedes prescindir de CrawlForge y consultar los archivos directamente — son gratuitos y están abiertamente documentados. Reserva tiempo para lo que el wrapper absorbe por ti: elegir un archivo según la forma de la consulta, la paginación, los reintentos con backoff (Arctic Shift mete a los clientes anónimos en un bucket compartido de throttling, y el mensaje 429 de PullPush indica que no proporciona recursos gratuitos a scrapers automatizados), normalizar dos esquemas de respuesta distintos y gestionar los huecos de cada archivo. Eso es un proyecto de fin de semana razonable para un corpus de investigación, y una mala inversión de tiempo si los datos de Reddit son solo una entrada más de tu producto. La comparación completa de todas las rutas — incluido el proceso de aprobación de la API oficial — está en Alternativas a la API de Reddit que aún funcionan en 2026.
Advertencias honestas
Los datos de archivo tienen aristas: las puntuaciones del contenido con menos de ~36 horas suelen leerse como 0 o 1 (el contenido se captura al instante; los recuentos de votos se ponen al día después), la cobertura de PullPush posterior a 2023 tiene huecos, y el contenido borrado puede persistir — lo cual corta en ambos sentidos, y es exactamente por lo que los investigadores usan los archivos.
Pruébalo en dos minutos
La prueba más rápida no necesita ninguna configuración: reddit_search está en vivo en el playground. Cuando estés listo para integrarlo en un agente o pipeline, empieza gratis con 1.000 credits — 500 búsquedas — y mantén abierta la referencia de la API para conocer cada parámetro.
Pruébalo tú mismo — sin necesidad de registrarte
Ejecuta cualquiera de las 28 herramientas de scraping y extracción de CrawlForge en el playground y luego empieza gratis con 1,000 credits.
1,000 credits gratis • Por única vez • No se requiere tarjeta de crédito
Etiquetas
Sobre el autor
Mantente al día con los últimos artículos
Recibe tutoriales, novedades del producto y consejos de web scraping en tu bandeja de entrada.
Sin spam. Cancela tu suscripción cuando quieras.