CrawlForge MCP
InicioPlaygroundCasos de usoIntegracionesPreciosDocumentaciónBlog
Cómo scrapear Reddit sin la API (2026)
Tutorials
Volver al blog
Tutoriales

Cómo scrapear Reddit sin la API (2026)

C
CrawlForge Team
Equipo de Ingeniería
24 de agosto de 2026
6 min de lectura

En esta página

Respuesta rápida

No puedes scrapear reddit.com directamente en 2026 — el sitio devuelve 403 a los fetches simples, a old.reddit.com, al truco de URL .json e incluso a los navegadores stealth avanzados. La ruta que funciona son los archivos comunitarios: Arctic Shift (casi en tiempo real, hilos anidados) y PullPush (búsqueda de texto completo). CrawlForge reddit_search envuelve ambos en una sola llamada sin credenciales de Reddit — busca posts, busca comentarios o lee un hilo completo por 2 credits — vía MCP, REST o el playground del navegador.

Todo tutorial que muestra BeautifulSoup apuntando a reddit.com es hoy un documento histórico. Si quieres scrapear Reddit sin la API en 2026, lo primero que hay que saber es que la pelea se ha desplazado: la pregunta ya no es cómo superar las defensas de Reddit sino dónde más vive el dato. Esta guía cubre ambas cosas — por qué fallan las vías directas, y la ruta de archivos que funciona, paso a paso.

Por qué scrapear reddit.com directamente falla

Antes de construir reddit_search, ejecutamos en vivo todas las vías de acceso directo contra reddit.com:

  • Un fetch simple con User-Agent de navegador: 403
  • old.reddit.com (el objetivo "fácil" tradicional): 403
  • El truco clásico de añadir .json a cualquier URL de Reddit: muere contra el mismo muro
  • Una plantilla de scraping reddit-thread construida a propósito: 403
  • stealth_mode con evasión avanzada de fingerprint: 403

El bloqueo tiene capas — reputación de IP de datacenter, fingerprinting TLS evaluado en el handshake y un desafío JavaScript — lo que significa que derrota a tu cliente HTTP antes de que tu código de parsing llegue siquiera a ejecutarse. Ningún selector, cabecera o estrategia de reintentos arregla un 403 a nivel de infraestructura.

La ruta que funciona: archivos comunitarios

El contenido de Reddit se archiva continuamente mediante dos proyectos mantenidos por la comunidad, los sucesores de Pushshift: Arctic Shift (ingesta casi en tiempo real, árboles de comentarios anidados como es debido, búsqueda acotada a un subreddit o autor) y PullPush (búsqueda de texto completo en todo Reddit, con huecos documentados posteriores a 2023). Ambos son gratuitos y no necesitan credenciales.

reddit_search los consulta por ti con enrutamiento automático — las búsquedas acotadas y las lecturas de hilos van al más fresco Arctic Shift, con PullPush como fallback solo ante errores; las búsquedas por palabras clave sin acotar van a PullPush, el único archivo que las admite. Una llamada, salida normalizada, 2 credits, y ni una sola petición a reddit.com.

Paso 1: buscar posts

Desde la API REST, buscar en un subreddit es un único POST autenticado:

Typescript
const response = await fetch('https://crawlforge.dev/api/v1/tools/reddit_search', {
  method: 'POST',
  headers: {
    'X-API-Key': process.env.CRAWLFORGE_API_KEY!,
    'Content-Type': 'application/json',
  },
  body: JSON.stringify({
    query: 'context window',
    subreddit: 'LocalLLaMA',
    mode: 'posts',
    limit: 25,
  }),
});

const { data } = await response.json();
// Each result: title, selftext, score, num_comments, ISO date, permalink

Acota a un subreddit o author siempre que puedas — te enruta al archivo más fresco y completo. En un cliente MCP como Claude Desktop o Cursor no hay código en absoluto: pide "busca en r/LocalLLaMA quejas sobre la ventana de contexto del último mes" y el agente hace esta llamada por su cuenta.

Paso 2: leer un hilo completo

Toma cualquier id de post del paso 1 y pásalo de vuelta como link_id con mode: "thread":

Json
{
  "tool": "reddit_search",
  "arguments": {
    "mode": "thread",
    "link_id": "1vbf4nh",
    "limit": 100
  }
}

Obtienes el post más su árbol de comentarios anidados — puntuaciones, permalinks, marcadores de colapso para las ramas demasiado profundas de expandir — listo para pasarlo a summarize_content o analyze_content.

Paso 3: usa los filtros que importan

  • Fechas: after y before aceptan ISO 8601, segundos epoch u offsets como "7d" — la forma más fácil de construir un monitor semanal.
  • Sintaxis de consulta: "frases entre comillas", OR y -exclusión funcionan en las búsquedas de posts y comentarios.
  • limit: hasta 100. Cada campo de texto está limitado a 2.000 caracteres con un indicador de truncado, así que incluso una página completa de resultados sigue siendo amigable con el LLM.
  • mode: "comments": busca en el cuerpo de los comentarios en lugar de en los posts — a menudo donde viven las opiniones reales.

Hacerlo tú mismo en su lugar

Puedes prescindir de CrawlForge y consultar los archivos directamente — son gratuitos y están abiertamente documentados. Reserva tiempo para lo que el wrapper absorbe por ti: elegir un archivo según la forma de la consulta, la paginación, los reintentos con backoff (Arctic Shift mete a los clientes anónimos en un bucket compartido de throttling, y el mensaje 429 de PullPush indica que no proporciona recursos gratuitos a scrapers automatizados), normalizar dos esquemas de respuesta distintos y gestionar los huecos de cada archivo. Eso es un proyecto de fin de semana razonable para un corpus de investigación, y una mala inversión de tiempo si los datos de Reddit son solo una entrada más de tu producto. La comparación completa de todas las rutas — incluido el proceso de aprobación de la API oficial — está en Alternativas a la API de Reddit que aún funcionan en 2026.

Advertencias honestas

Los datos de archivo tienen aristas: las puntuaciones del contenido con menos de ~36 horas suelen leerse como 0 o 1 (el contenido se captura al instante; los recuentos de votos se ponen al día después), la cobertura de PullPush posterior a 2023 tiene huecos, y el contenido borrado puede persistir — lo cual corta en ambos sentidos, y es exactamente por lo que los investigadores usan los archivos.

Pruébalo en dos minutos

La prueba más rápida no necesita ninguna configuración: reddit_search está en vivo en el playground. Cuando estés listo para integrarlo en un agente o pipeline, empieza gratis con 1.000 credits — 500 búsquedas — y mantén abierta la referencia de la API para conocer cada parámetro.

Pruébalo tú mismo — sin necesidad de registrarte

Ejecuta cualquiera de las 28 herramientas de scraping y extracción de CrawlForge en el playground y luego empieza gratis con 1,000 credits.

1,000 credits gratis • Por única vez • No se requiere tarjeta de crédito

Etiquetas

redditreddit_searchweb scrapingtutorialno api keyMCP

Sobre el autor

C

CrawlForge Team

Equipo de Ingeniería

Construimos el MCP server de web scraping más completo. Creamos herramientas que ayudan a los desarrolladores a extraer, analizar y transformar datos web para aplicaciones de IA.

Mantente al día con los últimos artículos

Recibe tutoriales, novedades del producto y consejos de web scraping en tu bandeja de entrada.

Sin spam. Cancela tu suscripción cuando quieras.

Ponlo en práctica

Prueba las herramientas de CrawlForge en cualquier URL — gratis, sin registro.

En esta página

Frequently Asked Questions

¿Sigue funcionando el truco de .json para scrapear Reddit?+

No. Añadir .json a una URL de Reddit solía devolver la página como datos estructurados, pero esas peticiones ahora chocan con el mismo bloqueo a nivel de infraestructura que cualquier otro scraper: comprobaciones de IP de datacenter, fingerprinting TLS y un desafío JavaScript. En las pruebas en vivo de CrawlForge, tanto los fetches simples como old.reddit.com devolvieron 403 en todos los casos. La ruta que funciona en 2026 es leer archivos comunitarios en lugar de reddit.com.

¿Puedo scrapear Reddit sin ninguna API key en absoluto?+

Sí, consultando directamente los archivos comunitarios Arctic Shift o PullPush — ambos son gratuitos y no necesitan credenciales. El coste es tiempo de ingeniería: tienes que gestionar tú mismo dos esquemas de respuesta distintos, la paginación, el rate limiting y los huecos específicos de cada archivo, y PullPush aplica rate limit explícitamente al tráfico de scraping automatizado. CrawlForge reddit_search envuelve ambos archivos detrás de una única llamada normalizada usando solo una clave de CrawlForge — sin ninguna credencial de Reddit de por medio.

¿Cómo scrapeo todos los comentarios de un hilo de Reddit sin la API?+

Usa reddit_search en modo thread: pasa el ID del post como link_id con mode en "thread" y te devuelve el post más su árbol de comentarios anidados — puntuaciones, permalinks y marcadores de colapso incluidos — obtenido del archivo Arctic Shift en lugar de reddit.com. Una llamada cuesta 2 credits sin importar el tamaño del hilo, y la salida está normalizada y truncada por comentario para seguir siendo utilizable dentro de la ventana de contexto de un LLM.

¿Es legal y fiable scrapear Reddit a través de archivos?+

Los archivos son proyectos de investigación públicos y mantenidos por la comunidad — sucesores de Pushshift, del que la academia dependió durante años — y leerlos no implica ninguna evasión de los términos de servicio frente a reddit.com, ya que ninguna petición toca Reddit en ningún momento. La fiabilidad tiene límites honestos: las puntuaciones de votos se retrasan unas 36 horas en el contenido reciente, y PullPush tiene huecos documentados posteriores a 2023, así que acota las búsquedas a un subreddit o autor cuando la exhaustividad importe.

Artículos relacionados

CrawlForge MCP v5.1.0: busca en Reddit sin la API
Product Updates

CrawlForge MCP v5.1.0: busca en Reddit sin la API

reddit.com bloquea todos nuestros scrapers, así que v5.1.0 lanza reddit_search, nuestra herramienta 28: busca posts y comentarios y lee hilos completos vía archivos comunitarios. Sin API key, sin credenciales, 2 credits.

C
CrawlForge Team
|
24 ago
|
9m
Cómo hacer un análisis de brecha de palabras clave con un MCP server
Tutorials

Cómo hacer un análisis de brecha de palabras clave con un MCP server

Monta un análisis de brecha de palabras clave reproducible con serp_rank y search_web sobre MCP: posiciones orgánicas reales, clasificación del tipo de página de la competencia y las trampas que hacen que casi toda la investigación de keywords esté mal.

C
CrawlForge Team
|
23 ago
|
11m
Cómo usar de verdad CrawlForge MCP en Claude Code
Tutorials

Cómo usar de verdad CrawlForge MCP en Claude Code

¿Instalaste CrawlForge pero Claude nunca lo llama? Los prompts, las reglas de permisos y la configuración de CLAUDE.md que hacen que las MCP tools se disparen de forma fiable en tu terminal.

C
CrawlForge Team
|
13 ago
|
12m

Pie de página

CrawlForge MCP

Web scraping empresarial para agentes de IA. 28 herramientas MCP especializadas diseñadas para desarrolladores modernos que crean sistemas inteligentes.

Producto

  • Funciones
  • Playground
  • Precios
  • Casos de uso
  • Integraciones
  • Alternativas
  • Registro de cambios

Recursos

  • Primeros pasos
  • Referencia de la API
  • Plantillas
  • Guías
  • Blog
  • Glosario
  • Preguntas frecuentes
  • Mapa del sitio

Desarrolladores

  • Protocolo MCP
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

Empresa

  • Acerca de
  • Contacto
  • Privacidad
  • Términos
  • Uso aceptable
  • Cookies

Mantente al día

Recibe las últimas novedades sobre nuevas herramientas y funciones.

Creado con Next.js y el protocolo MCP

© 2025-2026 CrawlForge. Todos los derechos reservados.