En esta página
Pregunta a cualquier desarrollador de scrapers cuál es el sitio mainstream más difícil de 2026 y Reddit es una respuesta segura. Lo sabemos bien — reddit.com bloquea todas las vías de acceso directo que tiene CrawlForge, desde un fetch simple hasta un navegador stealth completo. Así que CrawlForge MCP v5.1.0 deja de pelear contra el muro y lo rodea: la nueva herramienta reddit_search — la número 28 — busca posts y comentarios de Reddit y lee hilos enteros a través de archivos mantenidos por la comunidad, sin API key de Reddit, sin app de OAuth y sin credenciales de ningún tipo.
Tabla de contenidos
- Qué incluye v5.1.0
- Por qué reddit.com no se puede scrapear
- Conoce reddit_search
- Los archivos: Arctic Shift y PullPush
- Cómo funciona el enrutamiento
- Advertencias honestas
- Cómo usarlo desde MCP y REST
- ¿Qué pasa con la plantilla de hilos de Reddit?
- También desde v5.0.4
- Coste en credits
- Cómo actualizar
Qué incluye v5.1.0
v5.1.0 es una versión menor y enfocada con un solo titular:
reddit_search— busca posts de Reddit (título + selftext) y comentarios, o lee un post junto con su árbol de comentarios anidados, vía los archivos comunitarios Arctic Shift y PullPush. Tres modos, filtros de alcance, salida normalizada. 2 credits por llamada.- El número de herramientas pasa de 27 a 28, y la ficha del servidor MCP, las instrucciones de herramientas y el prompt de primeros pasos ya conocen a la recién llegada.
- 31 tests unitarios nuevos (1.018 en total en la suite) y 100% de cumplimiento del protocolo MCP en las 28 herramientas, verificado en vivo sobre MCP stdio devolviendo posts reales de r/ClaudeAI.
Por qué reddit.com no se puede scrapear
No recurrimos a los archivos por preferencia — primero medimos el muro. Antes de construir la herramienta ejecutamos todas las vías directas contra reddit.com, en vivo:
fetch_urlcon un User-Agent completo de navegador: 403scrapecontra old.reddit.com: 403scrape_templatecon la plantilla reddit-thread: 403stealth_modeen su nivel más avanzado: 403
El bloqueo tiene capas — primero reputación de IP de datacenter, fingerprinting TLS en el handshake y después un desafío JavaScript — y por eso falla incluso un navegador stealth en un servidor. Y la puerta oficial también se estrechó: Reddit cerró el registro autoservicio de su API en noviembre de 2025 bajo su Responsible Builder Policy, así que las solicitudes nuevas de credenciales oficiales de la API pasan por una petición de aprobación en lugar de un formulario de registro. La mayoría de los servidores MCP de Reddit envuelven esa API oficial, lo que ahora convierte "conseguir credenciales" en el paso más difícil de su configuración.
reddit_search esquiva todo eso. Nunca envía una sola petición a reddit.com.
Conoce reddit_search
Una herramienta, tres modos:
posts(por defecto) — búsqueda por palabras clave en los títulos y el selftext de los posts, opcionalmente acotada a un subreddit o autor. Admite"frases entre comillas",ORy-exclusión.comments— búsqueda de texto completo en el cuerpo de los comentarios, algo que la API oficial de Reddit no puede hacer en absoluto.thread— pásale el ID de un post y obtén el post más su árbol de comentarios anidados, con marcadores de colapso al estilo reddit para las ramas demasiado profundas de expandir.
Los filtros cubren subreddit, author, fechas after/before (ISO 8601, segundos epoch u offsets como "7d"), limit (hasta 100) y sort. Los resultados vuelven normalizados: permalinks completos de reddit.com, fechas ISO, puntuaciones, número de comentarios y texto limitado a 2.000 caracteres con indicadores de truncado, para que una carga de 100 resultados siga siendo amigable con la ventana de contexto de un LLM.
Una llamada típica desde un cliente MCP se ve así:
{
"tool": "reddit_search",
"arguments": {
"query": "best mcp servers",
"subreddit": "ClaudeAI",
"mode": "posts",
"limit": 10
}
}Toma cualquier id de post de los resultados, pásalo de vuelta como link_id con mode: "thread" y tienes la discusión completa — lista para que summarize_content o analyze_content la conviertan en sentimiento, topics y un informe.
Los archivos: Arctic Shift y PullPush
Si recuerdas Pushshift — el querido archivo de investigación de Reddit que perdió su acceso a la API en 2023 — estos dos proyectos son sus sucesores, y son lo que consulta reddit_search:
- Arctic Shift ingiere Reddit casi en tiempo real. Durante las pruebas en vivo devolvió un post creado el mismo día, y sirve árboles de comentarios anidados como es debido. Su única restricción documentada: la búsqueda por palabras clave debe acotarse a un subreddit o autor.
- PullPush es compatible con Pushshift y hace lo que Arctic Shift no hará: búsqueda de texto completo en todo Reddit. Las contrapartidas: huecos documentados en su archivo posterior a 2023 y rate limits agresivos.
Ambos son gratuitos, ambos los mantiene la comunidad y ninguno necesita credenciales. Cada respuesta incluye notas de procedencia que nombran el archivo que respondió, de modo que los consumidores posteriores siempre saben de dónde salieron los datos.
Cómo funciona el enrutamiento
Nunca eliges un backend salvo que quieras. En el modo auto por defecto:
- Las búsquedas acotadas (un filtro de
subredditoauthor) y las lecturas de hilos van a Arctic Shift — el archivo más fresco — con PullPush como fallback solo ante errores. Cuando el fallback se activa, la respuesta lo dice en un campofallback_used. - Las búsquedas por palabras clave sin acotar en todo Reddit van a PullPush, porque es el único archivo que las admite.
La fontanería absorbe las peculiaridades de los archivos: cada petición lleva un User-Agent identificativo (las pruebas en vivo mostraron que Arctic Shift mete a los clientes anónimos en un bucket compartido de throttling), las respuestas transitorias de throttling reciben un único reintento acotado, y los mensajes de rate limit de PullPush pasan tal cual, para que veas el motivo real en lugar de un error genérico. Una variable de entorno REDDIT_SEARCH_TIMEOUT_MS sobreescribe el tope de 30 segundos por petición si tu pipeline necesita otro presupuesto.
Advertencias honestas
Los datos de archivo tienen aristas, y preferimos documentarlas antes que dejar que las descubras tú:
- El contenido muy reciente puntúa bajo. Los archivos capturan los posts en cuanto aparecen, así que las puntuaciones y el número de comentarios del contenido con menos de ~36 horas suelen leerse como 0 o 1. El contenido está ahí; los recuentos de votos aún no se han puesto al día.
- PullPush tiene huecos posteriores a 2023. Una búsqueda sin acotar que vuelve vacía no demuestra que el contenido no exista. Acota a un subreddit o autor cuando puedas — eso te enruta al archivo más completo.
- El contenido borrado puede persistir en los archivos. Es inherente a cómo funcionan los archivos, y corta en ambos sentidos: también es la razón por la que los investigadores los usan.
Cómo usarlo desde MCP y REST
En un cliente MCP — Claude Desktop, Claude Code, Cursor — basta con pedir: "Busca en r/webdev discusiones sobre infraestructura de scraping del último mes y resume las quejas principales." El agente elige reddit_search, la acota y encadena el resumen por su cuenta.
Desde la API REST, es un único POST autenticado:
const response = await fetch('https://crawlforge.dev/api/v1/tools/reddit_search', {
method: 'POST',
headers: {
'X-API-Key': process.env.CRAWLFORGE_API_KEY!,
'Content-Type': 'application/json',
},
body: JSON.stringify({
query: 'best mechanical keyboard',
subreddit: 'MechanicalKeyboards',
mode: 'posts',
limit: 10,
}),
});
const { data } = await response.json();
console.log(`${data.count} posts via ${data.source}`);También puedes probarla sin configurar nada en el playground — reddit_search está en vivo allí junto a las otras 27 herramientas.
¿Qué pasa con la plantilla de hilos de Reddit?
scrape_template sigue incluyendo su plantilla reddit-thread, pero apunta a reddit.com — justo el muro que esta versión rodea — así que ya no funciona de forma fiable. La documentación de scrape_template ahora lo dice exactamente así y dirige el trabajo con Reddit a reddit_search. Las otras nueve plantillas (Amazon, GitHub, YouTube, Hacker News y compañía) no se ven afectadas.
También desde v5.0.4
Si te saltaste el parche entre versiones, v5.0.5 arregló dos números que serp_rank llevaba afirmando mal: el timeout de las peticiones a DataForSEO (ahora 120 segundos por defecto, ajustable vía DATAFORSEO_TIMEOUT_MS, porque los scrapes en vivo de Google a profundidad 100 tardan habitualmente 30-60+ segundos) y el coste upstream documentado (la cifra antigua era el precio de profundidad 10, 10× más bajo de lo que factura realmente el valor por defecto de profundidad 100). También arregló el listado de Smithery, que ahora deriva su tabla de herramientas del registro en vivo en lugar de una ficha escrita a mano. La historia completa del ciclo de endurecimiento v5.0.x está en el post de pruebas en vivo de v5.0.4.
Coste en credits
reddit_search cuesta 2 credits por llamada — búsqueda o lectura completa de un hilo, mismo precio. Para hacerte una idea: los 1.000 credits iniciales del plan Free cubren 500 búsquedas en Reddit, y una búsqueda más una lectura de hilo más summarize_content sobre el resultado son 8 credits de principio a fin. Como siempre, las peticiones fallidas no se cobran.
Cómo actualizar
npm install -g crawlforge-mcp-server@latest
crawlforge --version # 5.1.0O, si tu cliente MCP lanza el servidor con npx, tomará 5.1.0 automáticamente en el siguiente reinicio. Ningún esquema, forma de salida ni coste en credits de las herramientas existentes cambió — es una actualización directa.
¿Listo para minar discusiones de Reddit sin API key? Empieza gratis con 1.000 credits — suficientes para 500 búsquedas — y consulta la referencia de la API de reddit_search para conocer cada parámetro y modo.
Pruébalo tú mismo — sin necesidad de registrarte
Ejecuta cualquiera de las 28 herramientas de scraping y extracción de CrawlForge en el playground y luego empieza gratis con 1,000 credits.
1,000 credits gratis • Por única vez • No se requiere tarjeta de crédito
Etiquetas
Sobre el autor
Mantente al día con los últimos artículos
Recibe tutoriales, novedades del producto y consejos de web scraping en tu bandeja de entrada.
Sin spam. Cancela tu suscripción cuando quieras.