CrawlForge MCP
InicioPlaygroundCasos de usoIntegracionesPreciosDocumentaciónBlog
CrawlForge MCP v5.1.0: busca en Reddit sin la API
Product Updates
Volver al blog
Novedades del producto

CrawlForge MCP v5.1.0: busca en Reddit sin la API

C
CrawlForge Team
Equipo de Ingeniería
24 de agosto de 2026
9 min de lectura

En esta página

Respuesta rápida

CrawlForge MCP v5.1.0 añade reddit_search, su herramienta número 28: busca posts y comentarios de Reddit o lee un hilo de comentarios completo sin tocar reddit.com, que bloquea los scrapers de plano. En lugar de la API oficial de Reddit, cerrada tras una puerta de aprobación, consulta dos archivos comunitarios — Arctic Shift (casi en tiempo real, árboles de comentarios anidados) y PullPush (búsqueda de texto completo compatible con Pushshift) — así que no necesita ninguna credencial de Reddit. Tres modos: posts, comments y thread. Cuesta 2 credits por llamada. Actualiza con npm install -g crawlforge-mcp-server@latest.

Pregunta a cualquier desarrollador de scrapers cuál es el sitio mainstream más difícil de 2026 y Reddit es una respuesta segura. Lo sabemos bien — reddit.com bloquea todas las vías de acceso directo que tiene CrawlForge, desde un fetch simple hasta un navegador stealth completo. Así que CrawlForge MCP v5.1.0 deja de pelear contra el muro y lo rodea: la nueva herramienta reddit_search — la número 28 — busca posts y comentarios de Reddit y lee hilos enteros a través de archivos mantenidos por la comunidad, sin API key de Reddit, sin app de OAuth y sin credenciales de ningún tipo.

Tabla de contenidos

  • Qué incluye v5.1.0
  • Por qué reddit.com no se puede scrapear
  • Conoce reddit_search
  • Los archivos: Arctic Shift y PullPush
  • Cómo funciona el enrutamiento
  • Advertencias honestas
  • Cómo usarlo desde MCP y REST
  • ¿Qué pasa con la plantilla de hilos de Reddit?
  • También desde v5.0.4
  • Coste en credits
  • Cómo actualizar

Qué incluye v5.1.0

v5.1.0 es una versión menor y enfocada con un solo titular:

  • reddit_search — busca posts de Reddit (título + selftext) y comentarios, o lee un post junto con su árbol de comentarios anidados, vía los archivos comunitarios Arctic Shift y PullPush. Tres modos, filtros de alcance, salida normalizada. 2 credits por llamada.
  • El número de herramientas pasa de 27 a 28, y la ficha del servidor MCP, las instrucciones de herramientas y el prompt de primeros pasos ya conocen a la recién llegada.
  • 31 tests unitarios nuevos (1.018 en total en la suite) y 100% de cumplimiento del protocolo MCP en las 28 herramientas, verificado en vivo sobre MCP stdio devolviendo posts reales de r/ClaudeAI.

Por qué reddit.com no se puede scrapear

No recurrimos a los archivos por preferencia — primero medimos el muro. Antes de construir la herramienta ejecutamos todas las vías directas contra reddit.com, en vivo:

  • fetch_url con un User-Agent completo de navegador: 403
  • scrape contra old.reddit.com: 403
  • scrape_template con la plantilla reddit-thread: 403
  • stealth_mode en su nivel más avanzado: 403

El bloqueo tiene capas — primero reputación de IP de datacenter, fingerprinting TLS en el handshake y después un desafío JavaScript — y por eso falla incluso un navegador stealth en un servidor. Y la puerta oficial también se estrechó: Reddit cerró el registro autoservicio de su API en noviembre de 2025 bajo su Responsible Builder Policy, así que las solicitudes nuevas de credenciales oficiales de la API pasan por una petición de aprobación en lugar de un formulario de registro. La mayoría de los servidores MCP de Reddit envuelven esa API oficial, lo que ahora convierte "conseguir credenciales" en el paso más difícil de su configuración.

reddit_search esquiva todo eso. Nunca envía una sola petición a reddit.com.

Conoce reddit_search

Una herramienta, tres modos:

  • posts (por defecto) — búsqueda por palabras clave en los títulos y el selftext de los posts, opcionalmente acotada a un subreddit o autor. Admite "frases entre comillas", OR y -exclusión.
  • comments — búsqueda de texto completo en el cuerpo de los comentarios, algo que la API oficial de Reddit no puede hacer en absoluto.
  • thread — pásale el ID de un post y obtén el post más su árbol de comentarios anidados, con marcadores de colapso al estilo reddit para las ramas demasiado profundas de expandir.

Los filtros cubren subreddit, author, fechas after/before (ISO 8601, segundos epoch u offsets como "7d"), limit (hasta 100) y sort. Los resultados vuelven normalizados: permalinks completos de reddit.com, fechas ISO, puntuaciones, número de comentarios y texto limitado a 2.000 caracteres con indicadores de truncado, para que una carga de 100 resultados siga siendo amigable con la ventana de contexto de un LLM.

Una llamada típica desde un cliente MCP se ve así:

Json
{
  "tool": "reddit_search",
  "arguments": {
    "query": "best mcp servers",
    "subreddit": "ClaudeAI",
    "mode": "posts",
    "limit": 10
  }
}

Toma cualquier id de post de los resultados, pásalo de vuelta como link_id con mode: "thread" y tienes la discusión completa — lista para que summarize_content o analyze_content la conviertan en sentimiento, topics y un informe.

Los archivos: Arctic Shift y PullPush

Si recuerdas Pushshift — el querido archivo de investigación de Reddit que perdió su acceso a la API en 2023 — estos dos proyectos son sus sucesores, y son lo que consulta reddit_search:

  • Arctic Shift ingiere Reddit casi en tiempo real. Durante las pruebas en vivo devolvió un post creado el mismo día, y sirve árboles de comentarios anidados como es debido. Su única restricción documentada: la búsqueda por palabras clave debe acotarse a un subreddit o autor.
  • PullPush es compatible con Pushshift y hace lo que Arctic Shift no hará: búsqueda de texto completo en todo Reddit. Las contrapartidas: huecos documentados en su archivo posterior a 2023 y rate limits agresivos.

Ambos son gratuitos, ambos los mantiene la comunidad y ninguno necesita credenciales. Cada respuesta incluye notas de procedencia que nombran el archivo que respondió, de modo que los consumidores posteriores siempre saben de dónde salieron los datos.

Cómo funciona el enrutamiento

Nunca eliges un backend salvo que quieras. En el modo auto por defecto:

  • Las búsquedas acotadas (un filtro de subreddit o author) y las lecturas de hilos van a Arctic Shift — el archivo más fresco — con PullPush como fallback solo ante errores. Cuando el fallback se activa, la respuesta lo dice en un campo fallback_used.
  • Las búsquedas por palabras clave sin acotar en todo Reddit van a PullPush, porque es el único archivo que las admite.

La fontanería absorbe las peculiaridades de los archivos: cada petición lleva un User-Agent identificativo (las pruebas en vivo mostraron que Arctic Shift mete a los clientes anónimos en un bucket compartido de throttling), las respuestas transitorias de throttling reciben un único reintento acotado, y los mensajes de rate limit de PullPush pasan tal cual, para que veas el motivo real en lugar de un error genérico. Una variable de entorno REDDIT_SEARCH_TIMEOUT_MS sobreescribe el tope de 30 segundos por petición si tu pipeline necesita otro presupuesto.

Advertencias honestas

Los datos de archivo tienen aristas, y preferimos documentarlas antes que dejar que las descubras tú:

  • El contenido muy reciente puntúa bajo. Los archivos capturan los posts en cuanto aparecen, así que las puntuaciones y el número de comentarios del contenido con menos de ~36 horas suelen leerse como 0 o 1. El contenido está ahí; los recuentos de votos aún no se han puesto al día.
  • PullPush tiene huecos posteriores a 2023. Una búsqueda sin acotar que vuelve vacía no demuestra que el contenido no exista. Acota a un subreddit o autor cuando puedas — eso te enruta al archivo más completo.
  • El contenido borrado puede persistir en los archivos. Es inherente a cómo funcionan los archivos, y corta en ambos sentidos: también es la razón por la que los investigadores los usan.

Cómo usarlo desde MCP y REST

En un cliente MCP — Claude Desktop, Claude Code, Cursor — basta con pedir: "Busca en r/webdev discusiones sobre infraestructura de scraping del último mes y resume las quejas principales." El agente elige reddit_search, la acota y encadena el resumen por su cuenta.

Desde la API REST, es un único POST autenticado:

Typescript
const response = await fetch('https://crawlforge.dev/api/v1/tools/reddit_search', {
  method: 'POST',
  headers: {
    'X-API-Key': process.env.CRAWLFORGE_API_KEY!,
    'Content-Type': 'application/json',
  },
  body: JSON.stringify({
    query: 'best mechanical keyboard',
    subreddit: 'MechanicalKeyboards',
    mode: 'posts',
    limit: 10,
  }),
});

const { data } = await response.json();
console.log(`${data.count} posts via ${data.source}`);

También puedes probarla sin configurar nada en el playground — reddit_search está en vivo allí junto a las otras 27 herramientas.

¿Qué pasa con la plantilla de hilos de Reddit?

scrape_template sigue incluyendo su plantilla reddit-thread, pero apunta a reddit.com — justo el muro que esta versión rodea — así que ya no funciona de forma fiable. La documentación de scrape_template ahora lo dice exactamente así y dirige el trabajo con Reddit a reddit_search. Las otras nueve plantillas (Amazon, GitHub, YouTube, Hacker News y compañía) no se ven afectadas.

También desde v5.0.4

Si te saltaste el parche entre versiones, v5.0.5 arregló dos números que serp_rank llevaba afirmando mal: el timeout de las peticiones a DataForSEO (ahora 120 segundos por defecto, ajustable vía DATAFORSEO_TIMEOUT_MS, porque los scrapes en vivo de Google a profundidad 100 tardan habitualmente 30-60+ segundos) y el coste upstream documentado (la cifra antigua era el precio de profundidad 10, 10× más bajo de lo que factura realmente el valor por defecto de profundidad 100). También arregló el listado de Smithery, que ahora deriva su tabla de herramientas del registro en vivo en lugar de una ficha escrita a mano. La historia completa del ciclo de endurecimiento v5.0.x está en el post de pruebas en vivo de v5.0.4.

Coste en credits

reddit_search cuesta 2 credits por llamada — búsqueda o lectura completa de un hilo, mismo precio. Para hacerte una idea: los 1.000 credits iniciales del plan Free cubren 500 búsquedas en Reddit, y una búsqueda más una lectura de hilo más summarize_content sobre el resultado son 8 credits de principio a fin. Como siempre, las peticiones fallidas no se cobran.

Cómo actualizar

Bash
npm install -g crawlforge-mcp-server@latest
crawlforge --version   # 5.1.0

O, si tu cliente MCP lanza el servidor con npx, tomará 5.1.0 automáticamente en el siguiente reinicio. Ningún esquema, forma de salida ni coste en credits de las herramientas existentes cambió — es una actualización directa.

¿Listo para minar discusiones de Reddit sin API key? Empieza gratis con 1.000 credits — suficientes para 500 búsquedas — y consulta la referencia de la API de reddit_search para conocer cada parámetro y modo.

Pruébalo tú mismo — sin necesidad de registrarte

Ejecuta cualquiera de las 28 herramientas de scraping y extracción de CrawlForge en el playground y luego empieza gratis con 1,000 credits.

1,000 credits gratis • Por única vez • No se requiere tarjeta de crédito

Etiquetas

releasev5.1.0redditreddit_searchMCPweb scrapingchangelog

Sobre el autor

C

CrawlForge Team

Equipo de Ingeniería

Construimos el MCP server de web scraping más completo. Creamos herramientas que ayudan a los desarrolladores a extraer, analizar y transformar datos web para aplicaciones de IA.

Mantente al día con los últimos artículos

Recibe tutoriales, novedades del producto y consejos de web scraping en tu bandeja de entrada.

Sin spam. Cancela tu suscripción cuando quieras.

Ponlo en práctica

Prueba las herramientas de CrawlForge en cualquier URL — gratis, sin registro.

En esta página

Frequently Asked Questions

¿Usa CrawlForge la API oficial de Reddit para reddit_search?+

No. reddit_search nunca toca reddit.com ni la Data API oficial de Reddit. Consulta dos archivos mantenidos por la comunidad — Arctic Shift, que ingiere Reddit casi en tiempo real, y PullPush, el archivo compatible con Pushshift — así que no necesita API key de Reddit, ni app de OAuth, ni petición de aprobación. Eso importa más desde noviembre de 2025, cuando Reddit cerró el registro autoservicio de su API y dejó las credenciales oficiales nuevas tras una puerta de aprobación.

¿Por qué no puedo simplemente scrapear reddit.com directamente?+

reddit.com ejecuta un bloqueo por capas: reputación de IP de datacenter, fingerprinting TLS evaluado en el handshake y un desafío JavaScript. CrawlForge lo verificó en vivo — un fetch simple con User-Agent de navegador, old.reddit.com, la plantilla de scraping reddit-thread e incluso stealth_mode en su nivel más avanzado devuelven todos 403. El bloqueo es a nivel de infraestructura, y por eso reddit_search lee archivos comunitarios en lugar de pelear contra él.

¿Están al día los datos de Reddit que devuelve reddit_search?+

Arctic Shift ingiere contenido casi en tiempo real — durante las pruebas en vivo devolvió un post creado el mismo día. Una advertencia: como el archivo captura los posts en cuanto aparecen, las puntuaciones de votos y el número de comentarios del contenido con menos de unas 36 horas suelen leerse como 0 o 1, aunque el contenido en sí sea totalmente buscable. Cada respuesta lleva notas de procedencia que indican qué archivo respondió y sus características de frescura.

¿Puede reddit_search buscar en todo Reddit, o solo en un subreddit?+

Ambas cosas. Una consulta por palabras clave sin acotar busca en todo Reddit a través de PullPush, que admite búsqueda de texto completo pero tiene huecos documentados en su archivo posterior a 2023. Acotar la búsqueda a un subreddit o autor la enruta a Arctic Shift, el archivo más fresco y fiable, con PullPush como fallback automático. Para resultados exhaustivos, prefiere las búsquedas acotadas cuando sepas dónde vive la discusión.

¿Cuánto cuesta reddit_search y cómo lo pruebo?+

reddit_search cuesta 2 credits por llamada, ya sea una búsqueda de posts, una búsqueda de comments o una lectura completa de un hilo. Las peticiones fallidas nunca se cobran. El plan Free incluye 1.000 credits por una única vez — 500 búsquedas — y la herramienta está disponible sobre MCP, en la API REST en /api/v1/tools/reddit_search y en el playground del navegador sin configuración. Actualiza a v5.1.0 con npm install -g crawlforge-mcp-server@latest.

¿Sigue funcionando la plantilla reddit-thread de scrape_template?+

No de forma fiable. La plantilla reddit-thread apunta directamente a reddit.com, que ahora bloquea los scrapers con 403 a nivel de infraestructura, así que falla igual que cualquier vía directa. Sigue listada por compatibilidad, pero la documentación dirige ahora toda la extracción de Reddit a reddit_search, que lee los archivos comunitarios y devuelve el mismo tipo de datos de hilo normalizados — post, comentarios anidados, puntuaciones y permalinks.

Artículos relacionados

CrawlForge v5.0.4: 34 arreglos probando en vivo 27 herramientas MCP
Product Updates

CrawlForge v5.0.4: 34 arreglos probando en vivo 27 herramientas MCP

Cuatro parches en un día: probamos en vivo las 27 herramientas MCP y cada subcomando de la CLI contra webs reales y arreglamos los 34 defectos encontrados.

C
CrawlForge Team
|
20 ago
|
10m
CrawlForge v5.0.0: seguridad, corrección y especificación MCP
Product Updates

CrawlForge v5.0.0: seguridad, corrección y especificación MCP

CrawlForge MCP v5.0.0 agrupa una remediación de seguridad y corrección en siete fases: cero vulnerabilidades en npm audit, 914 tests y adopción completa de la especificación MCP.

C
CrawlForge Team
|
13 ago
|
12m
CrawlForge v4.8.0: Claude Skills que se autoactivan
Product Updates

CrawlForge v4.8.0: Claude Skills que se autoactivan

CrawlForge MCP v4.8.0 incluye 7 Claude Agent Skills que se autoactivan para sus 26 herramientas, protección SSRF aplicada de verdad, capturas de pantalla que funcionan, un formato branding de design tokens y monitorización programada de cambios integrada.

C
CrawlForge Team
|
28 jun
|
8m

Pie de página

CrawlForge MCP

Web scraping empresarial para agentes de IA. 28 herramientas MCP especializadas diseñadas para desarrolladores modernos que crean sistemas inteligentes.

Producto

  • Funciones
  • Playground
  • Precios
  • Casos de uso
  • Integraciones
  • Alternativas
  • Registro de cambios

Recursos

  • Primeros pasos
  • Referencia de la API
  • Plantillas
  • Guías
  • Blog
  • Glosario
  • Preguntas frecuentes
  • Mapa del sitio

Desarrolladores

  • Protocolo MCP
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

Empresa

  • Acerca de
  • Contacto
  • Privacidad
  • Términos
  • Uso aceptable
  • Cookies

Mantente al día

Recibe las últimas novedades sobre nuevas herramientas y funciones.

Creado con Next.js y el protocolo MCP

© 2025-2026 CrawlForge. Todos los derechos reservados.