Registro de cambios
Sigue cada actualización de CrawlForge
La línea 5.6: todo lo que sacó a la luz una pasada completa de los 29 tools y las 18 plantillas contra sitios reales. La corrección principal son los enlaces en línea que desaparecían en páginas cuyo CSS usa anidamiento nativo, con un resultado que parecía una página completa en lugar de un fallo.
- scrape conserva todos los enlaces en línea en páginas que usan anidamiento CSS nativo: una regla anidada se leía como global y borraba 56 de los 68 enlaces de un artículo
- batch_scrape, crawl_deep, generate_llms_txt y track_changes decodifican páginas que no son UTF-8, así que una página ISO-8859-1 ya no llega como mojibake
- La plantilla producthunt-launch vuelve a leer las páginas rediseñadas de Product Hunt, y una plantilla que no extrae nada ahora lo indica en vez de devolver un registro con todos los campos null
La línea 5.5: búsqueda de comentarios en todo Reddit, localization que ahora ejecuta la búsqueda que antes solo describía, y una larga serie de correcciones de precisión, incluidos los ejemplos de código que desaparecían en silencio de las páginas de documentación.
- reddit_search busca comentarios en todo Reddit, y localize_search ya ejecuta la búsqueda
- Cada número que devuelve un LLM se verifica contra el código fuente de la página, o vuelve como null y con un motivo
- Protección SSRF en todas las rutas de navegador y webhook, y el texto de la página aislado antes de llegar a un modelo
Extracción de nivel 2: leer el estado JavaScript que la página ya trae en lugar de su HTML renderizado. Una sola petición, valores exactos, sin LLM de por medio. La misma versión corrigió nueve defectos encontrados al probar las 29 herramientas en sitios reales.
- Nueva extract_embedded_state (2 credits): lee __NEXT_DATA__, payloads de React Server Components, Nuxt y Apollo
- extract_metadata suma un filtro json_ld_types que también reconoce los subtipos
- Cinco operaciones de track_changes que solo devolvían un error ahora funcionan
El trabajo de cumplimiento e identidad: todas las herramientas que hacen peticiones consultan robots.txt, una petición rechazada no cuesta nada, y las peticiones salientes van firmadas para que un sitio pueda verificar que el rastreo vino de CrawlForge.
- Todas las herramientas que hacen peticiones consultan robots.txt, incluidas las dos rutas de stealth que lo esquivaban
- Peticiones salientes firmadas según RFC 9421 (Web Bot Auth), con un directorio de claves público
- Un rechazo por cumplimiento es gratis: ya no consume credits
Una plantilla shopify-product que lee el JSON de la propia tienda en vez de analizar la página renderizada, soporte para Ollama remoto, y los extractores de plantillas separados en su propio paquete npm para que ambas superficies de CrawlForge usen una sola implementación.
- Plantilla shopify-product: precio exacto, precio comparativo y stock por variante, sin analizar HTML
- track_changes califica un cambio de precio real, no cuánto de la página ocupa
- Ollama registrado como proveedor real, eligiendo el mejor modelo instalado
Búsqueda real en Reddit, aunque reddit.com bloquea todas las vías directas que CrawlForge puede tomar. La herramienta nunca toca reddit.com: consulta los archivos mantenidos por la comunidad. Es de uso gratuito y no necesita credenciales.
- reddit_search (2 credits): búsqueda por palabras clave en publicaciones y comentarios, más hilos completos
- Respaldada por los archivos Arctic Shift y PullPush, con un reintento acotado cuando uno se satura
- Resultados normalizados a permalinks reales y fechas ISO, con avisos sobre la frescura del archivo
La versión mayor: refuerzo de SSRF, OAuth, secretos y facturación, 52 correcciones incluida una reescritura de crawl_deep, un transporte streamable-HTTP reconstruido, y las funciones de la especificación MCP que los clientes ya esperaban.
- Salida estructurada (outputSchema) y tareas asíncronas en las herramientas de larga duración
- CRAWLFORGE_TOOLS y CRAWLFORGE_TOOL_GROUPS exponen solo un subconjunto para reducir el contexto
- Cero vulnerabilidades en npm audit y el mínimo de Node elevado a 20.16
El servidor envía instructions de MCP que le indican a cualquier cliente preferir las herramientas de CrawlForge antes que su búsqueda web integrada. Es una recomendación, no una imposición: un MCP server no puede desactivar las herramientas propias del cliente.
- Las instructions de MCP a nivel de servidor llegan a cada cliente en el siguiente arranque, sin reinstalar
- Cuatro descripciones de herramientas reforzadas donde el modelo las lee, en tools/list
- serp_rank devuelve el top 10 orgánico completo junto con las posiciones del dominio
La herramienta número 27. Informa en qué posición aparece realmente un dominio en los resultados orgánicos de Google para una palabra clave — la que una API de búsqueda no puede dar — con DataForSEO y cargado a tu propia cuenta.
- serp_rank (5 credits) devuelve la mejor posición, la URL que rankea y todas las posiciones que ocupa
- Nunca inventa una posición: informa configured:false cuando DataForSEO no está configurado
- Facturación reforzada: una llamada sin costo no emite evento de uso y un error cobra la mitad
Claude Agent Skills que se activan solas, dos controles de seguridad anunciados que en realidad no funcionaban ahora hechos realidad, y monitoreo de cambios que sí se programa.
- Siete Claude Agent Skills con descripciones que las activan automáticamente
- SSRF aplicado en la ruta real de scraping, validando la petición inicial y cada redirección
- Los monitores programados de track_changes persisten y recuperan su línea base al reiniciar