7m
Un MCP server dentro de tu producto: cinco decisiones
Diez tools de veintinueve, desactivado por defecto, con la versión fijada y sustituible: la arquitectura detrás de una función de IA que cita páginas que abrió de verdad.
Blog
13 ingeniería de ia
◆7m
Diez tools de veintinueve, desactivado por defecto, con la versión fijada y sustituible: la arquitectura detrás de una función de IA que cita páginas que abrió de verdad.
◆4m
search_web encuentra las páginas; un modelo local de Ollama las lee. CrawlForge elige ese modelo por precisión medida, no por número de parámetros — y uno de 4B gana a uno de 20B.
◆4m
La mayoría de los MCP server "autoalojados" solo ejecutan el proceso en local. CrawlForge puede apuntar search_web a tu propia instancia de SearXNG — y esto es lo que sigue sin ser autoalojado.
◆12m
Every AI crawler that matters in 2026: 31 bots, their robots.txt tokens, and what blocking each one actually costs you. Copy-paste file included.
◆6m
Reddit es donde viven las opiniones sin filtrar, y es el sitio mainstream más hostil para agentes de toda la web. Así es como le das a tu agente de IA una búsqueda en Reddit que realmente funciona — posts, comentarios e hilos completos — a través de una sola herramienta MCP.
◆13m
Un agente de scraping persigue un objetivo, no un selector. Qué significa eso, las tres formas de construir uno, código funcional, los fallos reales y las cuentas en credits.
◆9m
Un estudio de julio de 2026 halló que el 91,8% de los MCP servers auditados no tiene autenticación. Por qué los servidores de scraping filtran credenciales de la nube y cómo evitarlo.
◆11m
Las mejores herramientas de web scraping para agentes de IA en 2026, clasificadas por su preparación para agentes: descubrimiento de herramientas nativo de MCP, esquemas tipados y salida eficiente en tokens.
◆9m
Sin API keys, sin nube, sin que tus datos salgan de tu máquina. Usa extract_with_llm con Ollama local para extraer datos estructurados de cualquier sitio.
◆10m
Aprende cómo funciona el Model Context Protocol, por qué importa para los agentes de IA y cómo construir MCP servers y clientes con diagramas de arquitectura y código.
◆11m
Crea un pipeline de RAG en producción que rastrea sitios web, extrae contenido, divide el texto en fragmentos, genera embeddings y sirve respuestas con generación aumentada por recuperación.
◆14m
Análisis técnico en profundidad de los sistemas de detección anti-bot y de cómo las funciones de modo sigiloso de CrawlForge te ayudan a hacer scraping de sitios web protegidos de forma ética y eficaz.
◆14m
Aprende a recopilar, limpiar y estructurar datos web para entrenar IA. Buenas prácticas para scraping ético, calidad de datos y preparación de fine-tuning de LLM.