Ingeniería de IA
Crear aplicaciones de IA con datos web.
Un MCP server dentro de tu producto: cinco decisiones
Diez tools de veintinueve, desactivado por defecto, con la versión fijada y sustituible: la arquitectura detrás de una función de IA que cita páginas que abrió de verdad.
MCP server de búsqueda web con LLM local: qué modelo se ejecuta
search_web encuentra las páginas; un modelo local de Ollama las lee. CrawlForge elige ese modelo por precisión medida, no por número de parámetros — y uno de 4B gana a uno de 20B.
MCP server de búsqueda web autoalojado
La mayoría de los MCP server "autoalojados" solo ejecutan el proceso en local. CrawlForge puede apuntar search_web a tu propia instancia de SearXNG — y esto es lo que sigue sin ser autoalojado.
AI Crawler List 2026: Every Bot + Should You Block Them?
Every AI crawler that matters in 2026: 31 bots, their robots.txt tokens, and what blocking each one actually costs you. Copy-paste file included.
Datos de Reddit para agentes de IA: la ruta MCP
Reddit es donde viven las opiniones sin filtrar, y es el sitio mainstream más hostil para agentes de toda la web. Así es como le das a tu agente de IA una búsqueda en Reddit que realmente funciona — posts, comentarios e hilos completos — a través de una sola herramienta MCP.
Agente de scraping: qué es y cómo construir uno
Un agente de scraping persigue un objetivo, no un selector. Qué significa eso, las tres formas de construir uno, código funcional, los fallos reales y las cuentas en credits.
SSRF en MCP servers: por qué los scrapers filtran secretos
Un estudio de julio de 2026 halló que el 91,8% de los MCP servers auditados no tiene autenticación. Por qué los servidores de scraping filtran credenciales de la nube y cómo evitarlo.
Las mejores herramientas de web scraping para agentes de IA en 2026
Las mejores herramientas de web scraping para agentes de IA en 2026, clasificadas por su preparación para agentes: descubrimiento de herramientas nativo de MCP, esquemas tipados y salida eficiente en tokens.
Extrae datos web con LLMs locales (Ollama + CrawlForge)
Sin API keys, sin nube, sin que tus datos salgan de tu máquina. Usa extract_with_llm con Ollama local para extraer datos estructurados de cualquier sitio.
El protocolo MCP explicado: una guía para desarrolladores en 2026
Aprende cómo funciona el Model Context Protocol, por qué importa para los agentes de IA y cómo construir MCP servers y clientes con diagramas de arquitectura y código.
Cómo crear un pipeline de RAG con datos web
Crea un pipeline de RAG en producción que rastrea sitios web, extrae contenido, divide el texto en fragmentos, genera embeddings y sirve respuestas con generación aumentada por recuperación.
Scraping en modo sigiloso: cómo CrawlForge evade la detección anti-bot
Análisis técnico en profundidad de los sistemas de detección anti-bot y de cómo las funciones de modo sigiloso de CrawlForge te ayudan a hacer scraping de sitios web protegidos de forma ética y eficaz.
Web scraping para datos de entrenamiento de IA: guía completa 2026
Aprende a recopilar, limpiar y estructurar datos web para entrenar IA. Buenas prácticas para scraping ético, calidad de datos y preparación de fine-tuning de LLM.