CrawlForge MCP
InicioPlaygroundCasos de usoIntegracionesPreciosDocumentaciónBlog
MCP server de búsqueda web con LLM local: qué modelo se ejecuta
AI Engineering
Volver al blog
Ingeniería de IA

MCP server de búsqueda web con LLM local: qué modelo se ejecuta

C
CrawlForge Team
Equipo de Ingeniería
31 de agosto de 2026
4 min de lectura

En esta página

Respuesta rápida

CrawlForge es un MCP server de búsqueda web cuyas tools basadas en LLM se ejecutan por defecto sobre un modelo local de Ollama: Ollama no necesita API key, así que en una máquina sin claves de nube es el único provider registrado y pasa a ser el predeterminado. No fija un modelo por código — un OLLAMA_DEFAULT_MODEL explícito gana, y si no, elige el modelo mejor clasificado que tengas instalado; ese ranking está medido, no supuesto. gemma3:4b lo encabeza con 18/18 campos en unos 1.040 ms, superando a gpt-oss:20b en velocidad e igualándolo en precisión. Ejecutarlo en local cambia dónde acaba el contenido de tus páginas, no lo que cuestan las tools: search_web sigue costando 5 credits responda el modelo que responda.

La mayoría de las guías sobre ejecutar un MCP server de búsqueda web "con un LLM local" se detienen en el comando de instalación. La pregunta más útil es qué modelo acaba usando realmente tu máquina, porque CrawlForge no fija ninguno por código: clasifica los modelos que ya tienes instalados y elige el mejor.

Conviene separar dos trabajos. search_web encuentra páginas; es una llamada a una API de búsqueda y no interviene ningún LLM. El modelo local importa para lo que viene después — extract_with_llm, summarize_content, analyze_content, deep_research. Así que "MCP server de búsqueda web con LLM local" significa en realidad: la búsqueda es remota, la lectura es local.

¿Un MCP server de búsqueda web usa un LLM local por defecto?

CrawlForge sí, sin ninguna configuración. Los providers se registran en un orden de preferencia fijo — openai, anthropic, ollama — pero los dos de nube solo se registran cuando su API key está presente. Ollama no necesita clave, así que en una máquina sin claves configuradas es el único provider registrado y se convierte en el predeterminado.

Define OPENAI_API_KEY y OpenAI pasa por delante de Ollama. Es deliberado: una clave de nube solo está ahí porque alguien la configuró a propósito, así que gana frente a la opción local sin configuración. Define DISABLE_OLLAMA=true para dejar Ollama fuera del todo.

¿Qué modelo local elige CrawlForge?

En este orden:

  1. OLLAMA_DEFAULT_MODEL si está definido — una fijación explícita siempre gana.
  2. Si no, el modelo mejor clasificado que tengas realmente instalado.
  3. Si no, el primer modelo instalado, sea cual sea.
  4. llama3.2 solo cuando no se puede alcanzar Ollama en absoluto — para que el mensaje de error nombre un modelo real y no un marcador de posición.

La lista de instalados sale de un único GET /api/tags contra OLLAMA_BASE_URL (por defecto http://localhost:11434) con tres segundos de tiempo límite, cacheada durante toda la vida del proceso.

El paso 1 es el que muerde. Un OLLAMA_DEFAULT_MODEL olvidado en un .env local anula en silencio todo el ranking, y nada te avisa.

¿Por qué un modelo de 4B supera a uno de 20B?

Porque el ranking está medido, no supuesto. Evaluado sobre tres páginas de producto reales con datos de referencia verificados de forma independiente, contando campos correctos sobre 18:

ModeloPuntuaciónTiempo
gemma3:4b18/181.040 ms
gpt-oss:20b18/183.464 ms
gemma3:12b16/183.652 ms
mistral:7b16/182.377 ms
llama3.216/181.179 ms
qwen2.5:3b16/181.067 ms
dolphin-llama3:8b12/186.288 ms

El número de parámetros no predijo la precisión. gemma3:4b igualó la puntuación del modelo de 20B con aproximadamente un tercio de la latencia, y mantuvo 45/45 en cinco ejecuciones.

Lo interesante son los fallos. llama3.2 — el antiguo predeterminado fijado por código — se inventó un precio anterior en un producto que no lo tiene, en todas y cada una de las ejecuciones. Por eso elegir el mejor modelo instalado sustituyó a fijar uno.

Hay un segundo ranking para otro trabajo. Juzgar afirmaciones — relevancia, agrupación por significado, contradicción — no es extraer, y solo gemma3:12b figura como apto para ello. gemma3:4b, el ganador en extracción, puntuó una página de marketing de Playwright frente a Selenium con un 0,9 de relevancia para un tema de anti-bot. A un modelo ausente de esa lista nunca se le pide que juzgue, porque un modelo que inventa desacuerdos entre fuentes que coinciden es peor que uno que no informa de ninguno.

¿Qué pasa si Ollama no se está ejecutando?

Se sondea una vez. Si el host no responde, el provider de Ollama se da de baja y la selección se vuelve a ejecutar, de modo que una máquina con una clave de nube recurre a ella, y una que no tenga ninguna informa de que no hay provider disponible en lugar de quedarse colgada. Las tools que pueden degradar a extracción por CSS o por palabras clave lo hacen en vez de fallar.

¿Ejecutar el modelo en local hace que la búsqueda sea gratis?

No. La inferencia local no cuesta nada de ejecutar, pero las tools siguen costando credits: search_web 5, summarize_content 4, extract_with_llm 3, analyze_content 3, list_ollama_models 1. La medición se ejecuta antes de elegir provider, así que nunca llega a saber que respondió un modelo local.

Lo que cambia la inferencia local es a dónde van tus datos. Con Ollama, el contenido de las páginas extraídas nunca se envía a un modelo de terceros. Combínalo con provider: "searxng" en search_web y la consulta tampoco sale de tu red — aunque eso es un cambio de privacidad, no de coste.

Pruébalo tú mismo — sin necesidad de registrarte

Ejecuta cualquiera de las 29 herramientas de scraping y extracción de CrawlForge en el playground y luego empieza gratis con 1,000 credits.

1,000 credits gratis • Por única vez • No se requiere tarjeta de crédito

Etiquetas

mcpollamalocal llmweb searchextract_with_llmai-engineering

Sobre el autor

C

CrawlForge Team

Equipo de Ingeniería

Construimos el MCP server de web scraping más completo. Creamos herramientas que ayudan a los desarrolladores a extraer, analizar y transformar datos web para aplicaciones de IA.

Mantente al día con los últimos artículos

Recibe tutoriales, novedades del producto y consejos de web scraping en tu bandeja de entrada.

Sin spam. Cancela tu suscripción cuando quieras.

Ponlo en práctica

Prueba las herramientas de CrawlForge en cualquier URL — gratis, sin registro.

En esta página

Frequently Asked Questions

¿Necesito una clave de OpenAI o Anthropic para usar las tools de LLM de CrawlForge?+

No. Ollama se registra sin API key y pasa a ser el provider predeterminado cuando no hay ninguna clave de nube, así que extract_with_llm, summarize_content y analyze_content funcionan en una instalación limpia con Ollama ejecutándose en local y nada más. Una clave de nube es opcional, y configurar una hace que ese provider pase por delante de Ollama.

¿Qué modelo de Ollama debería instalar para CrawlForge?+

gemma3:4b. Obtuvo 18 de 18 campos frente a datos de referencia verificados en unos 1.040 ms — igualando a gpt-oss:20b con un tercio de la latencia — y mantuvo 45/45 en cinco ejecuciones. Si además usas deep_research, añade gemma3:12b: es el único modelo listado hoy como apto para juzgar relevancia y contradicción, y ese papel recae en el ranking de extracción cuando no está.

¿Usar un LLM local reduce el coste en credits?+

No. search_web cuesta 5 credits, summarize_content 4, extract_with_llm 3, analyze_content 3 y list_ollama_models 1, responda el provider que responda. La comprobación de credits envuelve la tool y se ejecuta antes de seleccionar provider, así que no puede saber que el trabajo lo hizo un modelo local. Ejecutarlo en local es un cambio de residencia de los datos, no de facturación.

¿Por qué llama3.2 está mal clasificado si también es el modelo de reserva?+

Son dos papeles distintos. En el ranking de precisión, llama3.2 queda en la parte baja porque se inventó un precio anterior en todas las ejecuciones de un producto que no lo tiene. Aparece por separado como el nombre que se usa cuando no se puede alcanzar Ollama en absoluto — esa vía nunca ejecuta un modelo, solo necesita que el error nombre algo real en lugar de un marcador de posición.

Artículos relacionados

MCP server de búsqueda web autoalojado
AI Engineering

MCP server de búsqueda web autoalojado

La mayoría de los MCP server "autoalojados" solo ejecutan el proceso en local. CrawlForge puede apuntar search_web a tu propia instancia de SearXNG — y esto es lo que sigue sin ser autoalojado.

C
CrawlForge Team
|
28 ago
|
4m
El protocolo MCP explicado: una guía para desarrolladores en 2026
AI Engineering

El protocolo MCP explicado: una guía para desarrolladores en 2026

Aprende cómo funciona el Model Context Protocol, por qué importa para los agentes de IA y cómo construir MCP servers y clientes con diagramas de arquitectura y código.

C
CrawlForge Team
|
27 abr
|
10m
Extrae datos web con LLMs locales (Ollama + CrawlForge)
AI Engineering

Extrae datos web con LLMs locales (Ollama + CrawlForge)

Sin API keys, sin nube, sin que tus datos salgan de tu máquina. Usa extract_with_llm con Ollama local para extraer datos estructurados de cualquier sitio.

C
CrawlForge Team
|
24 may
|
9m

Pie de página

CrawlForge MCP

Web scraping empresarial para agentes de IA. 29 herramientas MCP especializadas diseñadas para desarrolladores modernos que crean sistemas inteligentes.

Producto

  • Funciones
  • Playground
  • Precios
  • Casos de uso
  • Integraciones
  • Alternativas
  • Registro de cambios

Recursos

  • Primeros pasos
  • Referencia de la API
  • Plantillas
  • Guías
  • Blog
  • Glosario
  • Preguntas frecuentes
  • Mapa del sitio

Desarrolladores

  • Protocolo MCP
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

Empresa

  • Acerca de
  • Contacto
  • Privacidad
  • Términos
  • Uso aceptable
  • Cookies

Mantente al día

Recibe las últimas novedades sobre nuevas herramientas y funciones.

Creado con Next.js y el protocolo MCP

© 2025-2026 CrawlForge. Todos los derechos reservados.