En esta página
La mayoría de las guías sobre ejecutar un MCP server de búsqueda web "con un LLM local" se detienen en el comando de instalación. La pregunta más útil es qué modelo acaba usando realmente tu máquina, porque CrawlForge no fija ninguno por código: clasifica los modelos que ya tienes instalados y elige el mejor.
Conviene separar dos trabajos. search_web encuentra páginas; es una llamada a una API de búsqueda y no interviene ningún LLM. El modelo local importa para lo que viene después — extract_with_llm, summarize_content, analyze_content, deep_research. Así que "MCP server de búsqueda web con LLM local" significa en realidad: la búsqueda es remota, la lectura es local.
¿Un MCP server de búsqueda web usa un LLM local por defecto?
CrawlForge sí, sin ninguna configuración. Los providers se registran en un orden de preferencia fijo — openai, anthropic, ollama — pero los dos de nube solo se registran cuando su API key está presente. Ollama no necesita clave, así que en una máquina sin claves configuradas es el único provider registrado y se convierte en el predeterminado.
Define OPENAI_API_KEY y OpenAI pasa por delante de Ollama. Es deliberado: una clave de nube solo está ahí porque alguien la configuró a propósito, así que gana frente a la opción local sin configuración. Define DISABLE_OLLAMA=true para dejar Ollama fuera del todo.
¿Qué modelo local elige CrawlForge?
En este orden:
OLLAMA_DEFAULT_MODELsi está definido — una fijación explícita siempre gana.- Si no, el modelo mejor clasificado que tengas realmente instalado.
- Si no, el primer modelo instalado, sea cual sea.
llama3.2solo cuando no se puede alcanzar Ollama en absoluto — para que el mensaje de error nombre un modelo real y no un marcador de posición.
La lista de instalados sale de un único GET /api/tags contra OLLAMA_BASE_URL (por defecto http://localhost:11434) con tres segundos de tiempo límite, cacheada durante toda la vida del proceso.
El paso 1 es el que muerde. Un OLLAMA_DEFAULT_MODEL olvidado en un .env local anula en silencio todo el ranking, y nada te avisa.
¿Por qué un modelo de 4B supera a uno de 20B?
Porque el ranking está medido, no supuesto. Evaluado sobre tres páginas de producto reales con datos de referencia verificados de forma independiente, contando campos correctos sobre 18:
| Modelo | Puntuación | Tiempo |
|---|---|---|
| gemma3:4b | 18/18 | 1.040 ms |
| gpt-oss:20b | 18/18 | 3.464 ms |
| gemma3:12b | 16/18 | 3.652 ms |
| mistral:7b | 16/18 | 2.377 ms |
| llama3.2 | 16/18 | 1.179 ms |
| qwen2.5:3b | 16/18 | 1.067 ms |
| dolphin-llama3:8b | 12/18 | 6.288 ms |
El número de parámetros no predijo la precisión. gemma3:4b igualó la puntuación del modelo de 20B con aproximadamente un tercio de la latencia, y mantuvo 45/45 en cinco ejecuciones.
Lo interesante son los fallos. llama3.2 — el antiguo predeterminado fijado por código — se inventó un precio anterior en un producto que no lo tiene, en todas y cada una de las ejecuciones. Por eso elegir el mejor modelo instalado sustituyó a fijar uno.
Hay un segundo ranking para otro trabajo. Juzgar afirmaciones — relevancia, agrupación por significado, contradicción — no es extraer, y solo gemma3:12b figura como apto para ello. gemma3:4b, el ganador en extracción, puntuó una página de marketing de Playwright frente a Selenium con un 0,9 de relevancia para un tema de anti-bot. A un modelo ausente de esa lista nunca se le pide que juzgue, porque un modelo que inventa desacuerdos entre fuentes que coinciden es peor que uno que no informa de ninguno.
¿Qué pasa si Ollama no se está ejecutando?
Se sondea una vez. Si el host no responde, el provider de Ollama se da de baja y la selección se vuelve a ejecutar, de modo que una máquina con una clave de nube recurre a ella, y una que no tenga ninguna informa de que no hay provider disponible en lugar de quedarse colgada. Las tools que pueden degradar a extracción por CSS o por palabras clave lo hacen en vez de fallar.
¿Ejecutar el modelo en local hace que la búsqueda sea gratis?
No. La inferencia local no cuesta nada de ejecutar, pero las tools siguen costando credits: search_web 5, summarize_content 4, extract_with_llm 3, analyze_content 3, list_ollama_models 1. La medición se ejecuta antes de elegir provider, así que nunca llega a saber que respondió un modelo local.
Lo que cambia la inferencia local es a dónde van tus datos. Con Ollama, el contenido de las páginas extraídas nunca se envía a un modelo de terceros. Combínalo con provider: "searxng" en search_web y la consulta tampoco sale de tu red — aunque eso es un cambio de privacidad, no de coste.
Pruébalo tú mismo — sin necesidad de registrarte
Ejecuta cualquiera de las 29 herramientas de scraping y extracción de CrawlForge en el playground y luego empieza gratis con 1,000 credits.
1,000 credits gratis • Por única vez • No se requiere tarjeta de crédito
Etiquetas
Sobre el autor
Mantente al día con los últimos artículos
Recibe tutoriales, novedades del producto y consejos de web scraping en tu bandeja de entrada.
Sin spam. Cancela tu suscripción cuando quieras.