En esta página
Busca un MCP server para due diligence y encontrarás servidores de registros mercantiles, una sala de datos virtual y un proveedor de compliance. Todos responden a la misma pregunta: de dónde salen los datos. Este post responde a la otra mitad — qué hace un MCP server de datos web genérico dentro de un proceso de debida diligencia, y cuál es el fallo que debería decidir si te fías de lo que produce.
Qué hace realmente un MCP server para la due diligence
No te entrega una base de datos de debida diligencia. CrawlForge no posee asientos del Registro Mercantil, ni listas de sanciones, ni cuentas depositadas, ni organigramas. Lee las páginas que le indiques.
Lo que aporta es la capa que va por encima de las fuentes: tu agente puede buscar, descargar, analizar y volver a comprobar documentos primarios en la misma sesión en la que redacta el informe, en vez de que tú copies entre una sala de datos, un navegador y una hoja de cálculo. Es una afirmación más estrecha que la de la mayoría de páginas que posicionan para esta frase, y es la honesta. Si necesitas una lista de sanciones con licencia, compra una lista de sanciones.
Qué tool corresponde a cada tarea de la diligencia
| Tarea | Tool | Credits |
|---|---|---|
| Revisar lo publicado sobre una contraparte | deep_research | 10 |
| Leer un PDF de cuentas, memoria anual o contrato | process_document | 2 |
| Extraer campos concretos de una ficha registral | extract_structured | 3 |
| Enumerar todo el sitio web de una filial | map_site → crawl_deep | 2 + 4 |
| Vigilar a una contraparte después de firmar | track_changes | 3 |
Cómo mantener al agente dentro de las fuentes en las que confías
La diligencia depende por completo de la calidad de las fuentes, así que fija la ejecución a los registros y reguladores que citarías de verdad. research_scope.domains admite hasta 10:
{
"research_query": "ACME Holdings Ltd filing history and current directors",
"research_scope": {
"domains": ["find-and-update.company-information.service.gov.uk", "sec.gov"]
},
"max_sources": 10
}Dos trampas de parámetros que conviene conocer antes de la primera llamada: el campo de consulta se llama research_query, no query ni topic, y necesita al menos 10 caracteres. Las claves desconocidas se descartan en silencio, así que enviar topic devuelve un 400 quejándose de que falta research_query — la lista completa de parámetros está en la referencia de la API.
Cuál es el fallo que de verdad importa
Un modelo que devuelve un dato verosímil que nunca estuvo en la página.
En la mayor parte del scraping eso es una molestia. En la debida diligencia es el riesgo entero, porque una fecha de constitución inventada se lee exactamente igual que una real y nada, aguas abajo, la marca. Hemos visto a extract_structured devolver un número de versión que no aparecía en ninguna parte de la página de origen, simplemente porque el modelo prefirió uno que tenía memorizado — el tipo de cosa que solo detectan las pruebas contra sitios reales, nunca una batería de tests.
Así que la propiedad sobre la que hay que diseñar es la trazabilidad, no las promesas de precisión. deep_research devuelve pasajes literales con un source_url en cada hallazgo, en lugar de un resumen sintetizado, lo que significa que cada línea del informe se puede rastrear hasta la página de la que salió. La regla práctica: deja que la extracción con LLM localice el dato, y confírmalo contra el pasaje original o contra el PDF mediante process_document antes de que llegue a nada que firme un socio.
Cuánto cuesta una contraparte
Una ronda realista, con los costes de la tabla anterior:
deep_researchacotado a dos registros — 10- dos documentos pasados por
process_document— 4 - una ficha registral por
extract_structured— 3 - líneas base sobre su página de precios y su sala de prensa para la vigilancia posterior al cierre — 6
Son 23 credits por contraparte, así que los 1.000 credits únicos del plan Free cubren unas 43 de principio a fin antes de que decidas si esto encaja en tu stack.
La vigilancia es la parte que casi nadie aprovecha. track_changes acepta create_baseline una vez y después compare con la periodicidad que quieras, con un selector CSS para acotar el diff a la sección que importa — una tabla de precios o una página de equipo directivo — de modo que un cambio de maquetación no se lea como un cambio material.
Empieza gratis con 1.000 credits y ejecuta la ronda anterior sobre una contraparte real antes de comprometerte a nada.
Pruébalo tú mismo — sin necesidad de registrarte
Ejecuta cualquiera de las 29 herramientas de scraping y extracción de CrawlForge en el playground y luego empieza gratis con 1,000 credits.
1,000 credits gratis • Por única vez • No se requiere tarjeta de crédito
Etiquetas
Sobre el autor
Mantente al día con los últimos artículos
Recibe tutoriales, novedades del producto y consejos de web scraping en tu bandeja de entrada.
Sin spam. Cancela tu suscripción cuando quieras.