CrawlForge MCP
InicioPlaygroundCasos de usoIntegracionesPreciosDocumentaciónBlog
  1. Inicio/
  2. Casos de uso/
  3. Extracción de datos de PDF y documentos

Extracción de datos de PDF y documentos

Extrae campos estructurados de PDFs, informes y expedientes sin crear un parser. process_document lee el archivo y extract_with_llm devuelve JSON tipado.

Respuesta rápida

Apunta process_document (2 credits) a una URL o a un archivo PDF para obtener texto, secciones y metadatos, y luego pasa ese texto a extract_with_llm (3 credits) con un esquema JSON para recuperar campos tipados. Unos 5 credits por documento, y la extracción usa por defecto un modelo local de Ollama, así que el contenido se queda en tu máquina.

El problema

Los números críticos viven dentro de PDFs: informes anuales, listas de precios, expedientes regulatorios, artículos de investigación. Copiarlos a mano no escala, y las librerías genéricas de PDF devuelven un muro de texto sin ninguna estructura que puedas consultar.

La solución

process_document de CrawlForge extrae texto, secciones y metadatos de una URL o de un archivo PDF, y extract_with_llm convierte ese texto en la forma JSON exacta que pediste -- ejecutándose por defecto contra Ollama local, así que el contenido de los documentos nunca sale de tu máquina.

Ejemplo de código

// Pull structured fields out of a PDF report
const doc = await mcp.process_document({
  source: "https://example.com/2026-annual-report.pdf",
  sourceType: "pdf_url",
  options: { extractText: true, extractMetadata: true },
});

// Ask for exactly the fields you need, as JSON
const fields = await mcp.extract_with_llm({
  content: doc.text,
  prompt: "Extract fiscal year, revenue, operating margin, and headcount.",
  schema: {
    type: "object",
    properties: {
      fiscalYear: { type: "string" },
      revenue: { type: "string" },
      operatingMargin: { type: "string" },
      headcount: { type: "number" },
    },
  },
});

console.log(doc.metadata.pageCount);
console.log(fields.data);

Herramientas utilizadas

process_document2 credits
extract_with_llm3 credits

Costo estimado: ~5 credits por documento

Preguntas frecuentes

¿Cómo extraigo datos de un PDF automáticamente?+

Apunta process_document a la URL o al archivo PDF para obtener texto, secciones y metadatos, y luego envía ese texto a extract_with_llm con un esquema JSON que describa los campos que quieres. Recuperas JSON tipado en lugar de un muro de texto.

¿El PDF tiene que estar en línea?+

No. process_document acepta una URL o una ruta de archivo local mediante sourceType —url, pdf_url, file o pdf_file— y opciones como pageRange y maxPages te permiten procesar solo las páginas que te interesan.

¿Qué modelo usa la extracción?+

extract_with_llm usa por defecto un modelo local de Ollama, así que el contenido de los documentos nunca sale de tu máquina. Pasa provider openai o anthropic con la API key correspondiente cuando prefieras un modelo en la nube.

¿Cuánto cuesta la extracción de documentos?+

Unos 5 credits por documento: 2 de process_document y 3 de extract_with_llm. El nivel gratuito de 1,000 credits cubre aproximadamente 200 documentos, suficiente para validar el pipeline contra un archivo real antes de mejorar tu plan.

¿Listo para comenzar?

Cada cuenta nueva recibe 1,000 credits gratis. No se requiere tarjeta de crédito.

Comienza gratis con 1,000 credits

Casos de uso relacionados

Ingesta de bases de conocimiento RAG
Convierte sitios de documentación en markdown limpio y listo para fragmentar en RAG. Rastrea, elimina el texto repetitivo y resume antes de generar embeddings.
map_site (2 cr)scrape (2 cr)summarize_content (4 cr)
Agentes de investigación en tiempo real
Crea agentes de IA que buscan en la web, sintetizan hallazgos y entregan investigación actualizada. Cada afirmación cita su fuente para que sea verificable.
deep_research (10 cr)search_web (5 cr)

Pie de página

CrawlForge MCP

Web scraping empresarial para agentes de IA. 28 herramientas MCP especializadas diseñadas para desarrolladores modernos que crean sistemas inteligentes.

Producto

  • Funciones
  • Playground
  • Precios
  • Casos de uso
  • Integraciones
  • Alternativas
  • Registro de cambios

Recursos

  • Primeros pasos
  • Referencia de la API
  • Plantillas
  • Guías
  • Blog
  • Glosario
  • Preguntas frecuentes
  • Mapa del sitio

Desarrolladores

  • Protocolo MCP
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

Empresa

  • Acerca de
  • Contacto
  • Privacidad
  • Términos
  • Uso aceptable
  • Cookies

Mantente al día

Recibe las últimas novedades sobre nuevas herramientas y funciones.

Creado con Next.js y el protocolo MCP

© 2025-2026 CrawlForge. Todos los derechos reservados.