Extracción de datos de PDF y documentos
Extrae campos estructurados de PDFs, informes y expedientes sin crear un parser. process_document lee el archivo y extract_with_llm devuelve JSON tipado.
Respuesta rápida
Apunta process_document (2 credits) a una URL o a un archivo PDF para obtener texto, secciones y metadatos, y luego pasa ese texto a extract_with_llm (3 credits) con un esquema JSON para recuperar campos tipados. Unos 5 credits por documento, y la extracción usa por defecto un modelo local de Ollama, así que el contenido se queda en tu máquina.
El problema
Los números críticos viven dentro de PDFs: informes anuales, listas de precios, expedientes regulatorios, artículos de investigación. Copiarlos a mano no escala, y las librerías genéricas de PDF devuelven un muro de texto sin ninguna estructura que puedas consultar.
La solución
process_document de CrawlForge extrae texto, secciones y metadatos de una URL o de un archivo PDF, y extract_with_llm convierte ese texto en la forma JSON exacta que pediste -- ejecutándose por defecto contra Ollama local, así que el contenido de los documentos nunca sale de tu máquina.
Ejemplo de código
// Pull structured fields out of a PDF report
const doc = await mcp.process_document({
source: "https://example.com/2026-annual-report.pdf",
sourceType: "pdf_url",
options: { extractText: true, extractMetadata: true },
});
// Ask for exactly the fields you need, as JSON
const fields = await mcp.extract_with_llm({
content: doc.text,
prompt: "Extract fiscal year, revenue, operating margin, and headcount.",
schema: {
type: "object",
properties: {
fiscalYear: { type: "string" },
revenue: { type: "string" },
operatingMargin: { type: "string" },
headcount: { type: "number" },
},
},
});
console.log(doc.metadata.pageCount);
console.log(fields.data);Herramientas utilizadas
Costo estimado: ~5 credits por documento
Preguntas frecuentes
¿Cómo extraigo datos de un PDF automáticamente?
Apunta process_document a la URL o al archivo PDF para obtener texto, secciones y metadatos, y luego envía ese texto a extract_with_llm con un esquema JSON que describa los campos que quieres. Recuperas JSON tipado en lugar de un muro de texto.
¿El PDF tiene que estar en línea?
No. process_document acepta una URL o una ruta de archivo local mediante sourceType —url, pdf_url, file o pdf_file— y opciones como pageRange y maxPages te permiten procesar solo las páginas que te interesan.
¿Qué modelo usa la extracción?
extract_with_llm usa por defecto un modelo local de Ollama, así que el contenido de los documentos nunca sale de tu máquina. Pasa provider openai o anthropic con la API key correspondiente cuando prefieras un modelo en la nube.
¿Cuánto cuesta la extracción de documentos?
Unos 5 credits por documento: 2 de process_document y 3 de extract_with_llm. El nivel gratuito de 1,000 credits cubre aproximadamente 200 documentos, suficiente para validar el pipeline contra un archivo real antes de mejorar tu plan.
¿Listo para comenzar?
Cada cuenta nueva recibe 1,000 credits gratis. No se requiere tarjeta de crédito.
Comienza gratis con 1,000 credits