Saltar al contenido

Casos de uso

Extrae campos estructurados de PDFs, informes y expedientes sin crear un parser. process_document lee el archivo y extract_with_llm devuelve JSON tipado.
Costo estimado: ~5 credits por documento

01Respuesta rápida

Apunta process_document (2 credits) a una URL o a un archivo PDF para obtener texto, secciones y metadatos, y luego pasa ese texto a extract_with_llm (3 credits) con un esquema JSON para recuperar campos tipados. Unos 5 credits por documento, y la extracción usa por defecto un modelo local de Ollama, así que el contenido se queda en tu máquina.

02El planteamiento

El problema

Los números críticos viven dentro de PDFs: informes anuales, listas de precios, expedientes regulatorios, artículos de investigación. Copiarlos a mano no escala, y las librerías genéricas de PDF devuelven un muro de texto sin ninguna estructura que puedas consultar.

La solución

process_document de CrawlForge extrae texto, secciones y metadatos de una URL o de un archivo PDF, y extract_with_llm convierte ese texto en la forma JSON exacta que pediste -- ejecutándose por defecto contra Ollama local, así que el contenido de los documentos nunca sale de tu máquina.

03En código

Ejemplo de código

pdf-document-extraction.js
// Pull structured fields out of a PDF reportconst doc = await mcp.process_document({  source: "https://example.com/2026-annual-report.pdf",  sourceType: "pdf_url",  options: { extractText: true, extractMetadata: true },}); // Ask for exactly the fields you need, as JSONconst fields = await mcp.extract_with_llm({  content: doc.text,  prompt: "Extract fiscal year, revenue, operating margin, and headcount.",  schema: {    type: "object",    properties: {      fiscalYear: { type: "string" },      revenue: { type: "string" },      operatingMargin: { type: "string" },      headcount: { type: "number" },    },  },}); console.log(doc.metadata.pageCount);console.log(fields.data);

04El pipeline

Herramientas utilizadas

5◆ credits
Costo estimado: ~5 credits por documento
  1. https://…
  2. 01process_document 2 credits
  3. 02extract_with_llm 3 credits
  4. JSON · markdown

05Preguntas

Preguntas frecuentes

01¿Cómo extraigo datos de un PDF automáticamente?

Apunta process_document a la URL o al archivo PDF para obtener texto, secciones y metadatos, y luego envía ese texto a extract_with_llm con un esquema JSON que describa los campos que quieres. Recuperas JSON tipado en lugar de un muro de texto.

02¿El PDF tiene que estar en línea?

No. process_document acepta una URL o una ruta de archivo local mediante sourceType —url, pdf_url, file o pdf_file— y opciones como pageRange y maxPages te permiten procesar solo las páginas que te interesan.

03¿Qué modelo usa la extracción?

extract_with_llm usa por defecto un modelo local de Ollama, así que el contenido de los documentos nunca sale de tu máquina. Pasa provider openai o anthropic con la API key correspondiente cuando prefieras un modelo en la nube.

04¿Cuánto cuesta la extracción de documentos?

Unos 5 credits por documento: 2 de process_document y 3 de extract_with_llm. El nivel gratuito de 1,000 credits cubre aproximadamente 200 documentos, suficiente para validar el pipeline contra un archivo real antes de mejorar tu plan.

Empieza a forjar

¿Listo para comenzar?

Cada cuenta nueva recibe 1,000 credits gratis. No se requiere tarjeta de crédito.