Langkau ke kandungan

Kes Penggunaan

Tarik medan berstruktur daripada PDF, laporan dan pemfailan tanpa membina penghurai. process_document membaca fail itu, extract_with_llm memulangkan JSON bertaip.
Anggaran kos: ~5 credits setiap dokumen

01Jawapan Pantas

Halakan process_document (2 credits) ke URL atau fail PDF untuk mendapatkan teks, bahagian, dan metadata, kemudian hantar teks itu ke extract_with_llm (3 credits) bersama skema JSON untuk mendapatkan medan bertaip. Lebih kurang 5 credits setiap dokumen, dan pengekstrakan menggunakan model Ollama tempatan secara lalai supaya kandungan kekal pada mesin anda.

02Ringkasan

Masalahnya

Nombor penting tersimpan dalam PDF: laporan tahunan, senarai harga, pemfailan kawal selia, kertas penyelidikan. Menyalinnya dengan tangan tidak boleh diskalakan, dan pustaka PDF generik memulangkan timbunan teks tanpa struktur yang boleh anda tanya.

Penyelesaiannya

process_document CrawlForge mengekstrak teks, bahagian, dan metadata daripada URL atau fail PDF, manakala extract_with_llm menukar teks itu kepada bentuk JSON yang tepat seperti anda minta -- berjalan pada Ollama tempatan secara lalai, jadi kandungan dokumen tidak pernah meninggalkan mesin anda.

03Dalam kod

Contoh Kod

pdf-document-extraction.js
// Pull structured fields out of a PDF reportconst doc = await mcp.process_document({  source: "https://example.com/2026-annual-report.pdf",  sourceType: "pdf_url",  options: { extractText: true, extractMetadata: true },}); // Ask for exactly the fields you need, as JSONconst fields = await mcp.extract_with_llm({  content: doc.text,  prompt: "Extract fiscal year, revenue, operating margin, and headcount.",  schema: {    type: "object",    properties: {      fiscalYear: { type: "string" },      revenue: { type: "string" },      operatingMargin: { type: "string" },      headcount: { type: "number" },    },  },}); console.log(doc.metadata.pageCount);console.log(fields.data);

04Saluran paip

Alat Digunakan

5◆ credits
Anggaran kos: ~5 credits setiap dokumen
  1. https://…
  2. 01process_document 2 credits
  3. 02extract_with_llm 3 credits
  4. JSON · markdown

05Soalan

Soalan Lazim

01Bagaimana saya boleh mengekstrak data daripada PDF secara automatik?

Halakan process_document ke URL atau fail PDF untuk mendapatkan teks, bahagian, dan metadata, kemudian hantar teks itu ke extract_with_llm bersama skema JSON yang menerangkan medan yang anda mahu. Anda mendapat JSON bertaip dan bukannya timbunan teks.

02Adakah PDF itu perlu berada dalam talian?

Tidak. process_document menerima URL atau laluan fail tempatan melalui sourceType — url, pdf_url, file, atau pdf_file — dan pilihan seperti pageRange dan maxPages membolehkan anda memproses hanya halaman yang anda perlukan.

03Model manakah yang digunakan untuk pengekstrakan?

extract_with_llm menggunakan model Ollama tempatan secara lalai, jadi kandungan dokumen tidak pernah meninggalkan mesin anda. Hantar provider openai atau anthropic bersama kunci API yang sepadan apabila anda mahukan model awan.

04Berapakah kos pengekstrakan dokumen?

Lebih kurang 5 credits setiap dokumen: 2 untuk process_document dan 3 untuk extract_with_llm. Peringkat percuma 1,000-credit merangkumi kira-kira 200 dokumen, cukup untuk mengesahkan saluran paip terhadap arkib sebenar sebelum menaik taraf.

Mula menempa

Sedia untuk Bermula?

Setiap akaun baharu mendapat 1,000 credits percuma. Tiada kad kredit diperlukan.