Pengekstrakan Data PDF & Dokumen
Tarik medan berstruktur daripada PDF, laporan dan pemfailan tanpa membina penghurai. process_document membaca fail itu, extract_with_llm memulangkan JSON bertaip.
Jawapan Pantas
Halakan process_document (2 credits) ke URL atau fail PDF untuk mendapatkan teks, bahagian, dan metadata, kemudian hantar teks itu ke extract_with_llm (3 credits) bersama skema JSON untuk mendapatkan medan bertaip. Lebih kurang 5 credits setiap dokumen, dan pengekstrakan menggunakan model Ollama tempatan secara lalai supaya kandungan kekal pada mesin anda.
Masalahnya
Nombor penting tersimpan dalam PDF: laporan tahunan, senarai harga, pemfailan kawal selia, kertas penyelidikan. Menyalinnya dengan tangan tidak boleh diskalakan, dan pustaka PDF generik memulangkan timbunan teks tanpa struktur yang boleh anda tanya.
Penyelesaiannya
process_document CrawlForge mengekstrak teks, bahagian, dan metadata daripada URL atau fail PDF, manakala extract_with_llm menukar teks itu kepada bentuk JSON yang tepat seperti anda minta -- berjalan pada Ollama tempatan secara lalai, jadi kandungan dokumen tidak pernah meninggalkan mesin anda.
Contoh Kod
// Pull structured fields out of a PDF report
const doc = await mcp.process_document({
source: "https://example.com/2026-annual-report.pdf",
sourceType: "pdf_url",
options: { extractText: true, extractMetadata: true },
});
// Ask for exactly the fields you need, as JSON
const fields = await mcp.extract_with_llm({
content: doc.text,
prompt: "Extract fiscal year, revenue, operating margin, and headcount.",
schema: {
type: "object",
properties: {
fiscalYear: { type: "string" },
revenue: { type: "string" },
operatingMargin: { type: "string" },
headcount: { type: "number" },
},
},
});
console.log(doc.metadata.pageCount);
console.log(fields.data);Alat Digunakan
Anggaran kos: ~5 credits setiap dokumen
Soalan Lazim
Bagaimana saya boleh mengekstrak data daripada PDF secara automatik?
Halakan process_document ke URL atau fail PDF untuk mendapatkan teks, bahagian, dan metadata, kemudian hantar teks itu ke extract_with_llm bersama skema JSON yang menerangkan medan yang anda mahu. Anda mendapat JSON bertaip dan bukannya timbunan teks.
Adakah PDF itu perlu berada dalam talian?
Tidak. process_document menerima URL atau laluan fail tempatan melalui sourceType — url, pdf_url, file, atau pdf_file — dan pilihan seperti pageRange dan maxPages membolehkan anda memproses hanya halaman yang anda perlukan.
Model manakah yang digunakan untuk pengekstrakan?
extract_with_llm menggunakan model Ollama tempatan secara lalai, jadi kandungan dokumen tidak pernah meninggalkan mesin anda. Hantar provider openai atau anthropic bersama kunci API yang sepadan apabila anda mahukan model awan.
Berapakah kos pengekstrakan dokumen?
Lebih kurang 5 credits setiap dokumen: 2 untuk process_document dan 3 untuk extract_with_llm. Peringkat percuma 1,000-credit merangkumi kira-kira 200 dokumen, cukup untuk mengesahkan saluran paip terhadap arkib sebenar sebelum menaik taraf.
Sedia untuk Bermula?
Setiap akaun baharu mendapat 1,000 credits percuma. Tiada kad kredit diperlukan.
Mula Percuma dengan 1,000 Credits