CrawlForge MCP
Laman UtamaPlaygroundKes PenggunaanIntegrasiHargaDokumentasiBlog
  1. Laman Utama/
  2. Kes Penggunaan/
  3. Pengekstrakan Data PDF & Dokumen

Pengekstrakan Data PDF & Dokumen

Tarik medan berstruktur daripada PDF, laporan dan pemfailan tanpa membina penghurai. process_document membaca fail itu, extract_with_llm memulangkan JSON bertaip.

Jawapan Pantas

Halakan process_document (2 credits) ke URL atau fail PDF untuk mendapatkan teks, bahagian, dan metadata, kemudian hantar teks itu ke extract_with_llm (3 credits) bersama skema JSON untuk mendapatkan medan bertaip. Lebih kurang 5 credits setiap dokumen, dan pengekstrakan menggunakan model Ollama tempatan secara lalai supaya kandungan kekal pada mesin anda.

Masalahnya

Nombor penting tersimpan dalam PDF: laporan tahunan, senarai harga, pemfailan kawal selia, kertas penyelidikan. Menyalinnya dengan tangan tidak boleh diskalakan, dan pustaka PDF generik memulangkan timbunan teks tanpa struktur yang boleh anda tanya.

Penyelesaiannya

process_document CrawlForge mengekstrak teks, bahagian, dan metadata daripada URL atau fail PDF, manakala extract_with_llm menukar teks itu kepada bentuk JSON yang tepat seperti anda minta -- berjalan pada Ollama tempatan secara lalai, jadi kandungan dokumen tidak pernah meninggalkan mesin anda.

Contoh Kod

// Pull structured fields out of a PDF report
const doc = await mcp.process_document({
  source: "https://example.com/2026-annual-report.pdf",
  sourceType: "pdf_url",
  options: { extractText: true, extractMetadata: true },
});

// Ask for exactly the fields you need, as JSON
const fields = await mcp.extract_with_llm({
  content: doc.text,
  prompt: "Extract fiscal year, revenue, operating margin, and headcount.",
  schema: {
    type: "object",
    properties: {
      fiscalYear: { type: "string" },
      revenue: { type: "string" },
      operatingMargin: { type: "string" },
      headcount: { type: "number" },
    },
  },
});

console.log(doc.metadata.pageCount);
console.log(fields.data);

Alat Digunakan

process_document2 credits
extract_with_llm3 credits

Anggaran kos: ~5 credits setiap dokumen

Soalan Lazim

Bagaimana saya boleh mengekstrak data daripada PDF secara automatik?+

Halakan process_document ke URL atau fail PDF untuk mendapatkan teks, bahagian, dan metadata, kemudian hantar teks itu ke extract_with_llm bersama skema JSON yang menerangkan medan yang anda mahu. Anda mendapat JSON bertaip dan bukannya timbunan teks.

Adakah PDF itu perlu berada dalam talian?+

Tidak. process_document menerima URL atau laluan fail tempatan melalui sourceType — url, pdf_url, file, atau pdf_file — dan pilihan seperti pageRange dan maxPages membolehkan anda memproses hanya halaman yang anda perlukan.

Model manakah yang digunakan untuk pengekstrakan?+

extract_with_llm menggunakan model Ollama tempatan secara lalai, jadi kandungan dokumen tidak pernah meninggalkan mesin anda. Hantar provider openai atau anthropic bersama kunci API yang sepadan apabila anda mahukan model awan.

Berapakah kos pengekstrakan dokumen?+

Lebih kurang 5 credits setiap dokumen: 2 untuk process_document dan 3 untuk extract_with_llm. Peringkat percuma 1,000-credit merangkumi kira-kira 200 dokumen, cukup untuk mengesahkan saluran paip terhadap arkib sebenar sebelum menaik taraf.

Sedia untuk Bermula?

Setiap akaun baharu mendapat 1,000 credits percuma. Tiada kad kredit diperlukan.

Mula Percuma dengan 1,000 Credits

Kes Penggunaan Berkaitan

Pemasukan Pangkalan Pengetahuan RAG
Tukar tapak dokumentasi menjadi markdown bersih yang sedia dipecah kepada ketulan untuk RAG. Rangkak, buang boilerplate dan ringkaskan sebelum membenamkan.
map_site (2 cr)scrape (2 cr)summarize_content (4 cr)
Ejen Penyelidikan Masa Nyata
Bina ejen AI yang mencari di web, mensintesis penemuan dan menyampaikan penyelidikan terkini. Setiap dakwaan memetik sumbernya supaya jawapan kekal boleh disahkan.
deep_research (10 cr)search_web (5 cr)

Footer

CrawlForge MCP

Web scraping gred perusahaan untuk Ejen AI. 28 alat MCP khusus yang direka untuk pembangun moden yang membina sistem pintar.

Produk

  • Ciri
  • Playground
  • Harga
  • Kes Penggunaan
  • Integrasi
  • Alternatif
  • Changelog

Sumber

  • Mula Bekerja
  • Rujukan API
  • Templat
  • Panduan
  • Blog
  • Glosari
  • Soalan Lazim
  • Peta Laman

Pembangun

  • Protokol MCP
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

Syarikat

  • Tentang
  • Hubungi
  • Privasi
  • Terma
  • Penggunaan Boleh Diterima
  • Cookies

Kekal dikemas kini

Dapatkan kemas kini terkini tentang alat dan ciri baharu.

Dibina dengan Next.js dan protokol MCP

© 2025-2026 CrawlForge. Hak cipta terpelihara.