CrawlForge MCP
Laman UtamaPlaygroundKes PenggunaanIntegrasiHargaDokumentasiBlog
  1. Laman Utama/
  2. Kes Penggunaan/
  3. Pemasukan Pangkalan Pengetahuan RAG

Pemasukan Pangkalan Pengetahuan RAG

Tukar tapak dokumentasi menjadi markdown bersih yang sedia dipecah kepada ketulan untuk RAG. Rangkak, buang boilerplate dan ringkaskan sebelum membenamkan.

Jawapan Pantas

Gunakan map_site (2 credits) untuk menyenaraikan tapak dokumentasi, scrape (2 credits) untuk memulangkan markdown dengan navigasi dan iklan dibuang, dan summarize_content (4 credits) untuk menambah ringkasan pendek pada setiap ketulan. Itu lebih kurang 6 credits setiap dokumen, dan markdown itu terus masuk ke pemecah ketulan dan model pembenaman anda.

Masalahnya

Sistem RAG hanya sebaik teks yang anda suapkan kepadanya. HTML mentah membawa navigasi, iklan, dan markup yang membengkakkan kiraan tokens serta mencemarkan pembenaman, dan setiap tapak dokumentasi disusun secara berbeza, jadi satu penghurai tidak pernah sesuai untuk semuanya.

Penyelesaiannya

scrape CrawlForge memulangkan markdown, metadata, dan pautan daripada satu panggilan dengan boilerplate dibuang oleh Readability, manakala summarize_content memadatkan halaman panjang menjadi ringkasan pendek yang boleh anda simpan sebagai metadata ketulan untuk perolehan yang lebih baik.

Contoh Kod

// Turn a documentation site into RAG-ready markdown
const pages = await mcp.map_site({
  url: "https://docs.example.com",
  include_sitemap: true,
  max_urls: 200,
});

// One call returns markdown, metadata, and links per page
const doc = await mcp.scrape({
  url: pages.urls[0],
  formats: ["markdown", "metadata", "links"],
  onlyMainContent: true,
});

// Condense long pages into chunk-level summaries
const digest = await mcp.summarize_content({
  text: doc.markdown,
  options: { summaryLength: "short", summaryType: "abstractive" },
});

console.log(doc.markdown);       // chunk + embed this
console.log(digest.summary);     // store as chunk metadata

Alat Digunakan

map_site2 credits
scrape2 credits
summarize_content4 credits

Anggaran kos: ~6 credits setiap dokumen

Soalan Lazim

Bagaimana saya boleh scrape tapak web untuk saluran paip RAG?+

Gunakan map_site untuk menyenaraikan setiap URL, scrape untuk memulangkan setiap halaman sebagai markdown dengan navigasi dan iklan dibuang, dan summarize_content untuk melampirkan ringkasan pendek pada setiap ketulan. Markdown itu terus masuk ke pemecah ketulan dan model pembenaman anda.

Mengapa markdown lebih baik daripada HTML mentah untuk RAG?+

HTML mentah membazirkan tokens pada markup, menu, dan iklan, dan gangguan itu berakhir dalam pembenaman anda. scrape menjalankan Readability dahulu dan memulangkan hanya kandungan utama, jadi ketulan kekal bersih dari segi semantik dan lebih murah untuk dibenamkan.

Bolehkah saya memastikan pangkalan pengetahuan sentiasa terkini?+

Ya. Jalankan semula map_site dan scrape mengikut jadual, dan gandingkannya dengan track_changes untuk mengesan halaman yang benar-benar berubah, supaya anda membenamkan semula halaman itu sahaja dan bukannya membina semula keseluruhan indeks.

Berapakah kos untuk memasukkan sebuah tapak dokumentasi?+

Lebih kurang 6 credits setiap dokumen — 2 untuk scrape dan 4 untuk summarize_content — ditambah 2 untuk satu panggilan map_site bagi setiap tapak. Tapak dokumentasi 200 halaman lebih kurang 1,200 credits, dan melangkau ringkasan menjadikannya separuh.

Sedia untuk Bermula?

Setiap akaun baharu mendapat 1,000 credits percuma. Tiada kad kredit diperlukan.

Mula Percuma dengan 1,000 Credits

Kes Penggunaan Berkaitan

Saluran Paip Data Ejen AI
Suapkan ejen AI anda dengan data web langsung — pengekstrakan berstruktur, penyelidikan pelbagai sumber, dan MCP tools dari fetch_url hingga deep_research.
deep_research (10 cr)extract_content (2 cr)
Pengumpulan Data Latihan AI
Kumpul dan susun set data web berskala besar untuk penalaan halus dan latihan model AI. Rangkak tapak penuh, ekstrak teks bersih dan eksport data latihan.
batch_scrape (5 cr)extract_content (2 cr)

Footer

CrawlForge MCP

Web scraping gred perusahaan untuk Ejen AI. 28 alat MCP khusus yang direka untuk pembangun moden yang membina sistem pintar.

Produk

  • Ciri
  • Playground
  • Harga
  • Kes Penggunaan
  • Integrasi
  • Alternatif
  • Changelog

Sumber

  • Mula Bekerja
  • Rujukan API
  • Templat
  • Panduan
  • Blog
  • Glosari
  • Soalan Lazim
  • Peta Laman

Pembangun

  • Protokol MCP
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

Syarikat

  • Tentang
  • Hubungi
  • Privasi
  • Terma
  • Penggunaan Boleh Diterima
  • Cookies

Kekal dikemas kini

Dapatkan kemas kini terkini tentang alat dan ciri baharu.

Dibina dengan Next.js dan protokol MCP

© 2025-2026 CrawlForge. Hak cipta terpelihara.