Pemasukan Pangkalan Pengetahuan RAG
Tukar tapak dokumentasi menjadi markdown bersih yang sedia dipecah kepada ketulan untuk RAG. Rangkak, buang boilerplate dan ringkaskan sebelum membenamkan.
Jawapan Pantas
Gunakan map_site (2 credits) untuk menyenaraikan tapak dokumentasi, scrape (2 credits) untuk memulangkan markdown dengan navigasi dan iklan dibuang, dan summarize_content (4 credits) untuk menambah ringkasan pendek pada setiap ketulan. Itu lebih kurang 6 credits setiap dokumen, dan markdown itu terus masuk ke pemecah ketulan dan model pembenaman anda.
Masalahnya
Sistem RAG hanya sebaik teks yang anda suapkan kepadanya. HTML mentah membawa navigasi, iklan, dan markup yang membengkakkan kiraan tokens serta mencemarkan pembenaman, dan setiap tapak dokumentasi disusun secara berbeza, jadi satu penghurai tidak pernah sesuai untuk semuanya.
Penyelesaiannya
scrape CrawlForge memulangkan markdown, metadata, dan pautan daripada satu panggilan dengan boilerplate dibuang oleh Readability, manakala summarize_content memadatkan halaman panjang menjadi ringkasan pendek yang boleh anda simpan sebagai metadata ketulan untuk perolehan yang lebih baik.
Contoh Kod
// Turn a documentation site into RAG-ready markdown
const pages = await mcp.map_site({
url: "https://docs.example.com",
include_sitemap: true,
max_urls: 200,
});
// One call returns markdown, metadata, and links per page
const doc = await mcp.scrape({
url: pages.urls[0],
formats: ["markdown", "metadata", "links"],
onlyMainContent: true,
});
// Condense long pages into chunk-level summaries
const digest = await mcp.summarize_content({
text: doc.markdown,
options: { summaryLength: "short", summaryType: "abstractive" },
});
console.log(doc.markdown); // chunk + embed this
console.log(digest.summary); // store as chunk metadataAlat Digunakan
Anggaran kos: ~6 credits setiap dokumen
Soalan Lazim
Bagaimana saya boleh scrape tapak web untuk saluran paip RAG?
Gunakan map_site untuk menyenaraikan setiap URL, scrape untuk memulangkan setiap halaman sebagai markdown dengan navigasi dan iklan dibuang, dan summarize_content untuk melampirkan ringkasan pendek pada setiap ketulan. Markdown itu terus masuk ke pemecah ketulan dan model pembenaman anda.
Mengapa markdown lebih baik daripada HTML mentah untuk RAG?
HTML mentah membazirkan tokens pada markup, menu, dan iklan, dan gangguan itu berakhir dalam pembenaman anda. scrape menjalankan Readability dahulu dan memulangkan hanya kandungan utama, jadi ketulan kekal bersih dari segi semantik dan lebih murah untuk dibenamkan.
Bolehkah saya memastikan pangkalan pengetahuan sentiasa terkini?
Ya. Jalankan semula map_site dan scrape mengikut jadual, dan gandingkannya dengan track_changes untuk mengesan halaman yang benar-benar berubah, supaya anda membenamkan semula halaman itu sahaja dan bukannya membina semula keseluruhan indeks.
Berapakah kos untuk memasukkan sebuah tapak dokumentasi?
Lebih kurang 6 credits setiap dokumen — 2 untuk scrape dan 4 untuk summarize_content — ditambah 2 untuk satu panggilan map_site bagi setiap tapak. Tapak dokumentasi 200 halaman lebih kurang 1,200 credits, dan melangkau ringkasan menjadikannya separuh.
Sedia untuk Bermula?
Setiap akaun baharu mendapat 1,000 credits percuma. Tiada kad kredit diperlukan.
Mula Percuma dengan 1,000 Credits