Langkau ke kandungan

Kes Penggunaan

Tukar tapak dokumentasi menjadi markdown bersih yang sedia dipecah kepada ketulan untuk RAG. Rangkak, buang boilerplate dan ringkaskan sebelum membenamkan.
Anggaran kos: ~6 credits setiap dokumen

01Jawapan Pantas

Gunakan map_site (2 credits) untuk menyenaraikan tapak dokumentasi, scrape (2 credits) untuk memulangkan markdown dengan navigasi dan iklan dibuang, dan summarize_content (4 credits) untuk menambah ringkasan pendek pada setiap ketulan. Itu lebih kurang 6 credits setiap dokumen, dan markdown itu terus masuk ke pemecah ketulan dan model pembenaman anda.

02Ringkasan

Masalahnya

Sistem RAG hanya sebaik teks yang anda suapkan kepadanya. HTML mentah membawa navigasi, iklan, dan markup yang membengkakkan kiraan tokens serta mencemarkan pembenaman, dan setiap tapak dokumentasi disusun secara berbeza, jadi satu penghurai tidak pernah sesuai untuk semuanya.

Penyelesaiannya

scrape CrawlForge memulangkan markdown, metadata, dan pautan daripada satu panggilan dengan boilerplate dibuang oleh Readability, manakala summarize_content memadatkan halaman panjang menjadi ringkasan pendek yang boleh anda simpan sebagai metadata ketulan untuk perolehan yang lebih baik.

03Dalam kod

Contoh Kod

rag-knowledge-base.js
// Turn a documentation site into RAG-ready markdownconst pages = await mcp.map_site({  url: "https://docs.example.com",  include_sitemap: true,  max_urls: 200,}); // One call returns markdown, metadata, and links per pageconst doc = await mcp.scrape({  url: pages.urls[0],  formats: ["markdown", "metadata", "links"],  onlyMainContent: true,}); // Condense long pages into chunk-level summariesconst digest = await mcp.summarize_content({  text: doc.markdown,  options: { summaryLength: "short", summaryType: "abstractive" },}); console.log(doc.markdown);       // chunk + embed thisconsole.log(digest.summary);     // store as chunk metadata

04Saluran paip

Alat Digunakan

8◆ credits
Anggaran kos: ~6 credits setiap dokumen
  1. https://…
  2. 01map_site 2 credits
  3. 02scrape 2 credits
  4. 03summarize_content 4 credits
  5. JSON · markdown

05Soalan

Soalan Lazim

01Bagaimana saya boleh scrape tapak web untuk saluran paip RAG?

Gunakan map_site untuk menyenaraikan setiap URL, scrape untuk memulangkan setiap halaman sebagai markdown dengan navigasi dan iklan dibuang, dan summarize_content untuk melampirkan ringkasan pendek pada setiap ketulan. Markdown itu terus masuk ke pemecah ketulan dan model pembenaman anda.

02Mengapa markdown lebih baik daripada HTML mentah untuk RAG?

HTML mentah membazirkan tokens pada markup, menu, dan iklan, dan gangguan itu berakhir dalam pembenaman anda. scrape menjalankan Readability dahulu dan memulangkan hanya kandungan utama, jadi ketulan kekal bersih dari segi semantik dan lebih murah untuk dibenamkan.

03Bolehkah saya memastikan pangkalan pengetahuan sentiasa terkini?

Ya. Jalankan semula map_site dan scrape mengikut jadual, dan gandingkannya dengan track_changes untuk mengesan halaman yang benar-benar berubah, supaya anda membenamkan semula halaman itu sahaja dan bukannya membina semula keseluruhan indeks.

04Berapakah kos untuk memasukkan sebuah tapak dokumentasi?

Lebih kurang 6 credits setiap dokumen — 2 untuk scrape dan 4 untuk summarize_content — ditambah 2 untuk satu panggilan map_site bagi setiap tapak. Tapak dokumentasi 200 halaman lebih kurang 1,200 credits, dan melangkau ringkasan menjadikannya separuh.

Mula menempa

Sedia untuk Bermula?

Setiap akaun baharu mendapat 1,000 credits percuma. Tiada kad kredit diperlukan.