Saltar al contenido

Casos de uso

Convierte sitios de documentación en markdown limpio y listo para fragmentar en RAG. Rastrea, elimina el texto repetitivo y resume antes de generar embeddings.
Costo estimado: ~6 credits por documento

01Respuesta rápida

Usa map_site (2 credits) para enumerar un sitio de documentación, scrape (2 credits) para devolver markdown sin navegación ni anuncios, y summarize_content (4 credits) para añadir un resumen corto a cada fragmento. Son unos 6 credits por documento, y el markdown pasa directamente a tu fragmentador y a tu modelo de embeddings.

02El planteamiento

El problema

Un sistema RAG es tan bueno como el texto que le das. El HTML sin procesar arrastra navegación, anuncios y marcado que inflan el número de tokens y contaminan los embeddings, y cada sitio de documentación está maquetado de forma distinta, así que ningún parser único sirve para todos.

La solución

scrape de CrawlForge devuelve markdown, metadatos y enlaces en una sola llamada, con el texto repetitivo eliminado por Readability, y summarize_content condensa las páginas largas en resúmenes cortos que puedes guardar como metadatos de cada fragmento para mejorar la recuperación.

03En código

Ejemplo de código

rag-knowledge-base.js
// Turn a documentation site into RAG-ready markdownconst pages = await mcp.map_site({  url: "https://docs.example.com",  include_sitemap: true,  max_urls: 200,}); // One call returns markdown, metadata, and links per pageconst doc = await mcp.scrape({  url: pages.urls[0],  formats: ["markdown", "metadata", "links"],  onlyMainContent: true,}); // Condense long pages into chunk-level summariesconst digest = await mcp.summarize_content({  text: doc.markdown,  options: { summaryLength: "short", summaryType: "abstractive" },}); console.log(doc.markdown);       // chunk + embed thisconsole.log(digest.summary);     // store as chunk metadata

04El pipeline

Herramientas utilizadas

8◆ credits
Costo estimado: ~6 credits por documento
  1. https://…
  2. 01map_site 2 credits
  3. 02scrape 2 credits
  4. 03summarize_content 4 credits
  5. JSON · markdown

05Preguntas

Preguntas frecuentes

01¿Cómo hago scraping de un sitio web para un pipeline RAG?

Usa map_site para listar todas las URLs, scrape para devolver cada página como markdown sin navegación ni anuncios, y summarize_content para adjuntar un resumen corto a cada fragmento. El markdown pasa directamente a tu fragmentador y a tu modelo de embeddings.

02¿Por qué el markdown es mejor que el HTML sin procesar para RAG?

El HTML sin procesar gasta tokens en marcado, menús y anuncios, y ese ruido acaba en tus embeddings. scrape ejecuta primero Readability y devuelve solo el contenido principal, así que los fragmentos se mantienen semánticamente limpios y cuesta menos generar sus embeddings.

03¿Puedo mantener actualizada la base de conocimiento?

Sí. Vuelve a ejecutar map_site y scrape de forma programada, y combínalos con track_changes para detectar las páginas que realmente cambiaron, de modo que solo regeneres los embeddings de esas en lugar de reconstruir todo el índice.

04¿Cuánto cuesta ingerir un sitio de documentación?

Unos 6 credits por documento —2 de scrape y 4 de summarize_content— más 2 de una llamada a map_site por sitio. Un sitio de documentación de 200 páginas son aproximadamente 1,200 credits, y omitir los resúmenes reduce esa cifra a la mitad.

Empieza a forjar

¿Listo para comenzar?

Cada cuenta nueva recibe 1,000 credits gratis. No se requiere tarjeta de crédito.