Ingesta de bases de conocimiento RAG
Convierte sitios de documentación en markdown limpio y listo para fragmentar en RAG. Rastrea, elimina el texto repetitivo y resume antes de generar embeddings.
Respuesta rápida
Usa map_site (2 credits) para enumerar un sitio de documentación, scrape (2 credits) para devolver markdown sin navegación ni anuncios, y summarize_content (4 credits) para añadir un resumen corto a cada fragmento. Son unos 6 credits por documento, y el markdown pasa directamente a tu fragmentador y a tu modelo de embeddings.
El problema
Un sistema RAG es tan bueno como el texto que le das. El HTML sin procesar arrastra navegación, anuncios y marcado que inflan el número de tokens y contaminan los embeddings, y cada sitio de documentación está maquetado de forma distinta, así que ningún parser único sirve para todos.
La solución
scrape de CrawlForge devuelve markdown, metadatos y enlaces en una sola llamada, con el texto repetitivo eliminado por Readability, y summarize_content condensa las páginas largas en resúmenes cortos que puedes guardar como metadatos de cada fragmento para mejorar la recuperación.
Ejemplo de código
// Turn a documentation site into RAG-ready markdown
const pages = await mcp.map_site({
url: "https://docs.example.com",
include_sitemap: true,
max_urls: 200,
});
// One call returns markdown, metadata, and links per page
const doc = await mcp.scrape({
url: pages.urls[0],
formats: ["markdown", "metadata", "links"],
onlyMainContent: true,
});
// Condense long pages into chunk-level summaries
const digest = await mcp.summarize_content({
text: doc.markdown,
options: { summaryLength: "short", summaryType: "abstractive" },
});
console.log(doc.markdown); // chunk + embed this
console.log(digest.summary); // store as chunk metadataHerramientas utilizadas
Costo estimado: ~6 credits por documento
Preguntas frecuentes
¿Cómo hago scraping de un sitio web para un pipeline RAG?
Usa map_site para listar todas las URLs, scrape para devolver cada página como markdown sin navegación ni anuncios, y summarize_content para adjuntar un resumen corto a cada fragmento. El markdown pasa directamente a tu fragmentador y a tu modelo de embeddings.
¿Por qué el markdown es mejor que el HTML sin procesar para RAG?
El HTML sin procesar gasta tokens en marcado, menús y anuncios, y ese ruido acaba en tus embeddings. scrape ejecuta primero Readability y devuelve solo el contenido principal, así que los fragmentos se mantienen semánticamente limpios y cuesta menos generar sus embeddings.
¿Puedo mantener actualizada la base de conocimiento?
Sí. Vuelve a ejecutar map_site y scrape de forma programada, y combínalos con track_changes para detectar las páginas que realmente cambiaron, de modo que solo regeneres los embeddings de esas en lugar de reconstruir todo el índice.
¿Cuánto cuesta ingerir un sitio de documentación?
Unos 6 credits por documento —2 de scrape y 4 de summarize_content— más 2 de una llamada a map_site por sitio. Un sitio de documentación de 200 páginas son aproximadamente 1,200 credits, y omitir los resúmenes reduce esa cifra a la mitad.
¿Listo para comenzar?
Cada cuenta nueva recibe 1,000 credits gratis. No se requiere tarjeta de crédito.
Comienza gratis con 1,000 credits