CrawlForge MCP
InicioPlaygroundCasos de usoIntegracionesPreciosDocumentaciónBlog
  1. Inicio/
  2. Casos de uso/
  3. Ingesta de bases de conocimiento RAG

Ingesta de bases de conocimiento RAG

Convierte sitios de documentación en markdown limpio y listo para fragmentar en RAG. Rastrea, elimina el texto repetitivo y resume antes de generar embeddings.

Respuesta rápida

Usa map_site (2 credits) para enumerar un sitio de documentación, scrape (2 credits) para devolver markdown sin navegación ni anuncios, y summarize_content (4 credits) para añadir un resumen corto a cada fragmento. Son unos 6 credits por documento, y el markdown pasa directamente a tu fragmentador y a tu modelo de embeddings.

El problema

Un sistema RAG es tan bueno como el texto que le das. El HTML sin procesar arrastra navegación, anuncios y marcado que inflan el número de tokens y contaminan los embeddings, y cada sitio de documentación está maquetado de forma distinta, así que ningún parser único sirve para todos.

La solución

scrape de CrawlForge devuelve markdown, metadatos y enlaces en una sola llamada, con el texto repetitivo eliminado por Readability, y summarize_content condensa las páginas largas en resúmenes cortos que puedes guardar como metadatos de cada fragmento para mejorar la recuperación.

Ejemplo de código

// Turn a documentation site into RAG-ready markdown
const pages = await mcp.map_site({
  url: "https://docs.example.com",
  include_sitemap: true,
  max_urls: 200,
});

// One call returns markdown, metadata, and links per page
const doc = await mcp.scrape({
  url: pages.urls[0],
  formats: ["markdown", "metadata", "links"],
  onlyMainContent: true,
});

// Condense long pages into chunk-level summaries
const digest = await mcp.summarize_content({
  text: doc.markdown,
  options: { summaryLength: "short", summaryType: "abstractive" },
});

console.log(doc.markdown);       // chunk + embed this
console.log(digest.summary);     // store as chunk metadata

Herramientas utilizadas

map_site2 credits
scrape2 credits
summarize_content4 credits

Costo estimado: ~6 credits por documento

Preguntas frecuentes

¿Cómo hago scraping de un sitio web para un pipeline RAG?+

Usa map_site para listar todas las URLs, scrape para devolver cada página como markdown sin navegación ni anuncios, y summarize_content para adjuntar un resumen corto a cada fragmento. El markdown pasa directamente a tu fragmentador y a tu modelo de embeddings.

¿Por qué el markdown es mejor que el HTML sin procesar para RAG?+

El HTML sin procesar gasta tokens en marcado, menús y anuncios, y ese ruido acaba en tus embeddings. scrape ejecuta primero Readability y devuelve solo el contenido principal, así que los fragmentos se mantienen semánticamente limpios y cuesta menos generar sus embeddings.

¿Puedo mantener actualizada la base de conocimiento?+

Sí. Vuelve a ejecutar map_site y scrape de forma programada, y combínalos con track_changes para detectar las páginas que realmente cambiaron, de modo que solo regeneres los embeddings de esas en lugar de reconstruir todo el índice.

¿Cuánto cuesta ingerir un sitio de documentación?+

Unos 6 credits por documento —2 de scrape y 4 de summarize_content— más 2 de una llamada a map_site por sitio. Un sitio de documentación de 200 páginas son aproximadamente 1,200 credits, y omitir los resúmenes reduce esa cifra a la mitad.

¿Listo para comenzar?

Cada cuenta nueva recibe 1,000 credits gratis. No se requiere tarjeta de crédito.

Comienza gratis con 1,000 credits

Casos de uso relacionados

Pipelines de datos para agentes de IA
Alimenta tus agentes de IA con datos web en vivo mediante extracción estructurada e investigación multifuente, con MCP tools de fetch_url a deep_research.
deep_research (10 cr)extract_content (2 cr)
Recopilación de datos para entrenar IA
Recopila y estructura datos web a gran escala para el ajuste fino y entrenamiento de modelos de IA. Rastrea sitios y exporta texto limpio listo para entrenar.
batch_scrape (5 cr)extract_content (2 cr)

Pie de página

CrawlForge MCP

Web scraping empresarial para agentes de IA. 28 herramientas MCP especializadas diseñadas para desarrolladores modernos que crean sistemas inteligentes.

Producto

  • Funciones
  • Playground
  • Precios
  • Casos de uso
  • Integraciones
  • Alternativas
  • Registro de cambios

Recursos

  • Primeros pasos
  • Referencia de la API
  • Plantillas
  • Guías
  • Blog
  • Glosario
  • Preguntas frecuentes
  • Mapa del sitio

Desarrolladores

  • Protocolo MCP
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

Empresa

  • Acerca de
  • Contacto
  • Privacidad
  • Términos
  • Uso aceptable
  • Cookies

Mantente al día

Recibe las últimas novedades sobre nuevas herramientas y funciones.

Creado con Next.js y el protocolo MCP

© 2025-2026 CrawlForge. Todos los derechos reservados.