Recopilación de datos de entrenamiento para IA
Recopila y estructura conjuntos de datos web a gran escala para el ajuste fino y el entrenamiento de modelos de IA.
Respuesta rápida
Usa batch_scrape (5 credits) de CrawlForge para obtener cientos de URLs en paralelo, y luego extract_content (2 credits) para devolver texto o markdown limpio y sin plantillas repetitivas, listo para un pipeline de entrenamiento. Recopilas contenido estructurado en lugar de HTML sin procesar y ruidoso, lo que mejora la calidad del conjunto de datos y reduce el costo de preprocesamiento -- unos 7 credits por documento.
El problema
Entrenar y ajustar modelos de IA requiere conjuntos de datos grandes y limpios provenientes de diversas fuentes web. Recopilar estos datos manualmente es poco práctico, y el HTML sin procesar es demasiado ruidoso para el entrenamiento de modelos.
La solución
batch_scrape de CrawlForge procesa cientos de URL en paralelo para escalar, mientras que extract_content devuelve texto limpio y estructurado listo para los pipelines de entrenamiento. Crea conjuntos de datos a partir de cualquier fuente web.
Ejemplo de código
// Collect training data from documentation sites
const batch = await mcp.batch_scrape({
urls: [
"https://docs.example.com/guide/intro",
"https://docs.example.com/guide/setup",
"https://docs.example.com/guide/advanced",
// ... hundreds more URLs
],
format: "markdown",
});
// Extract clean content for each page
const dataset = await Promise.all(
batch.results.map(page =>
mcp.extract_content({
url: page.url,
format: "text",
remove_navigation: true,
})
)
);
console.log(`Collected ${dataset.length} documents`);Herramientas utilizadas
Costo estimado: ~7 credits por documento
Preguntas frecuentes
¿Cómo recopilo datos de entrenamiento limpios de la web a gran escala?
Usa batch_scrape de CrawlForge para obtener cientos de URLs en paralelo y luego extract_content para devolver texto limpio y sin texto repetitivo, listo para un pipeline de entrenamiento. Obtienes contenido estructurado en lugar de HTML sin procesar y ruidoso.
¿Por qué no usar simplemente HTML sin procesar para entrenar el modelo?
El HTML sin procesar está lleno de navegación, anuncios y marcado que añaden ruido y desperdician tokens. extract_content usa una pasada de legibilidad para devolver solo el contenido principal como texto limpio o markdown, lo que mejora la calidad del conjunto de datos y reduce el costo de preprocesamiento.
¿Puedo crear un conjunto de datos grande a partir de muchas fuentes?
Sí. batch_scrape, a 5 credits por lote, paraleliza la obtención en cientos de URLs, y extract_content, a 2 credits, limpia cada una. Combínalo con map_site para enumerar primero una fuente y luego procesar por lotes las URLs resultantes.
¿Respeta CrawlForge el robots.txt al recopilar datos?
CrawlForge respeta las directivas de robots y tú controlas qué fuentes rastreas. Eres responsable de los derechos sobre los datos que recopilas, así que apunta a sitios que tengas permiso para usar en el entrenamiento y mantén deliberado el alcance de tu crawl.
¿Listo para comenzar?
Cada cuenta nueva recibe 1,000 credits gratis. No se requiere tarjeta de crédito.
Comienza gratis con 1,000 credits