En esta página
El 7 de julio de 2026, robots.txt dejó de ser una cuestión de etiqueta.
Ese fue el día en que el Comité Europeo de Protección de Datos (EDPB) adoptó las Directrices 03/2026 sobre web scraping en el contexto de la IA generativa — el primer marco integral del RGPD para el scraping a gran escala de datos públicamente disponibles con el fin de entrenar modelos generativos. Su sección sobre el test de ponderación contiene una posición con consecuencias directas de ingeniería: robots.txt, ai.txt, los CAPTCHA y los muros de login son indicadores de lo que los interesados esperan razonablemente. Ignóralos a gran escala y el argumento ya no va de términos de servicio. Va del Artículo 6(1)(f).
Cada página que posiciona para "is web scraping legal" es un bufete de abogados escribiendo para otros abogados. Esta es la versión para la persona que escribe el crawler.
Esto no es asesoramiento legal. Es una lectura de ingeniería de un documento regulatorio publicado. Las Directrices 03/2026 están en consulta pública hasta finales de octubre de 2026 y la versión final no se espera antes de finales de 2026. Habla con un abogado antes de poner en producción un pipeline que toque datos personales de la UE.
Tabla de contenidos
- ¿Es legal el web scraping en 2026?
- ¿Qué cambió el 7 de julio de 2026?
- ¿Tiene robots.txt fuerza legal ahora?
- ¿En qué base legal puedes apoyarte realmente?
- ¿Scraping dirigido o crawling indiscriminado?
- ¿Qué significa la minimización de datos en código?
- ¿Qué pasa si haces scraping de datos de categoría especial?
- ¿Tienes que avisar a la gente de que hiciste scraping de sus datos?
- ¿Eres el responsable o el encargado del tratamiento?
- ¿En qué se diferencia la posición de EE. UU.?
- ¿Qué deberían hacer distinto los desarrolladores de scrapers?
- Dónde encaja CrawlForge
¿Es legal el web scraping en 2026?
Sí, con condiciones. Descargar una página públicamente accesible no es en sí ilegal ni en la UE ni en EE. UU. La legalidad depende de qué recopilas, por qué y qué pasa después — y en la UE, cualquier scrape que toque datos personales es una operación de tratamiento que necesita una base legal antes de que salga la primera petición.
Los dos regímenes hacen preguntas distintas. La UE pregunta cuál es tu base legal y si puedes acreditarla; EE. UU. no tiene una ley federal de scraping, así que ese trabajo lo hacen los contratos, el copyright y las leyes estatales de privacidad.
La palabra que más daño hace aquí es público. "Públicamente disponible" no es una categoría del RGPD. Un nombre en la agenda de una conferencia, un comentario bajo un post de blog, el email de un maintainer en un commit — todo son datos personales, todo entra en el ámbito. La posición del EDPB es que el contenido de internet involucra datos personales "prácticamente siempre", y los datasets mixtos no se libran: la parte de datos personales sigue sujeta al RGPD.
¿Qué cambió el 7 de julio de 2026?
Antes de julio, el compliance del scraping en la UE se armaba por analogía a partir de guías del RGPD. Las Directrices 03/2026 lo sustituyen por un marco dirigido al entrenamiento de IA generativa.
| Elemento | Detalle |
|---|---|
| Adopción | 7 de julio de 2026, Versión 1.0 |
| Tema | Web scraping en el contexto de la IA generativa |
| Ámbito | Scraping realizado por entidades privadas |
| Activador | Cualquier scrape que involucre datos personales — "prácticamente siempre" en contenido de internet |
| Datasets mixtos | La parte de datos personales sigue sujeta al RGPD |
| Consulta pública | Abierta hasta finales de octubre de 2026 |
| Versión final | No se espera antes de finales de 2026 |
La redacción todavía puede cambiar, así que no la hardcodees en un programa de compliance. Pero las obligaciones que interpreta son derecho vigente, exigible ya — esperar al texto final no te compra nada.
¿Tiene robots.txt fuerza legal ahora?
No directamente. robots.txt es una convención, no una ley, y saltárselo no es una infracción en sí mismo. Lo que cambió es su papel probatorio: el EDPB trata robots.txt, ai.txt, los CAPTCHA y los muros de login como indicadores de las expectativas razonables de los interesados, uno de los insumos del test de ponderación del interés legítimo. Cuando un sitio despliega esas señales y declara que sus datos no pueden usarse para entrenar IA, la posición del EDPB es que los interesados no tienen una expectativa razonable de que se haga scraping de sus datos.
Ignorar un Disallow solía ser una cuestión de términos de servicio y copyright que podías discutir más tarde. Ahora pesa directamente en tu contra en el test sobre el que descansa toda tu base legal.
| Señal en el sitio | Cómo la leen las Directrices 03/2026 | Qué debería hacer tu crawler |
|---|---|---|
robots.txt Disallow | Expectativa de no ser rastreado | Respétalo por defecto; registra cada omisión |
ai.txt o un aviso explícito de no entrenar IA | Objeción explícita al uso para entrenamiento | Excluye el dominio de los corpus de entrenamiento |
| CAPTCHA | Control de acceso; eludirlo pesa en tu contra | No lo resuelvas de forma programática para construir un corpus |
| Muro de login | El contenido no está públicamente disponible | No te autentiques para recolectar |
Aquí se mezclan dos cosas que no deberían mezclarse. Nuestra guía de stealth mode cubre el fingerprinting de navegador en páginas ya públicas para cualquier visitante. Un muro de login es un acto distinto, y desde julio de 2026 conlleva peso bajo el RGPD además de la exposición contractual que siempre tuvo.
¿En qué base legal puedes apoyarte realmente?
El consentimiento del Artículo 6(1)(a) "generalmente no es una base legal viable" para el scraping a gran escala, en palabras del EDPB: no puedes obtener un consentimiento válido, específico y libremente otorgado de millones de personas cuyas páginas rastreaste. Queda el interés legítimo del Artículo 6(1)(f) — un test acumulativo de tres partes, así que fallar una parte es fallarlo todo.
| Paso | Qué pregunta | Qué necesitas tener documentado |
|---|---|---|
| 1. Interés | ¿Es lícito, real y está definido con precisión? | Una declaración de propósito por corpus. El EDPB acepta desarrollar un agente conversacional, la detección de fraude y, en general, desarrollar un modelo de IA |
| 2. Necesidad | ¿Existe una vía menos intrusiva igual de efectiva? | Una comparación por escrito de las alternativas que descartaste: criterios más estrechos, datos sintéticos, datos seudonimizados |
| 3. Ponderación | ¿Los derechos y las expectativas razonables de los interesados prevalecen sobre tu interés? | Registros de qué señales respetaste, qué dominios excluiste y cómo gestionaste los opt-outs |
El paso 2 es el que los equipos de ingeniería subestiman. "Necesitábamos toda la web" no es un argumento de necesidad. Criterios de crawl más estrechos, datos sintéticos y seudonimización en la ingesta figuran como alternativas menos intrusivas, y si nunca las evaluaste no tienes registro de haberlo intentado.
¿Scraping dirigido o crawling indiscriminado?
Las directrices separan el scraping dirigido — criterios restrictivos, dominios o temas específicos — del crawling indiscriminado que sigue enlaces sin restricción. El indiscriminado conlleva mayor riesgo de compliance, porque un crawler sin límites no puede demostrar que su recopilación era necesaria.
| Scraping dirigido | Crawling indiscriminado | |
|---|---|---|
| Definición | Criterios restrictivos; dominios o temas concretos | Seguimiento de enlaces sin restricción |
| Riesgo de compliance | Menor | Mayor |
| Test de necesidad | Más fácil de acreditar | Difícil de acreditar |
| Forma típica | Allowlist de semillas, patrones de inclusión, tope de páginas | URL semilla, límite de profundidad, correr hasta agotar el presupuesto |
Eso convierte la configuración del crawl en un artefacto de compliance. Tus patrones de inclusión, exclusiones y topes de páginas son los criterios definidos con precisión por los que pregunta el test de necesidad, así que su sitio está en el control de versiones.
import { Client } from '@modelcontextprotocol/sdk/client/index.js';
const client = new Client({ name: 'corpus-builder', version: '1.0.0' });
interface SourceRecord {
url: string;
domain: string;
collectedAt: string; // Timestamp ISO — requerido para la lista pública de fuentes
}
// Crawl dirigido: dominio concreto, patrones de inclusión explícitos, tope duro de páginas.
const result = await client.callTool({
name: 'crawl_deep',
arguments: {
url: 'https://docs.python.org/3/',
max_pages: 500,
respect_robots: true, // por defecto; desactivarlo es una decisión que debes justificar
include_patterns: ['/3/library/', '/3/tutorial/'],
exclude_patterns: ['/genindex', '/search'],
},
});
const payload = result.content as Array<{ text: string }>;
const crawled = JSON.parse(payload[0].text) as { pages: Array<{ url: string }> };
// El Artículo 14 espera una lista de fuentes lo más completa posible, idealmente
// con fechas de recopilación. Eso convierte la procedencia en un requisito del esquema.
const provenance: SourceRecord[] = crawled.pages.map((page) => ({
url: page.url,
domain: new URL(page.url).hostname,
collectedAt: new Date().toISOString(),
}));¿Qué significa la minimización de datos en código?
Las directrices prescriben la minimización en tres puntos, y cada uno se corresponde con un lugar de tu stack.
Antes de la recopilación. Criterios precisos, categorías de sitios estructuralmente sensibles excluidas de entrada, robots.txt y ai.txt respetados, datos sintéticos considerados. Trabajo de lista de semillas y configuración del crawl.
Durante y después de la recopilación. Filtros sintácticos para identificadores — los números de la seguridad social son el propio ejemplo del EDPB — y después seudonimización o anonimización. Esto va en la ruta de ingesta, antes de que nada llegue al almacenamiento duradero.
// Los filtros sintácticos corren antes de que nada llegue al almacenamiento persistente.
// Son deliberadamente burdos: sacrifican recall a cambio de un registro de minimización que puedes mostrar.
const IDENTIFIER_PATTERNS: Array<{ label: string; pattern: RegExp }> = [
{ label: 'us-ssn', pattern: /d{3}-d{2}-d{4}/g },
{ label: 'email', pattern: /[w.+-]+@[w-]+.[w.]{2,}/g },
];
interface RedactionResult {
text: string;
hits: Record<string, number>;
}
export function redactIdentifiers(input: string): RedactionResult {
const hits: Record<string, number> = {};
let text = input;
for (const { label, pattern } of IDENTIFIER_PATTERNS) {
const matches = text.match(pattern);
if (matches) {
hits[label] = matches.length;
text = text.replace(pattern, '[REDACTED:' + label + ']');
}
}
// Conserva los conteos. Son evidencia de responsabilidad, no output de debug.
return { text, hits };
}Los filtros regex se dejan mucho fuera: nombres, direcciones y revelaciones en texto libre pasan de largo. Documéntalo en lugar de afirmar que el corpus está limpio — la meta es una reducción demostrable, no la perfección.
¿Qué pasa si haces scraping de datos de categoría especial?
Los datos del Artículo 9 — salud, opiniones políticas, etnia — aparecen de forma incidental en cualquier crawl amplio. La posición del EDPB es que la recopilación incidental no es automáticamente ilegal, pero solo sobrevive con salvaguardas a lo largo de todo el ciclo de vida del modelo. Las directrices anclan esto en la sentencia del TJUE en el asunto GC and Others (C-136/17).
| Etapa del ciclo de vida | Salvaguarda | Dónde vive |
|---|---|---|
| Antes de la recopilación | Filtrar fuentes y contenido con probabilidad de contener datos del Artículo 9 | Lista de semillas y configuración del crawl |
| Después de la recopilación | Borrar sin demora lo que se coló | Pipeline de ingesta y job de retención |
| Durante el desarrollo del modelo | Probar que el modelo resiste la extracción de esos datos | Suite de evaluación |
| Después del despliegue | Monitorizar las salidas en busca de fugas | Telemetría de producción |
Esos son cuatro dueños distintos. Una historia de compliance que se detiene en la ingesta cubre una cuarta parte de lo requerido.
¿Tienes que avisar a la gente de que hiciste scraping de sus datos?
Individualmente, normalmente no. El Artículo 14(5)(b) exime del aviso directo cuando supondría un esfuerzo desproporcionado, y notificar a cada persona representada en un corpus a escala web califica. No es un pase libre: sigues teniendo que publicar un aviso de privacidad público que cubra las categorías de datos, los propósitos, la base legal y una lista de fuentes lo más completa posible — idealmente nombres de dominio buscables con fechas de recopilación. Los mecanismos de opt-out previos a la recopilación figuran como buena práctica.
Ese último requisito es una decisión de esquema disfrazada de decisión legal. Si el crawler no registra el dominio de origen y la fecha de recopilación por registro, no puedes producir esa página más tarde, y reconstruir la procedencia de cientos de millones de documentos no es realista. Dos columnas en el momento de escritura, como en el SourceRecord de arriba.
¿Eres el responsable o el encargado del tratamiento?
La entidad que ejecuta el scraper no es automáticamente el responsable del tratamiento, y la distinción decide quién carga con todo lo anterior.
- Hacer scraping siguiendo instrucciones documentadas — objetivos, criterios y propósitos fijados por un cliente — se parece a actuar como encargado. Consigue las instrucciones por escrito; eso es lo que hace defendible el rol.
- Elegir tus propios objetivos y propósitos te convierte en responsable del tratamiento, incluso cuando más tarde vendes o publicas el corpus.
- Reutilizar un dataset que otro obtuvo con scraping deja a cada parte responsable de su propio tratamiento, salvo que los propósitos y los medios se determinen conjuntamente.
Si vendes scraping como servicio, la distancia entre "el cliente especificó los dominios" y "nosotros elegimos los dominios" es la distancia entre las obligaciones de encargado y las de responsable.
¿En qué se diferencia la posición de EE. UU.?
En EE. UU. no existe una ley federal de web scraping. Las demandas bajo la Computer Fraud and Abuse Act (CFAA) dirigidas contra el scraping de datos públicamente accesibles han fracasado repetidamente, siendo la línea de casos de hiQ v. LinkedIn el ejemplo más conocido. Eso no significa que el scraping en EE. UU. no esté regulado: los términos contractuales, el copyright y las leyes estatales de privacidad concentran la exposición.
El copyright es el frente activo para el entrenamiento de IA. El análisis de mayo de 2026 de Ropes & Gray señala que usar datos obtenidos con scraping para entrenar modelos, y para alimentar la generación aumentada por recuperación, puede implicar el derecho de reproducción bajo la ley de copyright de EE. UU., citando el informe de 2024 de la U.S. Copyright Office.
| Cuestión | UE (RGPD + Directrices 03/2026) | EE. UU. |
|---|---|---|
| Norma aplicable | RGPD; test de interés legítimo del Artículo 6(1)(f) | Sin ley federal de scraping |
| Acceso a datos públicos | Base legal requerida aunque el acceso sea público | Las demandas CFAA han fracasado repetidamente (línea hiQ) |
robots.txt | Evidencia en el test de ponderación | Se encuadra en contratos y términos de servicio |
| Uso para entrenamiento | El propósito debe sobrevivir a necesidad y ponderación | Puede implicar el derecho de reproducción |
| Transparencia | Aviso de privacidad público con lista de fuentes | Sin deber general de divulgar el scraping |
Para equipos que lanzan globalmente, el análisis de la UE es el superconjunto estricto: construye para satisfacer las Directrices 03/2026 y las cuestiones restantes de EE. UU. serán de licencias y términos, no de arquitectura.
¿Qué deberían hacer distinto los desarrolladores de scrapers?
[ ] Registra el dominio de origen + timestamp de recopilación de cada registro almacenado
[ ] Respeta robots.txt y ai.txt por defecto; registra cada decisión de omisión
[ ] Nunca te autentiques ni resuelvas CAPTCHAs para construir un corpus de entrenamiento
[ ] Prefiere crawls con patrones de inclusión sobre el seguimiento de enlaces sin restricción
[ ] Mantén los criterios de crawl en control de versiones — son tu evidencia de necesidad
[ ] Escribe las alternativas que descartaste (sintéticas, más estrechas, seudonimizadas)
[ ] Excluye categorías de sitios estructuralmente sensibles en la lista de semillas
[ ] Filtra y seudonimiza identificadores antes de que nada llegue al almacenamiento duradero
[ ] Publica un aviso de privacidad: categorías, propósitos, base legal, lista de fuentes
[ ] Ofrece un opt-out previo a la recopilación y respétalo en la lista de semillas
El desglose de las directrices de Reed Smith recomienda empezar con un análisis de brechas contra el test de tres partes — sensato, porque la mayoría de las brechas resultan ser de logging y documentación más que de código. Si estás montando un corpus de entrenamiento, nuestra guía de web scraping para datos de entrenamiento de IA cubre el lado del pipeline del mismo problema.
Dónde encaja CrawlForge
Siendo honestos: se encarga de las partes mecánicas y de nada del criterio.
Las herramientas de crawling respetan robots.txt por defecto — crawl_deep acepta respect_robots por llamada, y el servidor lee RESPECT_ROBOTS_TXT para el valor global por defecto. Desactivar el cumplimiento es, por tanto, posible, y desde julio de 2026 esa es una decisión que vale la pena registrar junto con su motivo. El rate limiting es educado por defecto, y las herramientas descargan páginas públicamente accesibles — sin eludir muros de login. Los controles de acceso y la protección contra SSRF vienen activados por defecto, por las razones cubiertas en nuestro artículo sobre SSRF en servidores MCP.
Lo que ninguna herramienta hace es convertir un pipeline ilegal en legal. Ninguna de las 27 herramientas elige tu base legal, escribe tu aviso de privacidad, documenta las alternativas que descartaste ni decide si tu corpus necesitaba ese dominio. Esas son obligaciones del operador, y las Directrices 03/2026 las ponen sobre el responsable del tratamiento.
¿Construyes pipelines de IA sobre datos web en vivo? Empieza gratis con 1,000 credits — robots.txt respetado por defecto en las 27 herramientas, sin tarjeta. Consulta la documentación o la guía de web scraping para datos de entrenamiento de IA.
Pruébalo tú mismo — sin necesidad de registrarte
Ejecuta cualquiera de las 28 herramientas de scraping y extracción de CrawlForge en el playground y luego empieza gratis con 1,000 credits.
1,000 credits gratis • Por única vez • No se requiere tarjeta de crédito
Etiquetas
Sobre el autor
Mantente al día con los últimos artículos
Recibe tutoriales, novedades del producto y consejos de web scraping en tu bandeja de entrada.
Sin spam. Cancela tu suscripción cuando quieras.