Seguridad y tratamiento de datos
Qué sale de su máquina, qué conservamos, durante cuánto tiempo y con quién lo compartimos. Cada plazo de esta página es el que aplica el código.
Última actualización: September 2026
Navegación rápida
Cómo fluyen sus datos
CrawlForge tiene dos vías de acceso. El MCP server se ejecuta en su máquina y se comunica directamente con los sitios web. La API REST se ejecuta en nuestros servidores. Tratan sus datos de forma distinta, por lo que se describen por separado.
Ruta MCP: los resultados permanecen en su máquina
- •Usted instala crawlforge-mcp-server en su máquina. Su cliente MCP (Claude Desktop, Claude Code, Cursor y otros) se comunica con él por stdio.
- •El servidor obtiene los sitios de destino desde su red. El contenido de las páginas, los datos extraídos y las capturas de pantalla se devuelven a su cliente y nunca pasan por CrawlForge.
- •El servidor llama a nuestra API para tres cosas: validar su clave de API al iniciarse, leer su saldo de credits e informar de cada llamada después de ejecutarla.
- •Un informe de uso contiene el nombre de la herramienta, los credits usados, el estado, la duración, la versión del servidor y los parámetros de la llamada con los secretos enmascarados. Nunca contiene el resultado.
- •Las herramientas que usan un modelo de lenguaje lo ejecutan donde usted lo configure: una instancia local de Ollama por defecto, o un proveedor para el que haya configurado una clave de API. Ese tráfico va de su máquina a ese proveedor, no a nosotros.
Ruta REST: los resultados pasan por nuestros servidores y se devuelven, no se conservan
- •Su solicitud llega a una función serverless en Vercel. La función obtiene el sitio de destino, identificada y firmada como CrawlForge, construye la respuesta y se la devuelve.
- •Cinco herramientas (stealth_mode, scrape_with_actions, agent, extract_with_llm y list_ollama_models) se ejecutan en un worker de navegador que operamos en Render. El contenido de la página pasa por ese worker mientras se ejecuta la llamada.
- •Las respuestas no se almacenan, con tres excepciones de duración limitada que figuran en la tabla de conservación: los resultados de lotes asíncronos, las líneas base de seguimiento de cambios y los resultados de gran tamaño retenidos para read_result.
- •Se escribe una fila de uso por llamada, con los mismos parámetros enmascarados que en la ruta MCP, más el endpoint y el método.
- •La API REST no ejecuta ningún modelo de lenguaje propio. extract_with_llm y agent envían texto al endpoint de modelo configurado en el worker de Render.
Qué conservamos y durante cuánto tiempo
Esta tabla es el calendario de conservación de CrawlForge. La política de privacidad muestra la misma tabla. Cada plazo procede de la ruta de código que lo aplica; cuando un plazo lo fija un proveedor y no nosotros, la tabla lo indica.
| Datos | Dónde se guardan | Plazo | Notas |
|---|---|---|---|
| Resultados de herramientas en la ruta MCP (contenido de páginas, datos extraídos, capturas de pantalla) | Solo en su máquina | Nunca se envían a CrawlForge | El MCP server obtiene los sitios directamente e informa solo metadatos de uso a nuestra API. |
| Resultados de herramientas en la ruta REST | Se devuelven en la respuesta HTTP | No se almacenan | Los tres almacenes de duración limitada que figuran a continuación son las únicas excepciones. |
| Resultados de lotes (trabajos asíncronos de batch_scrape, que se leen con get_batch_results) | Redis (Upstash) | 24 horas | Caducan por sí solos. El id del trabajo es la única forma de leerlos. |
| Líneas base de seguimiento de cambios (el texto de la página capturado por track_changes) | Redis (Upstash) | 90 días | Crear una nueva línea base para la misma URL y el mismo selector sustituye la anterior y reinicia el plazo. |
| Líneas base de monitores alojados (el último texto capturado de cada página monitorizada) | PostgreSQL (Neon) | Hasta que se elimina el monitor | Cada comprobación sustituye la captura anterior, por lo que solo se conserva el texto más reciente de cada objetivo. Eliminar el monitor elimina sus líneas base. |
| Comprobaciones de monitores alojados (estado, recuentos, credits y las líneas añadidas y eliminadas de cada objetivo en cada comprobación) | PostgreSQL (Neon) | 30 días por defecto, de 1 a 365 días configurables por monitor | La ejecución programada elimina las comprobaciones más antiguas; eliminar el monitor elimina su historial. |
| Resultados de gran tamaño retenidos para read_result (un resultado demasiado grande para devolverlo en línea) | Redis (Upstash) | 1 hora | Se almacenan bajo su cuenta. El handle del resultado es la única forma de leerlos. |
| Registros de uso: nombre de la herramienta, parámetros enmascarados (incluida la URL o consulta de destino), estado, duración, credits, id de la clave de API y versión del cliente | PostgreSQL (Neon) | 12 meses | Un trabajo diario elimina las filas más antiguas. Los secretos se enmascaran antes de escribir una fila y de nuevo antes de mostrarla en el panel. |
| Datos de la cuenta: correo electrónico, nombre, hash de la contraseña, ids de los proveedores de inicio de sesión, configuración, saldo de credits y respuestas a la encuesta de opinión | PostgreSQL (Neon) | Mientras exista su cuenta | Se eliminan junto con la cuenta. Consulte Eliminación de la cuenta más abajo. |
| Claves de API | PostgreSQL (Neon), como hash SHA-256 con sal más el prefijo de la clave | Hasta que usted las revoque | La clave completa se muestra una sola vez, al crearla. No se almacena y no puede volver a mostrarse. |
| Sesiones de inicio de sesión | Cookies httpOnly, con una caché de verificación en Redis (Upstash) | Token de acceso 15 minutos, token de actualización 7 días | Cerrar sesión borra ambos. La caché de verificación caduca a los 5 minutos. |
| Tokens de restablecimiento de contraseña y de verificación de correo electrónico | PostgreSQL (Neon), con hash | Enlaces de restablecimiento 1 hora, enlaces de verificación 24 horas | De un solo uso. El enlace del correo es la única copia del token. |
| Datos de prevención de fraude: huella digital del dispositivo, puntuación de riesgo y contadores de límite de tasa de registro | PostgreSQL (Neon) y Redis (Upstash) | Huellas digitales y puntuaciones de riesgo hasta la eliminación de la cuenta; contadores de límite de tasa de 1 hora a 30 días | Se usan solo para bloquear registros y creaciones de claves abusivos. Nunca se usan para elaborar perfiles ni para publicidad. |
| Registros de pago | Stripe | Mientras lo exija la legislación fiscal y contable | Almacenamos los ids de cliente y de suscripción de Stripe, el plan y el período de facturación. Los números de tarjeta nunca llegan a nuestros servidores. |
| Suscripción al boletín (dirección de correo electrónico) | PostgreSQL (Neon) | Hasta que se dé de baja | Cada boletín incluye un enlace para darse de baja. |
| Cuentas eliminadas | PostgreSQL (Neon) | Se eliminan en un plazo de 30 días desde su solicitud | La cuenta, las claves, los registros de uso, las suscripciones, las huellas digitales, las puntuaciones de riesgo y los tokens se eliminan a la vez. Las entradas de Redis caducan según los plazos anteriores. Stripe conserva los registros de pago según exige la ley. |
- Datos
- Resultados de herramientas en la ruta MCP (contenido de páginas, datos extraídos, capturas de pantalla)
- Dónde se guardan
- Solo en su máquina
- Plazo
- Nunca se envían a CrawlForge
- Notas
- El MCP server obtiene los sitios directamente e informa solo metadatos de uso a nuestra API.
- Datos
- Resultados de herramientas en la ruta REST
- Dónde se guardan
- Se devuelven en la respuesta HTTP
- Plazo
- No se almacenan
- Notas
- Los tres almacenes de duración limitada que figuran a continuación son las únicas excepciones.
- Datos
- Resultados de lotes (trabajos asíncronos de batch_scrape, que se leen con get_batch_results)
- Dónde se guardan
- Redis (Upstash)
- Plazo
- 24 horas
- Notas
- Caducan por sí solos. El id del trabajo es la única forma de leerlos.
- Datos
- Líneas base de seguimiento de cambios (el texto de la página capturado por track_changes)
- Dónde se guardan
- Redis (Upstash)
- Plazo
- 90 días
- Notas
- Crear una nueva línea base para la misma URL y el mismo selector sustituye la anterior y reinicia el plazo.
- Datos
- Líneas base de monitores alojados (el último texto capturado de cada página monitorizada)
- Dónde se guardan
- PostgreSQL (Neon)
- Plazo
- Hasta que se elimina el monitor
- Notas
- Cada comprobación sustituye la captura anterior, por lo que solo se conserva el texto más reciente de cada objetivo. Eliminar el monitor elimina sus líneas base.
- Datos
- Comprobaciones de monitores alojados (estado, recuentos, credits y las líneas añadidas y eliminadas de cada objetivo en cada comprobación)
- Dónde se guardan
- PostgreSQL (Neon)
- Plazo
- 30 días por defecto, de 1 a 365 días configurables por monitor
- Notas
- La ejecución programada elimina las comprobaciones más antiguas; eliminar el monitor elimina su historial.
- Datos
- Resultados de gran tamaño retenidos para read_result (un resultado demasiado grande para devolverlo en línea)
- Dónde se guardan
- Redis (Upstash)
- Plazo
- 1 hora
- Notas
- Se almacenan bajo su cuenta. El handle del resultado es la única forma de leerlos.
- Datos
- Registros de uso: nombre de la herramienta, parámetros enmascarados (incluida la URL o consulta de destino), estado, duración, credits, id de la clave de API y versión del cliente
- Dónde se guardan
- PostgreSQL (Neon)
- Plazo
- 12 meses
- Notas
- Un trabajo diario elimina las filas más antiguas. Los secretos se enmascaran antes de escribir una fila y de nuevo antes de mostrarla en el panel.
- Datos
- Datos de la cuenta: correo electrónico, nombre, hash de la contraseña, ids de los proveedores de inicio de sesión, configuración, saldo de credits y respuestas a la encuesta de opinión
- Dónde se guardan
- PostgreSQL (Neon)
- Plazo
- Mientras exista su cuenta
- Notas
- Se eliminan junto con la cuenta. Consulte Eliminación de la cuenta más abajo.
- Datos
- Claves de API
- Dónde se guardan
- PostgreSQL (Neon), como hash SHA-256 con sal más el prefijo de la clave
- Plazo
- Hasta que usted las revoque
- Notas
- La clave completa se muestra una sola vez, al crearla. No se almacena y no puede volver a mostrarse.
- Datos
- Sesiones de inicio de sesión
- Dónde se guardan
- Cookies httpOnly, con una caché de verificación en Redis (Upstash)
- Plazo
- Token de acceso 15 minutos, token de actualización 7 días
- Notas
- Cerrar sesión borra ambos. La caché de verificación caduca a los 5 minutos.
- Datos
- Tokens de restablecimiento de contraseña y de verificación de correo electrónico
- Dónde se guardan
- PostgreSQL (Neon), con hash
- Plazo
- Enlaces de restablecimiento 1 hora, enlaces de verificación 24 horas
- Notas
- De un solo uso. El enlace del correo es la única copia del token.
- Datos
- Datos de prevención de fraude: huella digital del dispositivo, puntuación de riesgo y contadores de límite de tasa de registro
- Dónde se guardan
- PostgreSQL (Neon) y Redis (Upstash)
- Plazo
- Huellas digitales y puntuaciones de riesgo hasta la eliminación de la cuenta; contadores de límite de tasa de 1 hora a 30 días
- Notas
- Se usan solo para bloquear registros y creaciones de claves abusivos. Nunca se usan para elaborar perfiles ni para publicidad.
- Datos
- Registros de pago
- Dónde se guardan
- Stripe
- Plazo
- Mientras lo exija la legislación fiscal y contable
- Notas
- Almacenamos los ids de cliente y de suscripción de Stripe, el plan y el período de facturación. Los números de tarjeta nunca llegan a nuestros servidores.
- Datos
- Suscripción al boletín (dirección de correo electrónico)
- Dónde se guardan
- PostgreSQL (Neon)
- Plazo
- Hasta que se dé de baja
- Notas
- Cada boletín incluye un enlace para darse de baja.
- Datos
- Cuentas eliminadas
- Dónde se guardan
- PostgreSQL (Neon)
- Plazo
- Se eliminan en un plazo de 30 días desde su solicitud
- Notas
- La cuenta, las claves, los registros de uso, las suscripciones, las huellas digitales, las puntuaciones de riesgo y los tokens se eliminan a la vez. Las entradas de Redis caducan según los plazos anteriores. Stripe conserva los registros de pago según exige la ley.
Las dos filas de monitores alojados solo se aplican cuando creas un monitor. Una cuenta sin monitores no conserva ningún dato de monitores.
Subencargados
Estos son los proveedores que reciben sus datos cuando usa CrawlForge, y qué recibe cada uno. Los sitios web de destino no son subencargados: reciben la solicitud de nuestro rastreador, identificada como CrawlForge, y nada sobre su cuenta.
| Proveedor | Finalidad | Qué recibe |
|---|---|---|
| Vercel | Alojamiento del sitio web, el panel y la API REST | Cada solicitud: dirección IP, cabeceras y cuerpo de la solicitud. |
| Neon | Base de datos PostgreSQL | Datos de la cuenta, hashes de claves de API, registros de uso, suscripciones y datos de prevención de fraude. |
| Upstash | Redis | Caché de verificación de sesiones, límites de tasa, reservas de credits, resultados de lotes, líneas base de seguimiento de cambios, resultados de gran tamaño, idempotencia de webhooks e indicadores de deduplicación de correos. |
| Render | Worker de navegador y de modelo de lenguaje para cinco herramientas REST: stealth_mode, scrape_with_actions, agent, extract_with_llm y list_ollama_models | La URL de destino, los parámetros de la solicitud y el contenido de la página mientras se ejecuta la llamada. El texto que extract_with_llm y agent envían a un modelo de lenguaje va al endpoint de modelo configurado en este worker. |
| Stripe | Pagos y suscripciones | Correo electrónico, nombre, los datos de la tarjeta que introduce en la página de pago de Stripe y el historial de compras. |
| Resend | Correo electrónico transaccional | Dirección de correo electrónico, nombre y el contenido de cada correo: enlaces de verificación, restablecimientos de contraseña, avisos de facturación y de credits, y el boletín. |
| Sentry | Monitorización de errores | Trazas de pila y metadatos de la solicitud. Las cookies, las cabeceras de autorización, las claves de API, los tokens y las contraseñas se eliminan antes de enviar un evento. |
| Google, GitHub | Inicio de sesión con Google o GitHub, solo si usted lo elige | Recibimos su correo electrónico, nombre y avatar del proveedor. El proveedor sabe que usted inició sesión en CrawlForge. |
| Google Custom Search, DataForSEO | Resultados de búsqueda para search_web y serp_rank | La consulta de búsqueda y, en el caso de serp_rank, el dominio cuya posición se comprueba. |
| Arctic Shift, PullPush, reddit.com | Archivos de Reddit para reddit_search | La consulta de búsqueda. |
- Proveedor
- Vercel
- Finalidad
- Alojamiento del sitio web, el panel y la API REST
- Qué recibe
- Cada solicitud: dirección IP, cabeceras y cuerpo de la solicitud.
- Proveedor
- Neon
- Finalidad
- Base de datos PostgreSQL
- Qué recibe
- Datos de la cuenta, hashes de claves de API, registros de uso, suscripciones y datos de prevención de fraude.
- Proveedor
- Upstash
- Finalidad
- Redis
- Qué recibe
- Caché de verificación de sesiones, límites de tasa, reservas de credits, resultados de lotes, líneas base de seguimiento de cambios, resultados de gran tamaño, idempotencia de webhooks e indicadores de deduplicación de correos.
- Proveedor
- Render
- Finalidad
- Worker de navegador y de modelo de lenguaje para cinco herramientas REST: stealth_mode, scrape_with_actions, agent, extract_with_llm y list_ollama_models
- Qué recibe
- La URL de destino, los parámetros de la solicitud y el contenido de la página mientras se ejecuta la llamada. El texto que extract_with_llm y agent envían a un modelo de lenguaje va al endpoint de modelo configurado en este worker.
- Proveedor
- Stripe
- Finalidad
- Pagos y suscripciones
- Qué recibe
- Correo electrónico, nombre, los datos de la tarjeta que introduce en la página de pago de Stripe y el historial de compras.
- Proveedor
- Resend
- Finalidad
- Correo electrónico transaccional
- Qué recibe
- Dirección de correo electrónico, nombre y el contenido de cada correo: enlaces de verificación, restablecimientos de contraseña, avisos de facturación y de credits, y el boletín.
- Proveedor
- Sentry
- Finalidad
- Monitorización de errores
- Qué recibe
- Trazas de pila y metadatos de la solicitud. Las cookies, las cabeceras de autorización, las claves de API, los tokens y las contraseñas se eliminan antes de enviar un evento.
- Proveedor
- Google, GitHub
- Finalidad
- Inicio de sesión con Google o GitHub, solo si usted lo elige
- Qué recibe
- Recibimos su correo electrónico, nombre y avatar del proveedor. El proveedor sabe que usted inició sesión en CrawlForge.
- Proveedor
- Google Custom Search, DataForSEO
- Finalidad
- Resultados de búsqueda para search_web y serp_rank
- Qué recibe
- La consulta de búsqueda y, en el caso de serp_rank, el dominio cuya posición se comprueba.
- Proveedor
- Arctic Shift, PullPush, reddit.com
- Finalidad
- Archivos de Reddit para reddit_search
- Qué recibe
- La consulta de búsqueda.
Nuestra infraestructura principal está en Estados Unidos. Añadimos un proveedor a esta lista antes de que reciba datos de clientes.
Identidad del rastreador y controles para propietarios de sitios
Ambas superficies se identifican de la misma manera y siguen las mismas reglas en cada solicitud. Los propietarios de sitios pueden verificarnos, limitarnos la tasa o bloquearnos sin tener que adivinar.
- •Cada solicitud saliente lleva el User-Agent CrawlForge/<version> (+https://crawlforge.dev). El token de producto es CrawlForge tanto en el MCP server como en la API REST.
- •Cada solicitud saliente se firma con Ed25519 según RFC 9421 (el perfil Web Bot Auth). El directorio de claves públicas está en /.well-known/http-message-signatures-directory, de modo que un sitio puede verificar que una solicitud que dice ser de CrawlForge lo es realmente.
- •robots.txt se respeta por defecto en ambas superficies. Quien llama puede pasar respect_robots: false; la anulación es explícita, devuelve una advertencia en la respuesta y queda registrada contra la clave de API en el registro de uso.
- •No resolvemos CAPTCHAs ni falsificamos tokens de desafío. Una página de desafío se notifica como bloqueada, no se elude. stealth_mode hace que un navegador real renderice como un navegador real; no vence controles de acceso.
- •Un propietario de sitio que se excluye se añade a una lista de bloqueo permanente que se aplica en ambas superficies y que ningún cliente puede anular. Escriba a simon@crawlforge.dev para excluirse.
- •El token retirado CrawlForge-Bot se sigue respetando como regla de exclusión, de modo que las reglas que los propietarios de sitios escribieron antes del cambio de nombre siguen funcionando.
Credenciales y cifrado
Qué hacemos con los secretos que nos confía, y qué no afirmamos.
- •Todo el tráfico hacia crawlforge.dev usa TLS, y el sitio envía una cabecera Strict-Transport-Security.
- •Las contraseñas se almacenan con hash bcrypt. Nunca vemos ni almacenamos la contraseña en sí.
- •Las claves de API se almacenan como hash SHA-256 con una sal del lado del servidor, junto con el prefijo de la clave que se muestra en el panel. La clave completa existe en texto plano una sola vez, en la respuesta que la crea. No podemos recuperarla, así que una clave perdida se revoca y se sustituye, no se recupera.
- •Las sesiones de inicio de sesión usan un JWT de 15 minutos y un token de actualización de 7 días, ambos en cookies httpOnly, secure y same-site. Las solicitudes del panel que cambian el estado llevan un token CSRF.
- •Los enlaces de restablecimiento de contraseña y de verificación de correo electrónico son tokens de un solo uso almacenados como hash, con caducidad de 1 hora y 24 horas respectivamente.
- •Los secretos de sus solicitudes, como una contraseña escrita por scrape_with_actions, credenciales de proxy o una cabecera de autorización, se enmascaran antes de escribir una fila de uso y de nuevo antes de mostrarla en el panel.
- •Neon y Upstash cifran los datos almacenados en reposo, y toda conexión con ellos usa TLS.
- •Lo que no afirmamos: CrawlForge no cuenta con certificación SOC 2 ni ISO 27001, todavía no ofrece autenticación multifactor en las cuentas y no encarga pruebas de penetración a terceros. Si su proceso de compra exige alguna de ellas, pregúntenos en qué punto está antes de comprar.
Eliminación de la cuenta
Por ahora, la eliminación se hace a petición. El panel aún no ofrece una eliminación de autoservicio.
- •Envíe un correo a simon@crawlforge.dev desde la dirección de su cuenta con el asunto "Delete my account" (eliminar mi cuenta). Confirmamos por respuesta antes de eliminar nada.
- •Cancele primero cualquier suscripción activa, o pídanos que la cancelemos como parte de la eliminación. Los credits no usados no se reembolsan.
- •En un plazo de 30 días eliminamos la fila de la cuenta y, con ella, sus claves de API, registros de uso, registros de suscripción, huellas digitales de dispositivo, puntuaciones de riesgo y tokens. Las entradas de Redis caducan según los plazos de la tabla de conservación, 90 días como máximo.
- •Stripe conserva los registros de pago mientras lo exija la legislación fiscal y contable. No conservamos nada que le identifique una vez completada la eliminación.
- •Si se suscribió al boletín, indíquelo en la solicitud y la suscripción se elimina al mismo tiempo.
Divulgación de vulnerabilidades
Si encuentra un problema de seguridad en el sitio web, la API, el paquete crawlforge-mcp-server o los SDK, comuníquenoslo directamente. Los detalles también están publicados en /.well-known/security.txt.
- •Envíe un correo a simon@crawlforge.dev con el asunto "Security" (seguridad). Incluya la URL o la herramienta afectada, los pasos para reproducirlo y el impacto que observó.
- •Acusamos recibo de los informes en un plazo de cinco días hábiles y le mantenemos informado hasta que el problema quede corregido. No tenemos un programa de recompensas de pago.
- •Pruebe solo con su propia cuenta y sus propias claves de API. No acceda, modifique ni elimine datos de otros clientes.
- •Nada de denegación de servicio, ni escaneos masivos, ni ingeniería social contra las personas que trabajan en CrawlForge, ni pruebas contra los sitios web de destino que obtienen nuestras herramientas.
- •Deténgase en cuanto pueda demostrar el problema y notifíquelo. No conserve los datos a los que haya accedido.
- •Pedimos un tiempo razonable para corregir un problema antes de que se publique, y le daremos crédito en la corrección si así lo desea.
La investigación que sigue estas reglas está autorizada. No emprenderemos acciones legales contra ella ni la denunciaremos a las autoridades.
Políticas relacionadas
Política de Privacidad
Qué recopilamos, por qué, y sus derechos según el RGPD y la CCPA
Política de Uso Aceptable
Directrices para el uso ético y legal de nuestras herramientas de web scraping
Verificación del rastreador de CrawlForge
Patrón de User-Agent, firmas Web Bot Auth y reglas de robots.txt para propietarios de sitios
Contenido no confiable e inyección de prompts
El modelo de confianza para el texto de páginas que llega a su agente, y lo que deliberadamente no saneamos
¿Preguntas sobre seguridad?
Si necesita algo que esta página no responde, como un acuerdo de tratamiento de datos o la descripción de un control antes de comprar, escríbanos.
simon@crawlforge.dev