Ir al contenido
SealMetrics
Privacidad

Cómo auditar si la IA de tu analítica es realmente privada (checklist de 5 preguntas)

7 min de lecturaPor Rafa Jiménez

Casi todas las páginas de privacidad sobre IA están escritas para sobrevivir a una lectura en diagonal. Cinco preguntas rompen ese truco: quién es dueño de la inferencia, dónde se ejecuta, qué se guarda, qué entrena y si puedes marcharte. Hazlas en ese orden y el marketing se cae en unos diez minutos.

Conclusiones clave

  • La primera pregunta es la puerta: si la empresa que ejecuta la inferencia tiene matriz estadounidense, la CLOUD Act sigue a la matriz, no al centro de datos, y las otras cuatro respuestas no pueden deshacerlo.
  • "Podemos procesar en la UE" no es lo mismo que "solo procesamos en la UE". Pide exclusividad y pregunta si un endpoint global puede enrutar la petición a otro sitio.
  • Los compromisos de retención y de no entrenamiento van en el contrato de encargo del tratamiento y en la lista de subencargados, no en una página de marketing. Una excepción acotada y documentada es aceptable; una vaga, no.
  • La portabilidad también es una cuestión de privacidad: un modelo de pesos abiertos se puede fijar, inspeccionar y reproducir, mientras que una API cerrada puede cambiar bajo tus pies sin avisar.

Hoy toda herramienta de analítica tiene una función de IA, y toda función de IA tiene su página de privacidad. Se leen bien. También están escritas, en general, para tranquilizar más que para poder ser desmentidas: mucho "nivel empresarial" y muy poco sobre quién ejecuta exactamente el modelo y qué pasa con la petición.

No necesitas formación jurídica para comprobarlo. Necesitas cinco preguntas hechas en el orden correcto, porque el orden importa: la primera puede invalidar las respuestas a todas las demás. Mándalas por correo, pide respuestas por escrito y guárdalas. Ese intercambio es, además, la prueba que tu expediente de responsabilidad proactiva necesita.

Pregunta 1: ¿quién es propietario de la empresa que ejecuta la inferencia?

No quién te vende el producto, sino quién opera la máquina donde corre el modelo. Suelen ser empresas distintas, y la que importa es la segunda.

El motivo es jurisdiccional. La CLOUD Act estadounidense (2018) obliga a cualquier proveedor sujeto a jurisdicción de EE. UU. a entregar los datos que posea o controle, con independencia de en qué punto del mundo estén almacenados. La sección 702 de FISA añade un régimen aparte de recopilación de inteligencia exterior dirigido a personas no estadounidenses. Ambos siguen a la matriz corporativa. A ninguno le afecta qué región elegiste en un desplegable.

Así que si la respuesta menciona un grupo con sede en EE. UU., estás en el terreno de la residencia, no en el de la soberanía, y deberías parar a evaluar esa exposición antes de invertir tiempo en el resto del checklist. Desarrollamos esta distinción con más detalle en Residencia no es soberanía.

Pregunta 2: ¿dónde se ejecuta la inferencia, en exclusiva?

La palabra que sostiene la frase es exclusiva. Muchos proveedores pueden procesar en Europa. Bastantes menos se comprometen a no procesar en ningún otro sitio, y en la distancia entre esas dos afirmaciones es donde viven los incidentes.

Merece la pena hacer dos repreguntas. Primera: el endpoint al que llamas realmente, ¿fija una región o es un endpoint global que puede enrutar según capacidad? Vertex AI de Google, por ejemplo, permite fijar región en la UE, pero su endpoint global no da ningún control sobre dónde ocurre el procesamiento: mismo proveedor, dos respuestas muy distintas. Segunda: ¿el failover y la capacidad de desbordamiento están en la misma región? Un estado estable anclado a una región con un failover sin anclar no es procesamiento exclusivo en la UE.

También conviene conocer cómo está el mercado. Los proveedores estadounidenses han construido opciones europeas reales: OpenAI ofrece residencia de datos en la UE configurable por proyecto y con retención cero en la región; Azure OpenAI ofrece un tipo de despliegue con EU Data Boundary. La API propia de Anthropic no tiene opción de residencia en la UE: el procesamiento europeo pasa por las regiones UE de AWS Bedrock o por Google Vertex AI. Son mejoras auténticas frente a mandar los datos a Virginia. Ninguna cambia la respuesta a la primera pregunta.

Pregunta 3: ¿qué se conserva y durante cuánto tiempo?

Pregunta por tres cosas por separado, porque los proveedores suelen responder a una y dejar que des por supuestas las demás: el contenido del prompt, la salida del modelo y los metadatos de la llamada.

Una respuesta creíble de retención cero enumera sus excepciones. Un proveedor que dice "no conservamos nada, nunca, bajo ninguna circunstancia" o no está operando la infraestructura o no la está describiendo con precisión: los sistemas reales guardan algo cuando algo se rompe. Lo que quieres es el límite escrito: qué condición dispara la retención, qué se guarda, durante cuánto tiempo y quién puede leerlo.

Los metadatos son la parte que todo el mundo olvida. Contar tokens para facturar es legítimo y necesario. Almacenar el texto de todas las preguntas que ha hecho tu equipo, indefinidamente, para "mejorar la experiencia" es otra cosa muy distinta con el mismo nombre.

Pregunta 4: ¿hay algo que entrene un modelo?

Tiene una versión limpia y una versión blanda, y tú quieres la limpia. Limpia: las entradas y salidas de cliente nunca se usan para entrenar, ajustar ni mejorar ningún modelo, sin que tengas que hacer nada. Blanda: "no entrenamos con tus datos" seguido, varios párrafos después, de una excepción para datos agregados, desidentificados o de telemetría.

Comprueba dónde vive el compromiso. Si solo está en un post o en unas FAQ, es una declaración de intenciones actual. Si está en el contrato de encargo del tratamiento, es una obligación. Y si el compromiso depende de que alguien haya activado un interruptor en un panel de administración, entonces tu postura de privacidad depende de la configuración, es decir, de quien la configure la próxima vez.

Pregunta 5: ¿puedes marcharte y puedes reproducir lo que pasó?

Es la pregunta que casi nadie hace, y la que decide si tu expediente de cumplimiento seguirá significando algo dentro de doce meses.

Un modelo detrás de una API cerrada puede cambiar sin avisar. La versión que evaluaste, sometiste a red teaming y documentaste en tu análisis de riesgos puede no ser la que responda a tus consultas el trimestre que viene, y no tendrás forma de demostrar lo contrario. Un modelo de pesos abiertos con licencia permisiva se puede fijar a una versión exacta, inspeccionar, someter a red teaming y reproducir; y si el proveedor de hosting te decepciona, esos mismos pesos están disponibles en otros, de modo que cambiar es una decisión de infraestructura y no una reconstrucción.

La portabilidad suele archivarse en compras. Su sitio está en la revisión de privacidad, porque la reproducibilidad es lo que convierte una afirmación en prueba.

Cómo suena una buena respuesta y cómo suena una evasiva

Rara vez recibirás una negativa frontal. Lo que recibirás es una respuesta a una pregunta parecida. Esta tabla es un descodificador aproximado.

PreguntaRespuesta evasivaRespuesta que quieres
1. ¿Quién es dueño de la inferencia?«Trabajamos con proveedores de nivel empresarial con sólidos compromisos de privacidad.»Entidad jurídica concreta, país de constitución y matriz última, en la lista de subencargados.
2. ¿Dónde se ejecuta?«Tus datos pueden procesarse en la UE.»«La inferencia se ejecuta únicamente en <país concreto>. Sin endpoint global y sin failover entre regiones.»
3. ¿Qué se conserva?«Conservamos los datos solo el tiempo necesario.»Retención cero por defecto, con cada excepción nombrada, acotada en el tiempo y documentada.
4. ¿Algo entrena un modelo?«No entrenamos con tus datos», más una excepción para datos agregados o desidentificados.Sin entrenamiento con entradas ni salidas, recogido en el contrato de encargo, y sin que tengas que solicitar exclusión.
5. ¿Puedes marcharte?«El modelo es propietario y mejora de forma continua.»Modelo de pesos abiertos y licencia con nombre, versión fijada, disponible en más de un proveedor.

Una regla general: una respuesta fácil de verificar vale más que una respuesta impresionante. "Scaleway SAS, París, Francia" se comprueba en una tarde. "Infraestructura europea líder" no se comprueba de ninguna manera.

Un ejemplo real: aplicarnos el checklist a nosotros mismos

Un checklist que nunca te aplicas a ti mismo es un documento comercial. Así que aquí van nuestras cinco respuestas, las de Seal AI, la capa de IA privada dentro de SealMetrics.

1. Propiedad. La inferencia se ejecuta en Scaleway Generative APIs. Scaleway es una empresa francesa cuya matriz es el grupo Iliad, sin capital estadounidense, y declara explícitamente que sus servicios de IA no están sujetos a leyes extraterritoriales como la CLOUD Act estadounidense. Figura como encargado del tratamiento del artículo 28 en nuestra lista de subencargados: Scaleway SAS, París, Francia, finalidad inferencia LLM.

2. Ubicación. París, Francia, y nada más. Como los datos no salen de la UE y el encargado no tiene matriz estadounidense, el Capítulo V del RGPD — el de transferencias internacionales — no llega a activarse. Sin cláusulas contractuales tipo (SCC), sin evaluación de impacto de las transferencias y sin depender de que el Marco de Privacidad de Datos UE-EE. UU. sobreviva a su próxima vista.

3. Retención. Scaleway aplica Zero Data Retention por defecto, con una excepción documentada: ante un error grave del servicio, la petición fallida puede conservarse hasta dos semanas para análisis de causa raíz. Por nuestra parte, la capa de medición persiste únicamente contadores de tokens — organización, modelo, tokens de entrada y de salida — para cuota y facturación. El contenido del prompt y de la respuesta nunca se persiste ahí. El transporte es TLS 1.2 o superior con verificación de certificado.

4. Entrenamiento. Nada. Ni entrenamiento con datos de cliente en el proveedor de hosting, ni mecanismo posible: el modelo es un conjunto estático de pesos publicados, así que tus preguntas no pueden influir en él.

5. Salida. El modelo es gpt-oss-120b, de pesos abiertos bajo licencia Apache 2.0. La versión exacta se puede fijar, inspeccionar y reproducir, y esos mismos pesos los sirven otros proveedores soberanos europeos: OVHcloud AI Endpoints, IONOS AI Model Hub con el procesamiento confinado en Alemania, y Nebius en Finlandia y Francia, aunque Nebius cotiza en EE. UU., así que ahí la gobernanza merece tanta atención como la geografía. Elegimos nuestro proveedor; no estamos atados a él.

Dos matices honestos, porque un checklist que solo produce respuestas favorables no es un checklist. Scaleway tiene ISO/IEC 27001:2022 y HDS, concedidas en julio de 2024; su cualificación SecNumCloud con la ANSSI está en curso desde enero de 2025 y no está concedida: decimos "en cualificación" y nada más fuerte. Y los clientes que prefieran otro modelo pueden configurar su propia clave de OpenAI, Anthropic, Gemini o DeepSeek, en cuyo caso sus prompts van a ese proveedor bajo los términos de ese proveedor. Es una decisión deliberada, cliente a cliente, y se mantiene claramente separada de Seal AI, que sigue siendo la opción por defecto precisamente para que la privacidad no dependa de la configuración.

Qué hacer con las respuestas

Puntúalas como lo haría un regulador: no por el tono, sino por si cada afirmación está escrita en algún sitio vinculante y comprobable. Un proveedor que responde a la primera pregunta con una entidad concreta y una matriz concreta te ha dicho más en una línea que una página entera de "privacidad de nivel empresarial". Un proveedor que no puede responderla también te ha dicho algo.

Si quieres el desarrollo técnico completo detrás de nuestras propias respuestas, está en la documentación de arquitectura de Seal AI, y la auditoría de mercado que llevó a la elección del modelo está en el informe de selección de modelo.

Lecturas relacionadas