165 — Privacidad, secretos y minimización de datos

← Clase anterior · Índice de la parte · Clase siguiente →

Parte: 13 — Evaluación, seguridad y gobernanza
Nivel: experto · Horas estimadas: 6
Laboratorio: safety · Estado: EXECUTABLE_CORE

🎯 Propósito

Comprender privacidad, secretos y minimización de datos dentro de la evolución de la inteligencia artificial, implementar un experimento mínimo verificable y distinguir qué parte constituye evidencia frente a una afirmación todavía no comprobada.

📚 Resultados de aprendizaje

Al finalizar podrás:

  1. Explicar privacidad, secretos y minimización de datos usando los conceptos privacy, secrets, minimization, retention.
  2. Ejecutar el laboratorio con una semilla explícita y revisar su contrato JSON.
  3. Identificar al menos un supuesto, una limitación y un riesgo de aplicación.
  4. Comparar el enfoque con la etapa anterior de la ruta de aprendizaje.
  5. Producir una evidencia reproducible y una conclusión que no exceda los datos.

🧩 Conceptos centrales

privacy, secrets, minimization, retention

🗺️ Ubicación en el mapa de la IA

Los modelos aprenden de datos, y esos datos pueden contener información personal o secretos. Carlini et al. (arXiv:2012.07805) demostraron en 2020 que un LLM puede memorizar y regurgitar cadenas literales de su corpus —incluidos datos personales— con solo consultarlo. Esto convirtió la privacidad de una nota legal en un problema técnico medible: qué recuerda un modelo, qué expone un sistema de IA en contexto, y cómo minimizar ambos. Es la base técnica de la normativa (GDPR, EU AI Act) que se verá en la clase 170.

📖 Fundamentos

🧠 Memorización y extracción

Un modelo memoriza cuando reproduce literalmente secuencias de su corpus en lugar de generalizar patrones. Carlini et al. mostraron un ataque de extracción de datos de entrenamiento: generando muchas muestras y puntuándolas por confianza del modelo, se recuperan cadenas memorizadas (correos, teléfonos, claves) presentes una sola vez en el corpus. Hallazgos clave:

Definición útil: una secuencia es k-eidética memorizada si el modelo la reproduce y aparecía en ≤ k documentos del corpus; cuanto menor k, mayor el riesgo de privacidad.

🔑 Secretos en el ciclo de vida de la IA

Los secretos (API keys, tokens, contraseñas, PII) pueden filtrarse en cuatro puntos:

1. Entrenamiento/fine-tuning : el secreto está en el corpus -> memorización
2. Contexto/RAG              : se inyecta PII innecesaria en el prompt -> exposición en logs
3. Prompts y logs            : se registran entradas con datos sensibles -> fuga por observabilidad
4. Salida                    : el modelo repite un secreto que vio en contexto o memorizó

Un error frecuente es concentrarse solo en el punto 1; en la práctica los puntos 2 y 3 (logs de prompts con PII) son la fuga más común y la más fácil de evitar.

✂️ Minimización de datos

Minimización es el principio de recolectar, procesar y retener el mínimo de datos personales necesario para la finalidad. Se descompone en:

🛡️ Técnicas de protección

Técnica                 Qué hace                                  Límite
Redacción/masking       elimina o sustituye PII antes de procesar depende de detectar toda la PII
Seudonimización         reemplaza identificadores por tokens      reversible si se guarda el mapa
Anonimización           rompe el vínculo con la persona           difícil de garantizar (re-identificación)
Tokenización de secretos vault + referencia, nunca el valor       requiere infraestructura
Privacidad diferencial  ruido calibrado con garantía (epsilon)    coste en utilidad; complejo
Retención y borrado     TTL y derecho de supresión                requiere trazabilidad del dato

La privacidad diferencial (DP) ofrece una garantía formal: un parámetro epsilon acota cuánto puede cambiar la salida por incluir o excluir el dato de una persona; menor epsilon = más privacidad y menos utilidad. Es la única técnica con garantía matemática, pero cuesta utilidad y es compleja de aplicar bien.

📉 Medir la fuga

🧮 Ejemplo trabajado

Auditamos memorización con canarios en un modelo fine-tuneado.

  1. Diseño: insertamos 100 canarios únicos (formato CANARY-<uuid>-<número de 9 dígitos>) en el corpus de fine-tuning, cada uno repetido un número controlado de veces: 40 aparecen 1 vez, 40 aparecen 10 veces, 20 aparecen 100 veces.
  2. Prueba de extracción: damos el prefijo CANARY-<uuid>- y medimos si el modelo completa los 9 dígitos correctos (con muestreo).
Repeticiones   canarios   completados correctamente   tasa
1x                40               2                    5.0 %
10x               40              14                   35.0 %
100x              20              17                   85.0 %
  1. Lectura: la memorización crece fuerte con la repetición (5 % → 85 %), confirmando el hallazgo de Carlini. La minimización aquí sería deduplicar el corpus: bajar los datos sensibles a ≤ 1 aparición reduce drásticamente la extracción.
  2. Riesgo de privacidad: los canarios 1x son los más peligrosos si fueran PII real —aunque su tasa es baja (5 %), cada acierto identifica a una persona única. Tasa baja ≠ riesgo bajo cuando el dato es identificable.
  3. Acción: deduplicar y filtrar PII antes del entrenamiento, y —para datos que deben quedar— evaluar privacidad diferencial con un presupuesto epsilon; documentar la tasa residual, no ocultarla.

📊 Propiedades y comparación

Punto de fuga Probabilidad práctica Coste de mitigación Mitigación principal
Memorización (entrenamiento) media alto (re-entrenar) dedup + filtrado PII + DP
PII innecesaria en contexto alta bajo minimización en contexto
Logs de prompts con PII muy alta bajo redacción antes de loguear + retención
Secreto repetido en salida media medio no meter secretos en contexto, tokenizar
flowchart TD
    A[Dato entra al sistema] --> B{Es necesario para la finalidad?}
    B -- no --> C[No recolectar / descartar]
    B -- si --> D[Minimizar: solo campos necesarios]
    D --> E{Contiene PII o secretos?}
    E -- si --> F[Redactar / seudonimizar / tokenizar]
    E -- no --> G[Procesar]
    F --> G
    G --> H[Registrar sin PII + aplicar retencion TTL]
    H --> I[Auditar memorizacion con canarios + escaneo de logs]

⚠️ Errores conceptuales frecuentes

  1. "El modelo no puede filtrar lo que no entiende". Sí puede: reproduce cadenas literales memorizadas sin "comprenderlas"; la extracción no requiere razonamiento del modelo.
  2. "Solo importa lo que hay en el corpus de entrenamiento". Las fugas más frecuentes ocurren en contexto y logs (puntos 2 y 3), no en el entrenamiento; son también las más baratas de evitar.
  3. "Tasa de memorización baja = seguro". Un solo dato único extraído identifica a una persona; el riesgo depende de identificabilidad, no solo de la tasa.
  4. "Anonimizar es trivial". La re-identificación por combinación de cuasi-identificadores (código postal + edad + género) puede revertir una anonimización mal hecha.
  5. "La privacidad diferencial es gratis". Impone un coste de utilidad medible; un epsilon muy pequeño protege más pero degrada el modelo o las estadísticas.

🚀 Del aprendizaje a la operación

En operación: filtrado y deduplicación de PII antes del entrenamiento, redacción de PII antes de loguear prompts, minimización estricta de campos que llegan al contexto, tokenización de secretos en un vault (nunca en el prompt), políticas de retención con TTL y soporte del derecho de supresión, auditoría periódica de memorización con canarios, y —cuando aplique— presupuesto de privacidad diferencial documentado. La normativa (GDPR, EU AI Act; clase 170) convierte varias de estas prácticas en obligación legal. Esta clase solo establece los conceptos y la medición manual.

🧪 Laboratorio

python lab.py

El laboratorio llama a ai_evolution.labs.run_lab("safety"). Esta decisión evita 183 implementaciones divergentes: cada clase tiene un entrypoint propio, pero los motores didácticos se prueban como una biblioteca común.

🔍 Evidencia esperada

📓 Notebooks

📝 Evaluación

Criterio Peso
Comprensión conceptual 25 %
Ejecución reproducible 25 %
Interpretación basada en evidencia 25 %
Riesgos, límites y mejora propuesta 25 %

Consulta assessment.md para preguntas y criterio de aceptación.

⚠️ Errores comunes

Síntoma Causa probable Corrección
El código corre, pero no hay conclusión Se confundió ejecución con aprendizaje Explica qué demuestra y qué no demuestra
El resultado cambia sin explicación No se registró semilla o configuración Conserva semilla, versión y parámetros
Se promete uso real Se extrapoló desde una demo educativa Declara entorno, datos, límites y revisión humana
Se copia una métrica aislada No existe baseline ni costo de error Añade comparación y criterio de decisión

❓ Preguntas frecuentes

¿Debo usar una API comercial?
No. El núcleo funciona localmente. Las extensiones LIVE se documentan por separado.

¿El laboratorio representa una implementación industrial?
No por sí solo. Enseña el contrato y el patrón; producción exige integración, seguridad, observabilidad, pruebas y operación.

¿Dónde profundizo?
Revisa las especializaciones enlazadas en el README raíz y la ruta siguiente.

🔗 Referencias


📜 Papers que fundamentan esta clase

Bloque generado por python scripts/link_papers_to_classes.py. La fuente es papers/catalog/papers.json.

Paper Año Qué desbloqueó Miniatura
P143 · Calibrar el ruido a la sensibilidad en el análisis privado de datos 2006 Da una definición formal de privacidad que no depende de qué sepa el atacante, y un mecanismo concreto para cumplirla. notebook

Cada ficha explica el problema anterior, la matemática mínima, los límites y los errores de atribución más frecuentes. Para leerlas con método: cómo leer un paper de IA · anexos matemáticos.


📚 Bibliografía de apoyo

Bloque generado por python scripts/link_sources_to_classes.py. Cada obra lleva su localizador verificado en sources/bibliography.json.

Los papers dicen de dónde salió el mecanismo. Estas obras lo desarrollan con el espacio que una clase no tiene: teoría completa, demostraciones y ejercicios.

Obra Edición Localizador Papel en esta clase
Huyen, Chip — Designing Machine Learning Systems 2022 ISBN 9781098107956 · web de la obra · pendiente de confirmar en su catálogo obra de referencia de la parte 13 · capítulos de evaluación y monitorización
Russell, Stuart J. y Norvig, Peter — Artificial Intelligence: A Modern Approach 4.ª · 2020 ISBN 9780134610993 · web de la obra obra de referencia de la parte 13 · capítulo de filosofía, ética y seguridad de la IA

Normas y documentación oficial que aplica esta clase: Reglamento (UE) 2016/679 · OWASP Top 10 for LLM Applications


⬅️ Clase anterior

164 — Seguridad de tools, MCP y supply chain

➡️ Siguiente clase

166 — Sesgo, fairness y grupos afectados


📝 Evaluación completa

❓ Preguntas

  1. Define privacidad, secretos y minimización de datos sin usar una marca o framework como definición.
  2. Explica la relación entre privacy, secrets, minimization, retention.
  3. Ejecuta lab.py dos veces con la misma semilla. ¿Qué debe conservarse?
  4. Identifica una afirmación permitida y una afirmación exagerada sobre el resultado.
  5. Propón una prueba negativa o un caso límite.

🏆 Reto verificable

Amplía el resultado del laboratorio con una clave student_extension que incluya:

✅ Criterio de aceptación