Parte 15 — Seguridad de IA y machine learning

⬅️ Volver al programa · 📚 Índice completo · ⏭️ Parte siguiente

10 clases · rango 291–300 · Ataques adversariales, OWASP LLM, prompt injection y defensa con IA

Fuentes de referencia de esta parte:


🎯 ¿De qué trata esta parte?

Los modelos de machine learning y, sobre todo, los grandes modelos de lenguaje (LLM) ya no son curiosidades de laboratorio: son componentes de producción que toman decisiones de crédito, filtran spam, detectan fraude, moderan contenido y conversan con clientes. Esa superficie nueva trae vulnerabilidades nuevas. Un clasificador puede engañarse con ruido imperceptible; un conjunto de entrenamiento puede envenenarse con puertas traseras; un modelo caro puede robarse a través de su propia API; y un asistente con LLM puede secuestrarse con una simple frase escondida en un documento. Esta parte enseña a pensar en la seguridad del ciclo de vida completo de la IA: datos, entrenamiento, modelo, despliegue e inferencia.

La disciplina se apoya en marcos serios y reproducibles: la taxonomía OWASP Top 10 para LLM, la matriz de amenazas MITRE ATLAS, y el NIST AI RMF para gobernar el riesgo. No se trata de alarmismo, sino de ingeniería: entender qué puede fallar, cómo medirlo con herramientas reales (garak, PyRIT, Adversarial Robustness Toolbox) y cómo mitigarlo con controles concretos.

Sirve a ingenieros de ML que quieren endurecer sus modelos, a equipos de AppSec que ahora heredan aplicaciones con LLM, a red teamers que evalúan sistemas de IA y a responsables de GRC que deben gobernar su adopción con criterios de seguridad y ética.

🧩 Problemas que resuelve

🎓 Resultados de aprendizaje

Al terminar la parte, el alumno podrá:

  1. Mapear la superficie de ataque de un sistema de ML/LLM sobre MITRE ATLAS y OWASP LLM.
  2. Generar y evaluar ejemplos adversariales con Adversarial Robustness Toolbox (ART).
  3. Diseñar y detectar ataques de envenenamiento y puertas traseras en datos y modelos.
  4. Ejecutar y mitigar ataques de extracción/robo de modelos e inversión/inferencia de membresía.
  5. Auditar una aplicación con LLM contra el OWASP Top 10 y probarla con garak y PyRIT.
  6. Construir defensas para prompt injection en arquitecturas RAG y de agentes (aislamiento, allowlists, human-in-the-loop).
  7. Aplicar IA a la defensa (detección, triage de SOC) evaluando falsos positivos y evadibilidad.
  8. Gobernar el riesgo de IA con NIST AI RMF e ISO/IEC 42001, incluyendo consideraciones éticas y legales.

🧱 Prerrequisitos

🗺️ Estructura temática

Bloque Clases Foco
Fundamentos y superficie de ataque 291 Panorama, ciclo de vida, MITRE ATLAS, NIST AI RMF
Ataques al modelo 292, 293, 294 Adversariales, envenenamiento/backdoors, robo/extracción
Seguridad de LLM y aplicaciones 295, 296, 297 OWASP Top 10 LLM, prompt injection/jailbreaks, RAG y agentes
IA como herramienta 298, 299 Defensa (SOC/detección), ofensiva y deepfakes
Gobernanza 300 Ética, regulación, gestión del riesgo de IA

🔗 Referencias de la parte

▶️ Empezar

Clase 291 — Introducción a la seguridad de IA y ML