ISO/IEC 42001:2023 — sistema de gestión de la IA (AI management system) y ISO/IEC 23894:2023 — gestión del riesgo de IA.
🎯 ¿De qué trata esta parte?
Los modelos de machine learning y, sobre todo, los grandes modelos de lenguaje (LLM) ya no son curiosidades de laboratorio: son componentes de producción que toman decisiones de crédito, filtran spam, detectan fraude, moderan contenido y conversan con clientes. Esa superficie nueva trae vulnerabilidades nuevas. Un clasificador puede engañarse con ruido imperceptible; un conjunto de entrenamiento puede envenenarse con puertas traseras; un modelo caro puede robarse a través de su propia API; y un asistente con LLM puede secuestrarse con una simple frase escondida en un documento. Esta parte enseña a pensar en la seguridad del ciclo de vida completo de la IA: datos, entrenamiento, modelo, despliegue e inferencia.
La disciplina se apoya en marcos serios y reproducibles: la taxonomía OWASP Top 10 para LLM, la matriz de amenazas MITRE ATLAS, y el NIST AI RMF para gobernar el riesgo. No se trata de alarmismo, sino de ingeniería: entender qué puede fallar, cómo medirlo con herramientas reales (garak, PyRIT, Adversarial Robustness Toolbox) y cómo mitigarlo con controles concretos.
Sirve a ingenieros de ML que quieren endurecer sus modelos, a equipos de AppSec que ahora heredan aplicaciones con LLM, a red teamers que evalúan sistemas de IA y a responsables de GRC que deben gobernar su adopción con criterios de seguridad y ética.
🧩 Problemas que resuelve
Modelos de visión o NLP que se equivocan ante entradas manipuladas de forma imperceptible (ejemplos adversariales).
Conjuntos de datos y modelos preentrenados contaminados con puertas traseras o sesgos inyectados.
Fuga y robo de propiedad intelectual: extracción de modelos y de datos de entrenamiento vía la API.
Aplicaciones con LLM vulnerables a prompt injection, jailbreaks, fuga de secretos y ejecución de acciones no autorizadas por agentes.
Pipelines RAG que exponen datos sensibles o son manipulables desde documentos hostiles.
Uso ofensivo de la IA (phishing automatizado, deepfakes, malware asistido) y falta de gobernanza y controles éticos.
🎓 Resultados de aprendizaje
Al terminar la parte, el alumno podrá:
Mapear la superficie de ataque de un sistema de ML/LLM sobre MITRE ATLAS y OWASP LLM.
Generar y evaluar ejemplos adversariales con Adversarial Robustness Toolbox (ART).
Diseñar y detectar ataques de envenenamiento y puertas traseras en datos y modelos.
Ejecutar y mitigar ataques de extracción/robo de modelos e inversión/inferencia de membresía.
Auditar una aplicación con LLM contra el OWASP Top 10 y probarla con garak y PyRIT.
Construir defensas para prompt injection en arquitecturas RAG y de agentes (aislamiento, allowlists, human-in-the-loop).
Aplicar IA a la defensa (detección, triage de SOC) evaluando falsos positivos y evadibilidad.
Gobernar el riesgo de IA con NIST AI RMF e ISO/IEC 42001, incluyendo consideraciones éticas y legales.
🧱 Prerrequisitos
Parte 14 — GRC, riesgo y cumplimiento (marcos de riesgo, políticas, controles).
Fundamentos de programación en Python y familiaridad con conceptos básicos de ML (entrenamiento, inferencia, features, etiquetas).
Nociones de seguridad de aplicaciones web y APIs (partes previas del programa).
Un entorno de laboratorio aislado con Python 3.10+, capacidad de crear entornos virtuales y, deseablemente, GPU opcional.
🗺️ Estructura temática
🧭 Recorrido clase a clase
Las clases 291–294 construyen el modelo de amenaza desde el ciclo de datos hasta inferencia y extracción. Las clases 295–297 trasladan ese razonamiento a aplicaciones LLM, contenido no confiable, RAG y herramientas. Las clases 298–300 evalúan uso defensivo, abuso y gobierno durante todo el ciclo. Cada clase produce evidencia reproducible y declara incertidumbre; ninguna taxonomía ni benchmark funciona como certificado de seguridad.