Parte: 18 — IA aplicada a la ciberseguridad · Fuente: OWASP Top 10 for LLM · MITRE ATLAS · NIST AI RMF ⏱️ Duración estimada: 100 min · Nivel: Avanzado
Cerrar el círculo: los riesgos de usar IA para hacer seguridad y cómo mitigarlos. Tu propio agente es una superficie de ataque (prompt injection, fuga de datos), sus acciones deben ser auditables, y todo el uso está sujeto a un marco legal y ético donde la responsabilidad es humana. Esta clase te da los guardrails para operar con IA de forma profesional.
Al finalizar, el alumno podrá:
| # | Tema | Por qué importa |
|---|---|---|
| 1 | Prompt injection contra tu agente | Datos del objetivo pueden secuestrar sus instrucciones. |
| 2 | Exceso de agencia (excessive agency) | Un agente con demasiados permisos causa daño. |
| 3 | Fuga de datos | Enviar datos sensibles a un modelo externo. |
| 4 | Trazabilidad y auditoría | Cada acción del agente debe quedar registrada. |
| 5 | OPSEC del uso de IA | Modelo local vs nube, qué entra al contexto. |
| 6 | Marco legal y responsabilidad | La IA no diluye tu responsabilidad ni la autorización. |
Prompt injection : Instrucciones maliciosas ocultas en datos que el agente procesa (una web, un banner) que intentan cambiar su comportamiento. Riesgo LLM01 de OWASP.
Exceso de agencia (excessive agency) : Dar al agente más permisos/autonomía de la necesaria, de modo que un error o una inyección cause daño real. Riesgo LLM06.
Guardrail : Control que limita lo que el agente puede hacer (permisos mínimos, aprobación humana, listas de alcance, aislamiento de red).
OPSEC (seguridad operativa) : Disciplina de no exponer información sensible; aquí, controlar qué datos entran al modelo y dónde se ejecuta.
Trazabilidad : Registro auditable de cada acción del agente (comando, hora, resultado), imprescindible legal y operativamente.
Tu propio flujo de IA (de las clases anteriores). El ejercicio es de diseño de controles: políticas, permisos y registro. Revisa OWASP Top 10 for LLM como referencia.
Redacta un documento de guardrails para operar un agente de seguridad: matriz de permisos, aislamiento, política de datos, registro de auditoría y checklist legal.
Criterio de aceptación: toda acción con impacto requiere aprobación humana; hay aislamiento de red; se define qué datos no salen al modelo; existe un registro auditable; se exige autorización por escrito antes de cualquier sesión.
| Síntoma / mensaje | Causa y cómo arreglar |
|---|---|
| El agente obedece instrucciones de una web/banner | Prompt injection. Trata los datos del objetivo como no confiables y no le des autonomía total. |
| Credenciales en el contexto del agente | Fuga potencial. Usa secretos gestionados, nunca en el prompt. |
| Sin registro de lo que hizo el agente | No hay auditoría ni defensa legal. Loguea cada acción. |
| "La IA lo hizo, no yo" | La responsabilidad es del operador humano. La IA no exime de nada. |
| Datos de cliente enviados a un modelo público | Posible incumplimiento legal. Modelo aprobado/local y anonimización. |
❓ ¿La IA me hace responsable de menos? No. Eres tan responsable como si hubieras ejecutado las acciones a mano. La autorización, el alcance y las consecuencias son tuyos.
❓ ¿Puede mi propio agente volverse en mi contra? Sí, vía prompt injection: contenido malicioso en los datos que procesa puede intentar manipularlo. Por eso: mínimo privilegio, aprobación humana y aislamiento.
❓ ¿Modelo local o en la nube? Para datos sensibles, local o aprobado por el cliente. Es una decisión de OPSEC y de cumplimiento, no solo de comodidad.
Clase 338 — Generación de informes y flujos de trabajo con IA
Clase 340 — Capstone: pentest autorizado asistido por IA con MCP