Parte: 18 — IA aplicada a la ciberseguridad · Fuente: NIST AI RMF 1.0 (AI 100-1) y OWASP Top 10 for LLM Applications ⏱️ Duración estimada: 90 min · Nivel: Intermedio
Entender qué son los modelos generativos de lenguaje (LLM) y qué papel real juegan como herramienta de trabajo para hacer ciberseguridad: dónde aportan valor (acelerar tareas repetitivas, sintetizar información, redactar) y dónde fallan (alucinaciones, falta de contexto, datos desactualizados). Al terminar sabrás decidir cuándo apoyarte en un LLM y cuándo NO confiar en su salida sin verificación humana.
Importante: esta parte trata de usar IA para HACER seguridad (ofensiva y defensiva). No la confundas con la Parte 15, que trata de proteger a la propia IA (seguridad DE los modelos: prompt injection, envenenamiento de datos, etc.). Aquí el LLM es tu instrumento; allá es tu activo a defender.
Al finalizar, el alumno podrá:
| # | Tema | Por qué importa |
|---|---|---|
| 1 | Qué es un LLM (predicción de tokens) | Explica por qué "suena seguro" aunque se equivoque |
| 2 | Capacidades reales en seguridad | Evita expectativas mágicas y decepciones |
| 3 | Alucinaciones y confabulación | La causa nº1 de errores graves en producción |
| 4 | Corte de conocimiento y falta de contexto | Un CVE de esta semana puede no existir para el modelo |
| 5 | Verificación humana (human-in-the-loop) | Frontera entre asistente útil y riesgo operativo |
| 6 | Prompting efectivo para tareas técnicas | Mejora señal/ruido de la respuesta |
| 7 | Gobernanza: NIST AI RMF y política de uso | Marco para adoptar IA con responsabilidad |
Un LLM predice salidas condicionadas por contexto; no consulta verdad ni mantiene conocimiento operativo garantizado. En seguridad puede resumir, transformar y proponer hipótesis, pero cada afirmación técnica necesita evidencia primaria.
El diagrama separa lenguaje de autoridad. El modelo puede proponer; la política determina si la operación pertenece al alcance; la herramienta produce evidencia; y una persona o control determinista decide transiciones de alto impacto. Se registran prompt relevante, parámetros validados, versión, salida, aprobador y cleanup sin almacenar secretos innecesarios.
El modelo atribuye un CVE correcto al producto equivocado. El analista conserva la hipótesis y la descarta al verificar versión y aviso oficial.
| Término | Definición |
|---|---|
| Grounding | Vinculación de una salida con evidencia accesible. |
| Guardrail | Capa que reduce una capacidad o detecta su uso; no garantía absoluta. |
| Audit trail | Registro ordenado de solicitudes, decisiones, ejecuciones y resultados. |
El alumno demuestra dominio cuando reproduce el flujo completo, puede atribuir cada acción, evita que texto no confiable otorgue autoridad y explica qué control contiene un fallo del modelo.
nmap que no existe). Característica clave: es indistinguible del acierto sin verificación externa.man de las herramientas.Objetivo: medir empíricamente dónde ayuda y dónde falla un LLM. Todo el ejercicio es documental; no se ataca ningún sistema.
bitacora-llm.md con columnas: Tarea | Prompt | Respuesta resumida | ¿Verificado? | Veredicto.man nmap. Anota flags inexistentes o mal usadas.Elabora una "Política de uso responsable de LLM" de una página para un equipo de seguridad ficticio.
Criterio de aceptación: el documento debe (a) listar al menos 3 usos permitidos y 3 prohibidos, (b) exigir verificación humana antes de ejecutar cualquier acción con efecto, (c) prohibir el envío de datos sensibles a modelos externos sin autorización, y (d) referenciar explícitamente el NIST AI RMF. Un compañero debe poder leerlo y saber qué puede y qué no puede hacer con IA.
| Síntoma / mensaje | Causa y cómo arreglar |
|---|---|
| El modelo cita una CVE que no existe | Alucinación. Verifica siempre en NVD/MITRE antes de usar el dato. |
| Sugiere una flag de comando que da error | El modelo mezcló versiones o inventó. Contrasta con man/--help. |
| "No conozco eventos recientes" | Corte de conocimiento. Aporta tú la información actual por contexto. |
| Respuestas distintas a la misma pregunta | Aleatoriedad. Baja la temperatura y fija el contexto para tareas precisas. |
| El modelo "olvida" lo dicho antes | Se salió de la ventana de contexto. Reinyecta lo esencial. |
| Confía ciegamente y ejecuta sin revisar | Falta de HITL. Nunca ejecutes acciones de efecto real sin validar. |
❓ ¿Un LLM puede "hackear solo"? No de forma fiable ni responsable. Puede sugerir pasos y comandos, pero sin verificación humana y autorización comete errores, alucina y puede causar daño. El humano dirige; el modelo asiste.
❓ ¿Por qué inventa datos si "sabe" tanto? Porque no consulta una base de hechos: predice texto plausible. Cuando no hay patrón fuerte, rellena con algo que "suena bien". Por eso el grounding y la verificación son imprescindibles.
❓ ¿Es seguro pegarle logs de un cliente? No sin autorización explícita y sin conocer la política de retención del proveedor. Trátalo como enviar datos a un tercero: aplica minimización, anonimización y consentimiento.
❓ ¿Sirve para estudiar para certificaciones? Sí, como tutor que explica y genera ejercicios, pero contrasta siempre con el material oficial: puede equivocarse en detalles finos de sintaxis o normativa.
Clase 330 — Análisis de código y automatización de seguridad
Clase 332 — Agentes de IA y el Model Context Protocol (MCP) para seguridad