Clase 21.12 — Evaluación y guardrails#
Clase 12 de 14 de la parte 21 — IA aplicada a marketing, ventas y servicio, de nivel IA y expansión. Dura unos 150 minutos.
🚦 Antes de empezar#
Vienes de la clase 21.11, IA en customer success: ten a mano su entregable, porque esta sesión lo retoma y lo lleva más lejos.
Trabajarás sobre el caso de la clase. Si prefieres usar datos de tu organización, lo mínimo que necesitas es una serie histórica de desempeño en el conjunto de evaluación con la que calcular una línea base: sin ella podrás discutir el concepto, pero no comprobar si tu decisión mejora algo. Ten también dónde escribir —planilla o cuaderno— y, de la lectura comparada, al menos el índice y los capítulos que se indican al pie.
Calcula 150 minutos de trabajo dirigido más una hora de lectura selectiva. Sabrás que terminaste cuando exista el entregable y puedas responder las seis preguntas de comprobación sin volver al texto; si tienes el entregable pero no las respuestas, lo que produjiste es un documento, no un criterio.
Lee el propósito y la agenda antes que el desarrollo. La agenda dice qué debe salir de cada tramo, y el desarrollo se entiende mejor cuando ya sabes qué artefacto tiene que producir. No avances de sección sin escribir algo: este material está hecho para dejar decisiones documentadas, no notas de lectura.
La idea que ordena la sesión. Las cuatro funciones: mapear, medir, gestionar y gobernar el riesgo de IA — NIST. Todo lo demás en esta clase existe para poner esa idea a prueba contra un caso concreto.
🎯 Propósito#
Un sistema de IA sin evaluación es una apuesta. Evaluar significa definir un conjunto de casos representativos con respuesta esperada, medir el desempeño antes de desplegar y monitorearlo después. Los guardarraíles son las restricciones que impiden comportamientos inaceptables aunque el sistema los proponga. El marco de gestión de riesgo del NIST ordena esto en cuatro funciones: mapear, medir, gestionar y gobernar.
La clase trata el tema como un problema de evidencia y de consecuencia, no como vocabulario. La parte 21 busca usar IA como capacidad operativa con evaluación, control y responsabilidad humana; en esta clase esa progresión se concreta exigiendo que toda afirmación sobre evaluación y guardrails termine en una definición operacional, una señal observable, una decisión y una condición de revisión.
Pregunta rectora de la parte: ¿Qué tarea mejora con IA, cómo sé que mejora y quién responde cuando falla?
Los conceptos que estructuran la sesión son conjunto de evaluación, guardarraíl, monitoreo posterior y umbral de aceptación. No se estudian como lista de vocabulario: cada uno debe producir una predicción distinta sobre lo que ocurriría en la operación.
📚 Resultados de aprendizaje#
Al terminar esta clase serás capaz de:
- Distinguir
conjunto de evaluación,guardarraíl,monitoreo posterioryumbral de aceptaciónpor sus observables y no por su definición memorizada. - Explicar por qué esas distinciones cambian una decisión concreta dentro de IA aplicada a marketing, ventas y servicio.
- Aplicar la secuencia construir el conjunto de evaluación con casos reales → definir el umbral de aceptación antes de probar → implementar guardarraíles sobre los riesgos identificados → monitorear el desempeño en producción → documentar incidentes y ajustar el sistema conservando supuestos, alternativas descartadas y trazabilidad.
- Operacionalizar desempeño en el conjunto de evaluación, incidentes por guardarraíl activado y deriva de desempeño indicando numerador, denominador, ventana, fuente y uso permitido.
- Resolver el caso con al menos dos opciones defendibles y un criterio explícito de detención.
- Contrastar dos obras de la lectura comparada y señalar dónde entregan recomendaciones distintas.
🧭 Agenda sugerida (150 minutos)#
| Tramo | Foco | Evidencia de avance |
|---|---|---|
| 0–15 min | Recuperación | Define conjunto de evaluación y guardarraíl sin mirar el material; corrige después con la tabla de conceptos. |
| 15–45 min | Núcleo conceptual | Lectura del desarrollo y construcción de la tabla hecho / inferencia / supuesto. |
| 45–75 min | Medición | Ficha de la señal desempeño en el conjunto de evaluación: fórmula, fuente, ventana y lectura prohibida. |
| 75–110 min | Ejemplo trabajado | Recorrido de los 5 pasos del método sobre el caso de la clase. |
| 110–140 min | Caso ejecutivo | Dos alternativas, trade-offs, recomendación y señal de detención. |
| 140–150 min | Cierre | Entregable, preguntas de comprobación y registro de lo que aún no sabes. |
🧩 Conceptos centrales#
| Concepto | Definición operacional | Cómo demostrar que lo entendiste |
|---|---|---|
| conjunto de evaluación | casos representativos con resultado esperado que permiten medir el desempeño | Explica qué decisión cambiaría si el concepto estuviera ausente. |
| guardarraíl | restricción que impide un comportamiento inaceptable del sistema | Construye un caso límite donde el concepto se confunde con el anterior. |
| monitoreo posterior | medición continua del desempeño tras el despliegue | Indica qué dato tendrías que ver para afirmarlo en una reunión de comité. |
| umbral de aceptación | nivel de desempeño mínimo que autoriza el uso en producción | Traduce el concepto en una pregunta que puedas hacerle a un cliente real. |
Una definición que no produce predicciones observables sigue siendo demasiado vaga para dirigir. Si dos personas del equipo aplican la misma definición a un caso y clasifican distinto, la definición todavía no es operacional.
🧠 Modelo mental#
1. construir el conjunto de evaluación con casos reales → 2. definir el umbral de aceptación antes de probar → 3. implementar guardarraíles sobre los riesgos identificados → 4. monitorear el desempeño en producción → 5. documentar incidentes y ajustar el sistema
La secuencia no es un ritual: cada paso reduce una incertidumbre distinta y produce un artefacto revisable. Saltarse un paso no acelera la decisión, sólo traslada el error a una etapa donde corregirlo cuesta más caro.
Frontera de aplicación. Ningún conjunto de evaluación cubre todos los casos posibles. Los guardarraíles y el monitoreo son necesarios precisamente porque la evaluación previa es incompleta.
📖 Desarrollo#
1. Conjunto de evaluación: mecanismo central#
Conjunto de evaluación se entiende aquí como casos representativos con resultado esperado que permiten medir el desempeño.
Evaluar un sistema de inteligencia artificial exige un conjunto de casos que represente el uso real y no el uso ideal. Un modelo que funciona bien con ejemplos limpios puede fallar con la información desordenada que existe en la operación. Construir ese conjunto de evaluación es trabajo previo al despliegue y no una verificación posterior.
De dónde viene esta afirmación. NIST — AI Risk Management Framework 1.0 (2023) aporta la idea que sostiene este bloque: las cuatro funciones: mapear, medir, gestionar y gobernar el riesgo de IA. Búscala en el núcleo del marco. Aplicada a esta clase, esa idea predice algo verificable: si es correcta, «desempeño en el conjunto de evaluación» debería moverse cuando cambie conjunto de evaluación, y no debería moverse cuando cambie el resto. Ese es el contraste que tienes que montar antes de recomendar nada.
Relaciona el mecanismo con guardarraíl. Si ambos se mueven juntos no concluyas causalidad: nombra una tercera variable capaz de explicar el mismo patrón. El resultado de este bloque debe ser una hipótesis refutable, no una recomendación anticipada.
2. Guardarraíl: frontera conceptual y error de clasificación#
Definición operacional: restricción que impide un comportamiento inaceptable del sistema. Su valor está en distinguirlo de conjunto de evaluación.
El guardarraíl es una restricción que el sistema no debe cruzar aunque mejore su métrica principal: no prometer plazos, no mencionar precios, no afirmar sobre normativa, no procesar ciertos datos. Definir esos límites y verificarlos con casos de prueba específicos es más efectivo que confiar en instrucciones generales.
Contraste bibliográfico. Andrew Ng — Machine Learning Yearning (2018) aporta aquí una distinción concreta: el conjunto de evaluación que representa la distribución real de uso (los capítulos sobre conjuntos de desarrollo y prueba). Formula dos mini-casos: uno que satisface la definición de guardarraíl y otro que sólo se le parece en la superficie; después decide cuál de los dos describiría esa obra con su propio vocabulario. Si la obra no permite separarlos, la distinción es tuya y tienes que sostenerla con evidencia del caso, no con la cita.
Antes de pasar a «definir el umbral de aceptación antes de probar», registra explícitamente qué decisión sería errónea si esta frontera se ignora. Esa frase convierte el vocabulario en criterio de gestión.
3. Monitoreo posterior: operacionalización y medición#
Monitoreo posterior significa medición continua del desempeño tras el despliegue.
El monitoreo posterior es indispensable porque el desempeño se degrada: cambian los datos de entrada, cambia el contexto, cambia el modelo subyacente si es de un tercero. Un sistema evaluado una vez al desplegarse y nunca más es un sistema cuya calidad actual nadie conoce.
Ficha de medición obligatoria para desempeño en el conjunto de evaluación: casos resueltos correctamente, sobre casos del conjunto. Registra además fuente del dato, frecuencia, responsable, interpretación permitida e interpretación prohibida. Si no existe un dato confiable, la salida correcta no es inventar precisión: es diseñar el mecanismo de captura y declarar la incertidumbre.
Control de lectura. Ron Kohavi, Diane Tang y Ya Xu — Trustworthy Online Controlled Experiments (2020) pone una condición sobre la medición: las métricas guardarraíl que impiden ganar en lo local perdiendo en el sistema (los capítulos sobre métricas y guardarraíles). Contrasta tu ficha con ella: si la métrica que acabas de definir cae dentro de lo que esa obra considera un error de medición, corrígela antes de usarla para decidir.
4. Umbral de aceptación: trade-offs y efectos de segundo orden#
Definición: nivel de desempeño mínimo que autoriza el uso en producción.
Evaluaciones más exhaustivas detectan más problemas y retrasan el despliegue. El equilibrio debe hacerse según la consecuencia del error: un asistente que redacta borradores internos admite una evaluación ligera; uno que se comunica con clientes, no. Esa gradación debe estar en la política y no decidirse caso a caso.
Lo que aporta la fuente. ISO — ISO 31000: Gestión del riesgo (2018) aporta el criterio para pesar el intercambio: el proceso de gestión del riesgo: identificar, analizar, evaluar y tratar (la cláusula sobre el proceso). Úsalo para construir una matriz beneficio esperado / costo / reversibilidad / afectado / señal temprana. La evidencia deriva de desempeño ayuda a detectar si el intercambio está ocurriendo como se esperaba, pero no elimina la obligación de observar efectos laterales fuera del indicador principal.
Haz un pre-mortem: supón que la opción recomendada fracasó a los seis meses y enumera tres mecanismos que lo expliquen. Al menos uno debe provenir de un efecto de segundo orden asociado a umbral de aceptación y otro de un supuesto del caso que nunca fue validado.
5. Gobernanza, límites y responsabilidad#
La pregunta ejecutiva es siempre la misma: quién decide, quién ejecuta, a quién hay que consultar, qué evidencia queda registrada y qué condición obliga a detener, corregir o escalar. Al ejecutar «documentar incidentes y ajustar el sistema», deja una traza que permita a otra persona reconstruir por qué la decisión parecía razonable con la información disponible en ese momento.
El marco de gestión de riesgos publicado por el NIST propone organizar el trabajo en cuatro funciones —mapear, medir, gestionar y gobernar— y esa estructura es útil precisamente porque separa la evaluación técnica de la responsabilidad organizativa. Adoptarla exige verificar su texto vigente y adaptarla al contexto, no aplicarla como plantilla.
Frontera declarada. Ningún conjunto de evaluación cubre todos los casos posibles. Los guardarraíles y el monitoreo son necesarios precisamente porque la evaluación previa es incompleta. Conviértela en una regla operativa con el formato si ocurre X → no aplicar automáticamente → consultar, escalar o revalidar.
Esta parte vigila además un riesgo que es obligatorio declarar: Publicar contenido incorrecto a escala, tratar datos personales sin base legal y perder trazabilidad. Se documenta en el entregable con su mitigación y su responsable; no se resuelve en la conversación.
6. Integración: de conceptos a una decisión defendible#
Sintetizar evaluación y guardrails no consiste en sumar definiciones. Empieza por conjunto de evaluación, contrasta guardarraíl con monitoreo posterior, incorpora umbral de aceptación como restricción y cierra con la medición. Aplica entonces la secuencia completa conservando tres columnas por paso: evidencia utilizada, alternativa descartada y razón del descarte.
Esa disciplina permite que una revisión posterior distinga una mala decisión de un mal resultado. Sin ella, el equipo reescribe la historia después de conocer el desenlace y no aprende nada transferible. Una síntesis correcta indica qué evidencia falta y qué decisión se posterga hasta obtenerla.
📚 Lectura comparada#
No se pide leer las obras completas. Para cada una se indica qué idea concreta sostiene esta clase, dónde buscarla y qué pregunta esa idea le hace a tu propio diagnóstico. La lectura termina cuando puedes responder esa pregunta con evidencia del caso.
| Obra | Idea que sostiene esta clase | Dónde buscarla | Pregunta que le hace a tu diagnóstico |
|---|---|---|---|
| NIST — AI Risk Management Framework 1.0 (2023) | Las cuatro funciones: mapear, medir, gestionar y gobernar el riesgo de IA | El núcleo del marco | ¿Qué debería observarse en conjunto de evaluación si aquí opera «las cuatro funciones: mapear, medir, gestionar y gobernar el riesgo de IA»? ¿Y qué observación lo desmentiría en este caso? |
| Andrew Ng — Machine Learning Yearning (2018) | El conjunto de evaluación que representa la distribución real de uso | Los capítulos sobre conjuntos de desarrollo y prueba | ¿Qué debería observarse en guardarraíl si aquí opera «el conjunto de evaluación que representa la distribución real de uso»? ¿Y qué observación lo desmentiría en este caso? |
| Ron Kohavi, Diane Tang y Ya Xu — Trustworthy Online Controlled Experiments (2020) | Las métricas guardarraíl que impiden ganar en lo local perdiendo en el sistema | Los capítulos sobre métricas y guardarraíles | ¿Qué debería observarse en monitoreo posterior si aquí opera «las métricas guardarraíl que impiden ganar en lo local perdiendo en el sistema»? ¿Y qué observación lo desmentiría en este caso? |
| ISO — ISO 31000: Gestión del riesgo (2018) | El proceso de gestión del riesgo: identificar, analizar, evaluar y tratar | La cláusula sobre el proceso | ¿Qué debería observarse en umbral de aceptación si aquí opera «el proceso de gestión del riesgo: identificar, analizar, evaluar y tratar»? ¿Y qué observación lo desmentiría en este caso? |
Después de leer, escribe una discrepancia real. Al menos dos de estas obras entregan recomendaciones que no coinciden cuando se aplican al mismo caso; identifica cuáles y qué condición del caso decide a favor de una. Si no encuentras la discrepancia, es señal de que leíste buscando confirmación.
La lectura se evalúa por uso, no por cantidad de páginas. La nota de lectura debe indicar qué tesis modifica tu diagnóstico, qué evidencia del caso la tensiona y qué decisión concreta cambiarías después del contraste.
🧮 Ejemplo trabajado#
Situación. Ruta Andina desplegó su asistente sin conjunto de evaluación. Descubrió que prometía funcionalidades inexistentes cuando un cliente reclamó por escrito.
Paso 1 — Construir el conjunto de evaluación con casos reales. El equipo escribe primero el supuesto asociado a conjunto de evaluación y se prohíbe tratarlo como hecho. Contrasta ese supuesto con desempeño en el conjunto de evaluación y anota qué parte del dato todavía no existe. Del paso sale un artefacto revisable y una frase explícita: «cambiaríamos de rumbo si…».
Paso 2 — Definir el umbral de aceptación antes de probar. El trabajo aquí es separar lo observado de lo inferido sobre guardarraíl. La evidencia que ordena la discusión es incidentes por guardarraíl activado; si su definición no está escrita, escribirla es parte del paso. Nada avanza mientras el equipo no acuerde qué contaría como refutación.
Paso 3 — Implementar guardarraíles sobre los riesgos identificados. El riesgo de este paso es cerrar demasiado rápido alrededor de monitoreo posterior. Antes de concluir, el equipo enumera dos explicaciones alternativas del mismo patrón y revisa si deriva de desempeño logra distinguirlas. Si no lo logra, hace falta otra evidencia y así debe quedar registrado.
Paso 4 — Monitorear el desempeño en producción. Con umbral de aceptación ya delimitado, la pregunta pasa a ser de consecuencia: qué cambia en la operación, en la caja y en la carga del equipo. desempeño en el conjunto de evaluación entrega la lectura cuantitativa; el juicio sobre el costo de oportunidad sigue siendo humano y debe quedar firmado.
Paso 5 — Documentar incidentes y ajustar el sistema. El cierre exige compromiso: responsable, fecha, umbral de éxito y condición de detención asociados a conjunto de evaluación. incidentes por guardarraíl activado se convierte en la señal de seguimiento y se acuerda con qué frecuencia se revisa y quién puede declarar el fracaso sin costo político.
Síntesis. La recomendación termina con responsable, fecha, evidencia de éxito y señal de detención. Omitir cualquiera de esas cuatro piezas convierte el análisis en opinión difícil de auditar.
🔀 Comparación de caminos y límites#
| Camino | Qué privilegia | Cuándo elegirlo | Riesgo principal |
|---|---|---|---|
| Actuar sobre conjunto de evaluación | Casos representativos con resultado esperado que permiten medir el desempeño | Cuando desempeño en el conjunto de evaluación es observable y accionable en el plazo de la decisión. | Sobrerreaccionar a una señal parcial. |
| Actuar sobre guardarraíl | Restricción que impide un comportamiento inaceptable del sistema | Cuando la primera explicación no distingue mecanismo ni responsable. | Convertir el concepto en etiqueta y no en intervención. |
| Experimentar antes de decidir | Aprender antes de comprometer recursos mayores | Cuando la decisión es reversible y la incertidumbre es alta. | Experimentar indefinidamente y no decidir. |
| Escalar la decisión | Elevar autoridad, especialidad o control legal | Cuando hay compromisos contractuales, datos personales, regulación o irreversibilidad. | Delegar hacia arriba lo que sí correspondía decidir. |
Frontera de aplicación. Ningún conjunto de evaluación cubre todos los casos posibles. Los guardarraíles y el monitoreo son necesarios precisamente porque la evaluación previa es incompleta.
🪜 El mismo tema según el rol#
| Nivel | Responsabilidad sobre evaluación y guardrails |
|---|---|
| Analista / especialista | Produce la evidencia, documenta el método y declara los límites del dato. |
| Jefatura de equipo | Convierte el análisis en prioridad, carga de trabajo y criterio compartido. |
| Gerencia comercial | Conecta la decisión con presupuesto, capacidad, dependencias y riesgo interáreas; es el nivel donde operan perfiles como Growth manager con IA, RevOps, Marketing manager y Sales enablement. |
| Dirección comercial (CRO/CMO) | Decide si esto cambia la estrategia de ingresos y qué llega al directorio. |
| Founder / dueño | Pregunta si la solución reduce dependencia de personas, preserva caja y puede operar como sistema repetible. |
Al subir de nivel aumentan las personas, el dinero y las consecuencias que quedan dentro de la decisión. La misma herramienta debe volverse más explícita en evidencia, gobierno y revisión a medida que crece el alcance.
🏢 Caso ejecutivo#
Ruta Andina desplegó su asistente sin conjunto de evaluación. Descubrió que prometía funcionalidades inexistentes cuando un cliente reclamó por escrito.
Entrega un decision brief que contenga: (a) hechos y fuentes; (b) hipótesis; (c) dos opciones realmente defendibles; (d) efecto sobre cliente, operación, caja y riesgo; (e) recomendación; (f) la condición que la haría cambiar; (g) responsable y fecha de revisión. Usa al menos dos fuentes de la lectura comparada para desafiar tu primera respuesta.
🧪 Práctica guiada#
Cada paso indica qué hacer, con qué material y cómo saber que está terminado. No avances si la última columna todavía no se cumple: los pasos siguientes suponen el anterior resuelto.
| # | Paso | Qué haces | Con qué | Criterio de término |
|---|---|---|---|---|
| 1 | Reconstruir los hechos | Vuelca el caso en una tabla hecho / inferencia / supuesto / decisión sin agregar información que no esté en el enunciado. | El caso y nada más | Ninguna fila de la columna «hecho» contiene un juicio; cada supuesto tiene un responsable de verificarlo. |
| 2 | Ejecutar el método | Recorre la secuencia construir el conjunto de evaluación con casos reales → definir el umbral de aceptación antes de probar → implementar guardarraíles sobre los riesgos identificados → monitorear el desempeño en producción → documentar incidentes y ajustar el sistema y adjunta la evidencia usada en cada transición. | La tabla del paso 1 | Cada paso deja un artefacto revisable y una alternativa descartada con su razón. |
| 3 | Operacionalizar la señal | Construye la ficha de medición de desempeño en el conjunto de evaluación; si el dato no existe, diseña cómo obtenerlo y estima cuánto costaría. | Fuentes de datos reales o el diseño de captura | Dos personas del equipo calculan el mismo número con la ficha y llegan al mismo resultado. |
| 4 | Atacar tu propia respuesta | Escribe la alternativa que contradice tu preferencia inicial y hazle un pre-mortem a seis meses. | Tu borrador de recomendación | Puedes nombrar el dato concreto que te haría cambiar de opinión. |
| 5 | Contrastar con la fuente | Lee la idea anclada de AI Risk Management Framework 1.0 y la de Machine Learning Yearning, y registra una coincidencia y una tensión con tu diagnóstico. | La tabla de lectura comparada | La nota de lectura cita qué idea usaste y qué decisión cambió por ella, o declara que ninguna cambió y por qué. |
| 6 | Subir de nivel | Rehaz la decisión desde la dirección comercial: qué cambia al aumentar alcance, dinero e irreversibilidad. | El brief completo | El brief indica qué parte de la decisión ya no corresponde al analista y a quién pasa. |
Si te atascas. El bloqueo más común no es de método sino de definición: vuelve a la tabla de conceptos y comprueba que puedes clasificar un caso límite sin dudar. Si dudas, el problema está ahí y no en el paso que estabas ejecutando.
⚠️ Errores frecuentes#
| Síntoma | Causa probable | Corrección |
|---|---|---|
| Usar conjunto de evaluación y guardarraíl como sinónimos | Se perdió la distinción entre «casos representativos con resultado esperado que permiten medir el desempeño» y «restricción que impide un comportamiento inaceptable del sistema» | Vuelve a los observables y exige una señal distinta para cada concepto. |
| Empezar por «documentar incidentes y ajustar el sistema» | Se saltó «construir el conjunto de evaluación con casos reales»: la solución llegó antes que el diagnóstico | Reconstruye la cadena completa y marca el primer supuesto no demostrado. |
| Optimizar sólo desempeño en el conjunto de evaluación | La métrica local reemplazó al resultado del sistema | Contrástala con deriva de desempeño y explicita el costo de oportunidad. |
| Desplegar sin conjunto de evaluación ni umbral | Error específico de esta clase | Construye casos representativos con respuesta esperada y define el umbral antes del despliegue. |
| No fijar revisión | La decisión se vuelve permanente por inercia | Define responsable, fecha, señal de éxito y condición de detención. |
❓ Preguntas de comprobación#
- Explica la diferencia entre conjunto de evaluación y guardarraíl con un ejemplo donde elegir mal cambie la decisión.
- ¿Qué observarías para validar monitoreo posterior y qué observación te obligaría a rechazar tu interpretación?
- Aplica «construir el conjunto de evaluación con casos reales» al caso de la clase. ¿Qué dato sigue faltando?
- ¿Por qué desempeño en el conjunto de evaluación no basta por sí sola para atribuir causalidad?
- Compara dos fuentes de la lectura comparada: ¿dónde llevarían a recomendaciones distintas?
- ¿Qué decisión equivocada se produciría si se ignora este límite: «Ningún conjunto de evaluación cubre todos los casos posibles. Los guardarraíles y el monitoreo son necesarios precisamente porque la evaluación previa es incompleta»?
🗝️ Respuestas orientadoras#
No encontrarás aquí las respuestas: encontrarás qué tiene que contener una respuesta suficiente. Úsalo para autoevaluarte antes de entregar y para corregir a un par.
| Pregunta | Una respuesta suficiente contiene |
|---|---|
| 1 | Nombra un caso real donde la clasificación cambie la intervención, no sólo la etiqueta. Si el ejemplo funciona igual con los dos conceptos intercambiados, la distinción todavía no está entendida. |
| 2 | Dos observaciones concretas: una que confirmaría monitoreo posterior y otra que te obligaría a abandonarlo. Una respuesta sin condición de refutación no es suficiente. |
| 3 | El dato faltante debe ser nombrable y obtenible: qué se mide, quién lo tiene y en cuánto tiempo. «Faltan datos» no cuenta como respuesta. |
| 4 | Debes distinguir asociación de causa y proponer al menos una explicación alternativa del mismo movimiento de desempeño en el conjunto de evaluación. |
| 5 | Identifica la condición del caso que decide entre ambas obras. Basta con que sea una: la respuesta correcta no es «depende», sino «depende de esto, y aquí ocurre así». Ancla el contraste en AI Risk Management Framework 1.0 y ISO 31000: Gestión del riesgo. |
| 6 | Describe la decisión equivocada concreta —qué se haría de más o de menos— y quién pagaría el costo. Un límite que no produce una decisión distinta no está operando como límite. |
Si tres o más respuestas no alcanzan el criterio, no sigas a la clase siguiente: repite el desarrollo con el caso en la mano. Avanzar con la definición floja es lo que produce, más adelante, decisiones que nadie puede auditar.
🇨🇱 Contexto chileno y cumplimiento#
Riesgo asociado a esta parte: Publicar contenido incorrecto a escala, tratar datos personales sin base legal y perder trazabilidad. Antes de ejecutar cualquier recomendación de esta clase en una operación real, comprueba la norma en su texto vigente. Los enlaces van al texto completo publicado por la Biblioteca del Congreso Nacional; son gratuitos y no hace falta creerle a este material.
- Consumo y comercio. Ley 19.496 — Establece normas sobre protección de los derechos de los consumidores (Ministerio de Economía, Fomento y Reconstrucción), y su reglamento de comercio electrónico, Decreto 6/2021 — Aprueba reglamento de comercio electrónico (Ministerio de Economía, Fomento y Turismo).
- Datos personales. Ley 21.719 — Regula la protección y el tratamiento de los datos personales y crea la Agencia de Protección de Datos Personales (Ministerio Secretaría General de la Presidencia), que sustituye progresivamente a Ley 19.628 — Sobre protección de la vida privada (Ministerio Secretaría General de la Presidencia).
- Derecho a retracto. Decreto 52/2024 — Aprueba reglamento que regula la forma y condiciones en que los proveedores deberán comunicar la exclusión del derecho a retracto y los bienes en que excepcionalmente y por su naturaleza procederá tal exclusión (Ministerio de Economía, Fomento y Turismo).
Dentro del repositorio, el mapa regulatorio ordena qué norma aplica a cada decisión comercial, datos personales y ética desarrolla el tratamiento de datos y fuentes oficiales lista los organismos con su fecha de consulta. Ninguno de esos documentos reemplaza al texto legal.
La regla del programa es simple: la fuente oficial manda sobre el material pedagógico. Si la norma cambió después de la fecha de esta clase, gana la norma.
📥 Entregable#
Guarda en evidence/P21-C12-evaluacion-y-guardrails/:
decision-brief.md— problema, evidencia, alternativas, recomendación y gobierno.ficha-metricas.md— definición operacional de desempeño en el conjunto de evaluación, incidentes por guardarraíl activado y deriva de desempeño con fuente, ventana y lectura prohibida.nota-de-lectura.md— dos fuentes contrastadas con edición y páginas consultadas.red-team.md— la objeción más fuerte a tu recomendación y el dato que la invalidaría.
Este entregable alimenta el artefacto de la parte: operating model humano-IA con casos de uso, evaluaciones, guardrails y registro de incidentes.
✅ Evaluación de la clase#
| Criterio | Peso | Evidencia esperada |
|---|---|---|
| Precisión conceptual | 25 % | Distinciones correctas y observables entre los conceptos de la clase. |
| Diagnóstico y evidencia | 30 % | Datos pertinentes, línea base, supuestos explícitos y límites del dato. |
| Decisión y trade-offs | 30 % | Dos opciones defendibles, costo de oportunidad y condición de revisión. |
| Fuentes y comunicación | 15 % | Dos lecturas realmente utilizadas y argumento ejecutivo trazable. |
Aprobación: 80/100 y ningún criterio bajo 60 %. Una respuesta que podría copiarse sin cambios a otra clase se considera insuficiente.
📗 Fuentes y verificación#
Aquí conviene separar dos cosas que suelen ir juntas y no son lo mismo.
Lo que está comprobado. Que cada obra existe y cuál es exactamente la edición: el enlace resuelve su ISBN contra el catálogo de OpenLibrary, y eso se revalida periódicamente. Las normas chilenas citadas más arriba enlazan su texto completo y gratuito.
Lo que es atribución del programa. Que la idea señalada esté en el capítulo que se indica. Eso es la lectura que este material hace de cada obra, no una cita textual cotejada frase por frase, y se declara así de explícito para que puedas contrastarlo: si abres la obra y no encuentras la idea donde se dice, la cita está mal puesta y corresponde reportarlo como error del material. No se citan números de página porque cambian entre ediciones.
- NIST — AI Risk Management Framework 1.0 (2023) · DOI 10.6028/NIST.AI.100-1 — aporta a esta clase: las cuatro funciones: mapear, medir, gestionar y gobernar el riesgo de IA. Dónde buscarlo: el núcleo del marco. Acceso: gratis. Registra edición y páginas consultadas en tu nota de lectura.
- Andrew Ng — Machine Learning Yearning (2018) · fuente primaria — aporta a esta clase: el conjunto de evaluación que representa la distribución real de uso. Dónde buscarlo: los capítulos sobre conjuntos de desarrollo y prueba. Acceso: gratis. Registra edición y páginas consultadas en tu nota de lectura.
- Ron Kohavi, Diane Tang y Ya Xu — Trustworthy Online Controlled Experiments (2020) · ISBN 9781108601375 — aporta a esta clase: las métricas guardarraíl que impiden ganar en lo local perdiendo en el sistema. Dónde buscarlo: los capítulos sobre métricas y guardarraíles. Acceso: comprar o biblioteca. Registra edición y páginas consultadas en tu nota de lectura.
- ISO — ISO 31000: Gestión del riesgo (2018) · fuente primaria — aporta a esta clase: el proceso de gestión del riesgo: identificar, analizar, evaluar y tratar. Dónde buscarlo: la cláusula sobre el proceso. Acceso: de pago. Registra edición y páginas consultadas en tu nota de lectura.
Estándar pedagógico del programa: Susan A. Ambrose et al. — How Learning Works (2010); Peter C. Brown, Henry L. Roediger III y Mark A. McDaniel — Make It Stick (2014); Grant Wiggins y Jay McTighe — Understanding by Design (2005, 2.ª ed.); Anders Ericsson y Robert Pool — Peak (2016); William Ellet — The Case Study Handbook (2018, ed. revisada).
Regla de fuentes. Las obras anteriores estructuran las perspectivas de esta materia. Cualquier norma, impuesto, tarifa, política de plataforma o estándar vivo mencionado debe comprobarse nuevamente en su fuente primaria vigente antes de usarse en una operación real. El desarrollo de esta clase es original y no reproduce capítulos protegidos por derechos de autor.
Sobre la edición. No busques estas obras sólo por el título: distintas ediciones cambian capítulos y ejemplos, y los anclajes de arriba están hechos sobre la que declara el registro de fuentes. La bibliografía completa de la parte, con todas sus obras, está en su índice.
← Clase 11 · IA en customer success · Índice de la parte · Clase 13 · Privacidad y propiedad intelectual →