Saltar al contenido
Marketing, Sales & Growth Evolution Program

Clase 21.12 — Evaluación y guardrails#

Clase 12 de 14 de la parte 21 — IA aplicada a marketing, ventas y servicio, de nivel IA y expansión. Dura unos 150 minutos.

🚦 Antes de empezar#

Vienes de la clase 21.11, IA en customer success: ten a mano su entregable, porque esta sesión lo retoma y lo lleva más lejos.

Trabajarás sobre el caso de la clase. Si prefieres usar datos de tu organización, lo mínimo que necesitas es una serie histórica de desempeño en el conjunto de evaluación con la que calcular una línea base: sin ella podrás discutir el concepto, pero no comprobar si tu decisión mejora algo. Ten también dónde escribir —planilla o cuaderno— y, de la lectura comparada, al menos el índice y los capítulos que se indican al pie.

Calcula 150 minutos de trabajo dirigido más una hora de lectura selectiva. Sabrás que terminaste cuando exista el entregable y puedas responder las seis preguntas de comprobación sin volver al texto; si tienes el entregable pero no las respuestas, lo que produjiste es un documento, no un criterio.

Lee el propósito y la agenda antes que el desarrollo. La agenda dice qué debe salir de cada tramo, y el desarrollo se entiende mejor cuando ya sabes qué artefacto tiene que producir. No avances de sección sin escribir algo: este material está hecho para dejar decisiones documentadas, no notas de lectura.

La idea que ordena la sesión. Las cuatro funciones: mapear, medir, gestionar y gobernar el riesgo de IA — NIST. Todo lo demás en esta clase existe para poner esa idea a prueba contra un caso concreto.

🎯 Propósito#

Un sistema de IA sin evaluación es una apuesta. Evaluar significa definir un conjunto de casos representativos con respuesta esperada, medir el desempeño antes de desplegar y monitorearlo después. Los guardarraíles son las restricciones que impiden comportamientos inaceptables aunque el sistema los proponga. El marco de gestión de riesgo del NIST ordena esto en cuatro funciones: mapear, medir, gestionar y gobernar.

La clase trata el tema como un problema de evidencia y de consecuencia, no como vocabulario. La parte 21 busca usar IA como capacidad operativa con evaluación, control y responsabilidad humana; en esta clase esa progresión se concreta exigiendo que toda afirmación sobre evaluación y guardrails termine en una definición operacional, una señal observable, una decisión y una condición de revisión.

Pregunta rectora de la parte: ¿Qué tarea mejora con IA, cómo sé que mejora y quién responde cuando falla?

Los conceptos que estructuran la sesión son conjunto de evaluación, guardarraíl, monitoreo posterior y umbral de aceptación. No se estudian como lista de vocabulario: cada uno debe producir una predicción distinta sobre lo que ocurriría en la operación.

📚 Resultados de aprendizaje#

Al terminar esta clase serás capaz de:

  1. Distinguir conjunto de evaluación, guardarraíl, monitoreo posterior y umbral de aceptación por sus observables y no por su definición memorizada.
  2. Explicar por qué esas distinciones cambian una decisión concreta dentro de IA aplicada a marketing, ventas y servicio.
  3. Aplicar la secuencia construir el conjunto de evaluación con casos reales → definir el umbral de aceptación antes de probar → implementar guardarraíles sobre los riesgos identificados → monitorear el desempeño en producción → documentar incidentes y ajustar el sistema conservando supuestos, alternativas descartadas y trazabilidad.
  4. Operacionalizar desempeño en el conjunto de evaluación, incidentes por guardarraíl activado y deriva de desempeño indicando numerador, denominador, ventana, fuente y uso permitido.
  5. Resolver el caso con al menos dos opciones defendibles y un criterio explícito de detención.
  6. Contrastar dos obras de la lectura comparada y señalar dónde entregan recomendaciones distintas.

🧭 Agenda sugerida (150 minutos)#

TramoFocoEvidencia de avance
0–15 minRecuperaciónDefine conjunto de evaluación y guardarraíl sin mirar el material; corrige después con la tabla de conceptos.
15–45 minNúcleo conceptualLectura del desarrollo y construcción de la tabla hecho / inferencia / supuesto.
45–75 minMediciónFicha de la señal desempeño en el conjunto de evaluación: fórmula, fuente, ventana y lectura prohibida.
75–110 minEjemplo trabajadoRecorrido de los 5 pasos del método sobre el caso de la clase.
110–140 minCaso ejecutivoDos alternativas, trade-offs, recomendación y señal de detención.
140–150 minCierreEntregable, preguntas de comprobación y registro de lo que aún no sabes.

🧩 Conceptos centrales#

ConceptoDefinición operacionalCómo demostrar que lo entendiste
conjunto de evaluacióncasos representativos con resultado esperado que permiten medir el desempeñoExplica qué decisión cambiaría si el concepto estuviera ausente.
guardarraílrestricción que impide un comportamiento inaceptable del sistemaConstruye un caso límite donde el concepto se confunde con el anterior.
monitoreo posteriormedición continua del desempeño tras el despliegueIndica qué dato tendrías que ver para afirmarlo en una reunión de comité.
umbral de aceptaciónnivel de desempeño mínimo que autoriza el uso en producciónTraduce el concepto en una pregunta que puedas hacerle a un cliente real.

Una definición que no produce predicciones observables sigue siendo demasiado vaga para dirigir. Si dos personas del equipo aplican la misma definición a un caso y clasifican distinto, la definición todavía no es operacional.

🧠 Modelo mental#

1. construir el conjunto de evaluación con casos reales → 2. definir el umbral de aceptación antes de probar → 3. implementar guardarraíles sobre los riesgos identificados → 4. monitorear el desempeño en producción → 5. documentar incidentes y ajustar el sistema

La secuencia no es un ritual: cada paso reduce una incertidumbre distinta y produce un artefacto revisable. Saltarse un paso no acelera la decisión, sólo traslada el error a una etapa donde corregirlo cuesta más caro.

Frontera de aplicación. Ningún conjunto de evaluación cubre todos los casos posibles. Los guardarraíles y el monitoreo son necesarios precisamente porque la evaluación previa es incompleta.

📖 Desarrollo#

1. Conjunto de evaluación: mecanismo central#

Conjunto de evaluación se entiende aquí como casos representativos con resultado esperado que permiten medir el desempeño.

Evaluar un sistema de inteligencia artificial exige un conjunto de casos que represente el uso real y no el uso ideal. Un modelo que funciona bien con ejemplos limpios puede fallar con la información desordenada que existe en la operación. Construir ese conjunto de evaluación es trabajo previo al despliegue y no una verificación posterior.

De dónde viene esta afirmación. NIST — AI Risk Management Framework 1.0 (2023) aporta la idea que sostiene este bloque: las cuatro funciones: mapear, medir, gestionar y gobernar el riesgo de IA. Búscala en el núcleo del marco. Aplicada a esta clase, esa idea predice algo verificable: si es correcta, «desempeño en el conjunto de evaluación» debería moverse cuando cambie conjunto de evaluación, y no debería moverse cuando cambie el resto. Ese es el contraste que tienes que montar antes de recomendar nada.

Relaciona el mecanismo con guardarraíl. Si ambos se mueven juntos no concluyas causalidad: nombra una tercera variable capaz de explicar el mismo patrón. El resultado de este bloque debe ser una hipótesis refutable, no una recomendación anticipada.

2. Guardarraíl: frontera conceptual y error de clasificación#

Definición operacional: restricción que impide un comportamiento inaceptable del sistema. Su valor está en distinguirlo de conjunto de evaluación.

El guardarraíl es una restricción que el sistema no debe cruzar aunque mejore su métrica principal: no prometer plazos, no mencionar precios, no afirmar sobre normativa, no procesar ciertos datos. Definir esos límites y verificarlos con casos de prueba específicos es más efectivo que confiar en instrucciones generales.

Contraste bibliográfico. Andrew Ng — Machine Learning Yearning (2018) aporta aquí una distinción concreta: el conjunto de evaluación que representa la distribución real de uso (los capítulos sobre conjuntos de desarrollo y prueba). Formula dos mini-casos: uno que satisface la definición de guardarraíl y otro que sólo se le parece en la superficie; después decide cuál de los dos describiría esa obra con su propio vocabulario. Si la obra no permite separarlos, la distinción es tuya y tienes que sostenerla con evidencia del caso, no con la cita.

Antes de pasar a «definir el umbral de aceptación antes de probar», registra explícitamente qué decisión sería errónea si esta frontera se ignora. Esa frase convierte el vocabulario en criterio de gestión.

3. Monitoreo posterior: operacionalización y medición#

Monitoreo posterior significa medición continua del desempeño tras el despliegue.

El monitoreo posterior es indispensable porque el desempeño se degrada: cambian los datos de entrada, cambia el contexto, cambia el modelo subyacente si es de un tercero. Un sistema evaluado una vez al desplegarse y nunca más es un sistema cuya calidad actual nadie conoce.

Ficha de medición obligatoria para desempeño en el conjunto de evaluación: casos resueltos correctamente, sobre casos del conjunto. Registra además fuente del dato, frecuencia, responsable, interpretación permitida e interpretación prohibida. Si no existe un dato confiable, la salida correcta no es inventar precisión: es diseñar el mecanismo de captura y declarar la incertidumbre.

Control de lectura. Ron Kohavi, Diane Tang y Ya Xu — Trustworthy Online Controlled Experiments (2020) pone una condición sobre la medición: las métricas guardarraíl que impiden ganar en lo local perdiendo en el sistema (los capítulos sobre métricas y guardarraíles). Contrasta tu ficha con ella: si la métrica que acabas de definir cae dentro de lo que esa obra considera un error de medición, corrígela antes de usarla para decidir.

4. Umbral de aceptación: trade-offs y efectos de segundo orden#

Definición: nivel de desempeño mínimo que autoriza el uso en producción.

Evaluaciones más exhaustivas detectan más problemas y retrasan el despliegue. El equilibrio debe hacerse según la consecuencia del error: un asistente que redacta borradores internos admite una evaluación ligera; uno que se comunica con clientes, no. Esa gradación debe estar en la política y no decidirse caso a caso.

Lo que aporta la fuente. ISO — ISO 31000: Gestión del riesgo (2018) aporta el criterio para pesar el intercambio: el proceso de gestión del riesgo: identificar, analizar, evaluar y tratar (la cláusula sobre el proceso). Úsalo para construir una matriz beneficio esperado / costo / reversibilidad / afectado / señal temprana. La evidencia deriva de desempeño ayuda a detectar si el intercambio está ocurriendo como se esperaba, pero no elimina la obligación de observar efectos laterales fuera del indicador principal.

Haz un pre-mortem: supón que la opción recomendada fracasó a los seis meses y enumera tres mecanismos que lo expliquen. Al menos uno debe provenir de un efecto de segundo orden asociado a umbral de aceptación y otro de un supuesto del caso que nunca fue validado.

5. Gobernanza, límites y responsabilidad#

La pregunta ejecutiva es siempre la misma: quién decide, quién ejecuta, a quién hay que consultar, qué evidencia queda registrada y qué condición obliga a detener, corregir o escalar. Al ejecutar «documentar incidentes y ajustar el sistema», deja una traza que permita a otra persona reconstruir por qué la decisión parecía razonable con la información disponible en ese momento.

El marco de gestión de riesgos publicado por el NIST propone organizar el trabajo en cuatro funciones —mapear, medir, gestionar y gobernar— y esa estructura es útil precisamente porque separa la evaluación técnica de la responsabilidad organizativa. Adoptarla exige verificar su texto vigente y adaptarla al contexto, no aplicarla como plantilla.

Frontera declarada. Ningún conjunto de evaluación cubre todos los casos posibles. Los guardarraíles y el monitoreo son necesarios precisamente porque la evaluación previa es incompleta. Conviértela en una regla operativa con el formato si ocurre X → no aplicar automáticamente → consultar, escalar o revalidar.

Esta parte vigila además un riesgo que es obligatorio declarar: Publicar contenido incorrecto a escala, tratar datos personales sin base legal y perder trazabilidad. Se documenta en el entregable con su mitigación y su responsable; no se resuelve en la conversación.

6. Integración: de conceptos a una decisión defendible#

Sintetizar evaluación y guardrails no consiste en sumar definiciones. Empieza por conjunto de evaluación, contrasta guardarraíl con monitoreo posterior, incorpora umbral de aceptación como restricción y cierra con la medición. Aplica entonces la secuencia completa conservando tres columnas por paso: evidencia utilizada, alternativa descartada y razón del descarte.

Esa disciplina permite que una revisión posterior distinga una mala decisión de un mal resultado. Sin ella, el equipo reescribe la historia después de conocer el desenlace y no aprende nada transferible. Una síntesis correcta indica qué evidencia falta y qué decisión se posterga hasta obtenerla.

📚 Lectura comparada#

No se pide leer las obras completas. Para cada una se indica qué idea concreta sostiene esta clase, dónde buscarla y qué pregunta esa idea le hace a tu propio diagnóstico. La lectura termina cuando puedes responder esa pregunta con evidencia del caso.

ObraIdea que sostiene esta claseDónde buscarlaPregunta que le hace a tu diagnóstico
NIST — AI Risk Management Framework 1.0 (2023)Las cuatro funciones: mapear, medir, gestionar y gobernar el riesgo de IAEl núcleo del marco¿Qué debería observarse en conjunto de evaluación si aquí opera «las cuatro funciones: mapear, medir, gestionar y gobernar el riesgo de IA»? ¿Y qué observación lo desmentiría en este caso?
Andrew Ng — Machine Learning Yearning (2018)El conjunto de evaluación que representa la distribución real de usoLos capítulos sobre conjuntos de desarrollo y prueba¿Qué debería observarse en guardarraíl si aquí opera «el conjunto de evaluación que representa la distribución real de uso»? ¿Y qué observación lo desmentiría en este caso?
Ron Kohavi, Diane Tang y Ya Xu — Trustworthy Online Controlled Experiments (2020)Las métricas guardarraíl que impiden ganar en lo local perdiendo en el sistemaLos capítulos sobre métricas y guardarraíles¿Qué debería observarse en monitoreo posterior si aquí opera «las métricas guardarraíl que impiden ganar en lo local perdiendo en el sistema»? ¿Y qué observación lo desmentiría en este caso?
ISO — ISO 31000: Gestión del riesgo (2018)El proceso de gestión del riesgo: identificar, analizar, evaluar y tratarLa cláusula sobre el proceso¿Qué debería observarse en umbral de aceptación si aquí opera «el proceso de gestión del riesgo: identificar, analizar, evaluar y tratar»? ¿Y qué observación lo desmentiría en este caso?

Después de leer, escribe una discrepancia real. Al menos dos de estas obras entregan recomendaciones que no coinciden cuando se aplican al mismo caso; identifica cuáles y qué condición del caso decide a favor de una. Si no encuentras la discrepancia, es señal de que leíste buscando confirmación.

La lectura se evalúa por uso, no por cantidad de páginas. La nota de lectura debe indicar qué tesis modifica tu diagnóstico, qué evidencia del caso la tensiona y qué decisión concreta cambiarías después del contraste.

🧮 Ejemplo trabajado#

Situación. Ruta Andina desplegó su asistente sin conjunto de evaluación. Descubrió que prometía funcionalidades inexistentes cuando un cliente reclamó por escrito.

Paso 1 — Construir el conjunto de evaluación con casos reales. El equipo escribe primero el supuesto asociado a conjunto de evaluación y se prohíbe tratarlo como hecho. Contrasta ese supuesto con desempeño en el conjunto de evaluación y anota qué parte del dato todavía no existe. Del paso sale un artefacto revisable y una frase explícita: «cambiaríamos de rumbo si…».

Paso 2 — Definir el umbral de aceptación antes de probar. El trabajo aquí es separar lo observado de lo inferido sobre guardarraíl. La evidencia que ordena la discusión es incidentes por guardarraíl activado; si su definición no está escrita, escribirla es parte del paso. Nada avanza mientras el equipo no acuerde qué contaría como refutación.

Paso 3 — Implementar guardarraíles sobre los riesgos identificados. El riesgo de este paso es cerrar demasiado rápido alrededor de monitoreo posterior. Antes de concluir, el equipo enumera dos explicaciones alternativas del mismo patrón y revisa si deriva de desempeño logra distinguirlas. Si no lo logra, hace falta otra evidencia y así debe quedar registrado.

Paso 4 — Monitorear el desempeño en producción. Con umbral de aceptación ya delimitado, la pregunta pasa a ser de consecuencia: qué cambia en la operación, en la caja y en la carga del equipo. desempeño en el conjunto de evaluación entrega la lectura cuantitativa; el juicio sobre el costo de oportunidad sigue siendo humano y debe quedar firmado.

Paso 5 — Documentar incidentes y ajustar el sistema. El cierre exige compromiso: responsable, fecha, umbral de éxito y condición de detención asociados a conjunto de evaluación. incidentes por guardarraíl activado se convierte en la señal de seguimiento y se acuerda con qué frecuencia se revisa y quién puede declarar el fracaso sin costo político.

Síntesis. La recomendación termina con responsable, fecha, evidencia de éxito y señal de detención. Omitir cualquiera de esas cuatro piezas convierte el análisis en opinión difícil de auditar.

🔀 Comparación de caminos y límites#

CaminoQué privilegiaCuándo elegirloRiesgo principal
Actuar sobre conjunto de evaluaciónCasos representativos con resultado esperado que permiten medir el desempeñoCuando desempeño en el conjunto de evaluación es observable y accionable en el plazo de la decisión.Sobrerreaccionar a una señal parcial.
Actuar sobre guardarraílRestricción que impide un comportamiento inaceptable del sistemaCuando la primera explicación no distingue mecanismo ni responsable.Convertir el concepto en etiqueta y no en intervención.
Experimentar antes de decidirAprender antes de comprometer recursos mayoresCuando la decisión es reversible y la incertidumbre es alta.Experimentar indefinidamente y no decidir.
Escalar la decisiónElevar autoridad, especialidad o control legalCuando hay compromisos contractuales, datos personales, regulación o irreversibilidad.Delegar hacia arriba lo que sí correspondía decidir.

Frontera de aplicación. Ningún conjunto de evaluación cubre todos los casos posibles. Los guardarraíles y el monitoreo son necesarios precisamente porque la evaluación previa es incompleta.

🪜 El mismo tema según el rol#

NivelResponsabilidad sobre evaluación y guardrails
Analista / especialistaProduce la evidencia, documenta el método y declara los límites del dato.
Jefatura de equipoConvierte el análisis en prioridad, carga de trabajo y criterio compartido.
Gerencia comercialConecta la decisión con presupuesto, capacidad, dependencias y riesgo interáreas; es el nivel donde operan perfiles como Growth manager con IA, RevOps, Marketing manager y Sales enablement.
Dirección comercial (CRO/CMO)Decide si esto cambia la estrategia de ingresos y qué llega al directorio.
Founder / dueñoPregunta si la solución reduce dependencia de personas, preserva caja y puede operar como sistema repetible.

Al subir de nivel aumentan las personas, el dinero y las consecuencias que quedan dentro de la decisión. La misma herramienta debe volverse más explícita en evidencia, gobierno y revisión a medida que crece el alcance.

🏢 Caso ejecutivo#

Ruta Andina desplegó su asistente sin conjunto de evaluación. Descubrió que prometía funcionalidades inexistentes cuando un cliente reclamó por escrito.

Entrega un decision brief que contenga: (a) hechos y fuentes; (b) hipótesis; (c) dos opciones realmente defendibles; (d) efecto sobre cliente, operación, caja y riesgo; (e) recomendación; (f) la condición que la haría cambiar; (g) responsable y fecha de revisión. Usa al menos dos fuentes de la lectura comparada para desafiar tu primera respuesta.

🧪 Práctica guiada#

Cada paso indica qué hacer, con qué material y cómo saber que está terminado. No avances si la última columna todavía no se cumple: los pasos siguientes suponen el anterior resuelto.

#PasoQué hacesCon quéCriterio de término
1Reconstruir los hechosVuelca el caso en una tabla hecho / inferencia / supuesto / decisión sin agregar información que no esté en el enunciado.El caso y nada másNinguna fila de la columna «hecho» contiene un juicio; cada supuesto tiene un responsable de verificarlo.
2Ejecutar el métodoRecorre la secuencia construir el conjunto de evaluación con casos reales → definir el umbral de aceptación antes de probar → implementar guardarraíles sobre los riesgos identificados → monitorear el desempeño en producción → documentar incidentes y ajustar el sistema y adjunta la evidencia usada en cada transición.La tabla del paso 1Cada paso deja un artefacto revisable y una alternativa descartada con su razón.
3Operacionalizar la señalConstruye la ficha de medición de desempeño en el conjunto de evaluación; si el dato no existe, diseña cómo obtenerlo y estima cuánto costaría.Fuentes de datos reales o el diseño de capturaDos personas del equipo calculan el mismo número con la ficha y llegan al mismo resultado.
4Atacar tu propia respuestaEscribe la alternativa que contradice tu preferencia inicial y hazle un pre-mortem a seis meses.Tu borrador de recomendaciónPuedes nombrar el dato concreto que te haría cambiar de opinión.
5Contrastar con la fuenteLee la idea anclada de AI Risk Management Framework 1.0 y la de Machine Learning Yearning, y registra una coincidencia y una tensión con tu diagnóstico.La tabla de lectura comparadaLa nota de lectura cita qué idea usaste y qué decisión cambió por ella, o declara que ninguna cambió y por qué.
6Subir de nivelRehaz la decisión desde la dirección comercial: qué cambia al aumentar alcance, dinero e irreversibilidad.El brief completoEl brief indica qué parte de la decisión ya no corresponde al analista y a quién pasa.

Si te atascas. El bloqueo más común no es de método sino de definición: vuelve a la tabla de conceptos y comprueba que puedes clasificar un caso límite sin dudar. Si dudas, el problema está ahí y no en el paso que estabas ejecutando.

⚠️ Errores frecuentes#

SíntomaCausa probableCorrección
Usar conjunto de evaluación y guardarraíl como sinónimosSe perdió la distinción entre «casos representativos con resultado esperado que permiten medir el desempeño» y «restricción que impide un comportamiento inaceptable del sistema»Vuelve a los observables y exige una señal distinta para cada concepto.
Empezar por «documentar incidentes y ajustar el sistema»Se saltó «construir el conjunto de evaluación con casos reales»: la solución llegó antes que el diagnósticoReconstruye la cadena completa y marca el primer supuesto no demostrado.
Optimizar sólo desempeño en el conjunto de evaluaciónLa métrica local reemplazó al resultado del sistemaContrástala con deriva de desempeño y explicita el costo de oportunidad.
Desplegar sin conjunto de evaluación ni umbralError específico de esta claseConstruye casos representativos con respuesta esperada y define el umbral antes del despliegue.
No fijar revisiónLa decisión se vuelve permanente por inerciaDefine responsable, fecha, señal de éxito y condición de detención.

❓ Preguntas de comprobación#

  1. Explica la diferencia entre conjunto de evaluación y guardarraíl con un ejemplo donde elegir mal cambie la decisión.
  2. ¿Qué observarías para validar monitoreo posterior y qué observación te obligaría a rechazar tu interpretación?
  3. Aplica «construir el conjunto de evaluación con casos reales» al caso de la clase. ¿Qué dato sigue faltando?
  4. ¿Por qué desempeño en el conjunto de evaluación no basta por sí sola para atribuir causalidad?
  5. Compara dos fuentes de la lectura comparada: ¿dónde llevarían a recomendaciones distintas?
  6. ¿Qué decisión equivocada se produciría si se ignora este límite: «Ningún conjunto de evaluación cubre todos los casos posibles. Los guardarraíles y el monitoreo son necesarios precisamente porque la evaluación previa es incompleta»?

🗝️ Respuestas orientadoras#

No encontrarás aquí las respuestas: encontrarás qué tiene que contener una respuesta suficiente. Úsalo para autoevaluarte antes de entregar y para corregir a un par.

PreguntaUna respuesta suficiente contiene
1Nombra un caso real donde la clasificación cambie la intervención, no sólo la etiqueta. Si el ejemplo funciona igual con los dos conceptos intercambiados, la distinción todavía no está entendida.
2Dos observaciones concretas: una que confirmaría monitoreo posterior y otra que te obligaría a abandonarlo. Una respuesta sin condición de refutación no es suficiente.
3El dato faltante debe ser nombrable y obtenible: qué se mide, quién lo tiene y en cuánto tiempo. «Faltan datos» no cuenta como respuesta.
4Debes distinguir asociación de causa y proponer al menos una explicación alternativa del mismo movimiento de desempeño en el conjunto de evaluación.
5Identifica la condición del caso que decide entre ambas obras. Basta con que sea una: la respuesta correcta no es «depende», sino «depende de esto, y aquí ocurre así». Ancla el contraste en AI Risk Management Framework 1.0 y ISO 31000: Gestión del riesgo.
6Describe la decisión equivocada concreta —qué se haría de más o de menos— y quién pagaría el costo. Un límite que no produce una decisión distinta no está operando como límite.

Si tres o más respuestas no alcanzan el criterio, no sigas a la clase siguiente: repite el desarrollo con el caso en la mano. Avanzar con la definición floja es lo que produce, más adelante, decisiones que nadie puede auditar.

🇨🇱 Contexto chileno y cumplimiento#

Riesgo asociado a esta parte: Publicar contenido incorrecto a escala, tratar datos personales sin base legal y perder trazabilidad. Antes de ejecutar cualquier recomendación de esta clase en una operación real, comprueba la norma en su texto vigente. Los enlaces van al texto completo publicado por la Biblioteca del Congreso Nacional; son gratuitos y no hace falta creerle a este material.

Dentro del repositorio, el mapa regulatorio ordena qué norma aplica a cada decisión comercial, datos personales y ética desarrolla el tratamiento de datos y fuentes oficiales lista los organismos con su fecha de consulta. Ninguno de esos documentos reemplaza al texto legal.

La regla del programa es simple: la fuente oficial manda sobre el material pedagógico. Si la norma cambió después de la fecha de esta clase, gana la norma.

📥 Entregable#

Guarda en evidence/P21-C12-evaluacion-y-guardrails/:

Este entregable alimenta el artefacto de la parte: operating model humano-IA con casos de uso, evaluaciones, guardrails y registro de incidentes.

✅ Evaluación de la clase#

CriterioPesoEvidencia esperada
Precisión conceptual25 %Distinciones correctas y observables entre los conceptos de la clase.
Diagnóstico y evidencia30 %Datos pertinentes, línea base, supuestos explícitos y límites del dato.
Decisión y trade-offs30 %Dos opciones defendibles, costo de oportunidad y condición de revisión.
Fuentes y comunicación15 %Dos lecturas realmente utilizadas y argumento ejecutivo trazable.

Aprobación: 80/100 y ningún criterio bajo 60 %. Una respuesta que podría copiarse sin cambios a otra clase se considera insuficiente.

📗 Fuentes y verificación#

Aquí conviene separar dos cosas que suelen ir juntas y no son lo mismo.

Lo que está comprobado. Que cada obra existe y cuál es exactamente la edición: el enlace resuelve su ISBN contra el catálogo de OpenLibrary, y eso se revalida periódicamente. Las normas chilenas citadas más arriba enlazan su texto completo y gratuito.

Lo que es atribución del programa. Que la idea señalada esté en el capítulo que se indica. Eso es la lectura que este material hace de cada obra, no una cita textual cotejada frase por frase, y se declara así de explícito para que puedas contrastarlo: si abres la obra y no encuentras la idea donde se dice, la cita está mal puesta y corresponde reportarlo como error del material. No se citan números de página porque cambian entre ediciones.

Estándar pedagógico del programa: Susan A. Ambrose et al. — How Learning Works (2010); Peter C. Brown, Henry L. Roediger III y Mark A. McDaniel — Make It Stick (2014); Grant Wiggins y Jay McTighe — Understanding by Design (2005, 2.ª ed.); Anders Ericsson y Robert Pool — Peak (2016); William Ellet — The Case Study Handbook (2018, ed. revisada).

Regla de fuentes. Las obras anteriores estructuran las perspectivas de esta materia. Cualquier norma, impuesto, tarifa, política de plataforma o estándar vivo mencionado debe comprobarse nuevamente en su fuente primaria vigente antes de usarse en una operación real. El desarrollo de esta clase es original y no reproduce capítulos protegidos por derechos de autor.

Sobre la edición. No busques estas obras sólo por el título: distintas ediciones cambian capítulos y ejemplos, y los anclajes de arriba están hechos sobre la que declara el registro de fuentes. La bibliografía completa de la parte, con todas sus obras, está en su índice.


Clase 11 · IA en customer success · Índice de la parte · Clase 13 · Privacidad y propiedad intelectual