Neural Network Training Labs
Laboratorio 21 · Central · 22 / 31

🔍 Explicabilidad

Explicabilidad

Objetivo

Explicar predicciones con Integrated Gradients y permutación.

Dataset real

Incluye advertencias éticas sobre variables demográficas y sesgo.

Fundamento matemático

Atribución por integración del gradiente entre baseline y entrada.

Protocolo experimental

  1. Descargar y verificar la procedencia.
  2. Conservar o crear una partición reproducible.
  3. Ajustar transformaciones únicamente con train.
  4. Seleccionar modelo e hiperparámetros usando validation.
  5. Evaluar test una sola vez tras congelar la decisión.
  6. Comparar con la línea base: Regresión logística interpretable.
  7. Guardar configuración, entorno, métricas, predicciones, gráficos y modelo.

Ejecución

python labs/21_explainability/train.py --quick
python labs/21_explainability/train.py --config improved

Preparar únicamente el dataset:

python -m neural_labs.cli dataset --lab 21_explainability

Inferencia y exportación:

neural-labs predict --lab 21_explainability --run latest --input sample.json
neural-labs export --lab 21_explainability --run latest --format onnx --verify

Métricas

accuracy, f1, roc_auc, pr_auc.

Archivos

Ejercicios

Material formativo v3

Comandos profesionales

neural-labs quality --lab 21_explainability --quick
neural-labs benchmark --lab 21_explainability --quick --split-seed 42 --training-seeds 41 42 43
neural-labs leaderboard

Sellado del experimento

La partición se controla con split_seed; la inicialización y el entrenamiento con training_seed. El conjunto test se abre solamente después de seleccionar el checkpoint mediante validación y escribir experiment.lock.json.

🧠 Teoría

Teoría — Explicabilidad

Propósito

Explicar predicciones con Integrated Gradients y permutación.

Idea central

Este laboratorio estudia atribución de características usando adult_census, un dataset público real procedente de UCI.

Un modelo puede acertar mucho y, aun así, ser una caja negra: predice si el ingreso anual supera cierto umbral, pero no dice por qué. La explicabilidad busca responder esa pregunta asignando a cada característica de entrada una atribución: cuánto empujó ese atributo la predicción hacia una clase u otra. En un dataset con variables demográficas y laborales como adult_census, esa atribución no es un lujo académico —es un requisito de auditoría, porque una explicación revela si el modelo se apoya en señales legítimas o en correlaciones espurias con atributos sensibles.

El laboratorio contrasta métodos locales y globales. Integrated Gradients explica una predicción concreta (por qué este individuo fue clasificado así) integrando el gradiente del modelo a lo largo de un camino desde una entrada de referencia. La importancia por permutación mide, en cambio, cuánto se degrada el rendimiento global cuando se destruye la información de una variable barajándola. Comparamos siempre contra una regresión logística interpretable, cuyo peso por variable ofrece un patrón de referencia de qué debería "importar".

Fundamento matemático

Atribución por integración del gradiente entre baseline y entrada.

Integrated Gradients parte de una idea de teoría de juegos y cálculo: para explicar la salida f(x) de un modelo, comparamos x con una entrada de referencia (baseline) x′ que representa "ausencia de información" (por ejemplo, el vector de medias o de ceros). La contribución de la característica i es la integral del gradiente parcial ∂f/∂xᵢ a lo largo del segmento recto que va de x′ a x:

IGᵢ(x) = (xᵢ − x′ᵢ) · ∫₀¹ ∂f(x′ + α·(x − x′)) / ∂xᵢ · dα

Intuitivamente recorremos el camino de x′ hasta x en pasos infinitesimales, acumulamos cuánto responde la salida a la variable i en cada punto del trayecto, y lo multiplicamos por cuánto cambió esa variable, (xᵢ − x′ᵢ). Usar la integral del gradiente —y no el gradiente en un solo punto— evita el problema de la saturación: cuando f está en una zona plana, el gradiente local es casi cero aunque la variable sea decisiva, y la integral a lo largo del camino sí captura su efecto. En la práctica la integral se aproxima por una suma de Riemann con m pasos: IGᵢ ≈ (xᵢ − x′ᵢ)·(1/m)·Σₖ ∂f(x′ + (k/m)(x − x′))/∂xᵢ. El método cumple dos propiedades deseables: sensibilidad (una variable que cambia la predicción recibe atribución no nula) y completitud (la suma de las atribuciones iguala la diferencia f(x) − f(x′)).

La importancia por permutación es un método agnóstico al modelo y de alcance global. Se mide una métrica de referencia s (por ejemplo, exactitud o AUC) sobre datos de validación; luego, para la característica j, se baraja aleatoriamente su columna —rompiendo su relación con la etiqueta pero conservando su distribución marginal— y se vuelve a medir s_j^perm. La importancia es la caída media Iⱼ = s − 𝔼[s_j^perm], normalmente promediada sobre varias permutaciones para estimar su variabilidad. La lógica es contrafactual: si al destruir la información de j el rendimiento no cae, el modelo no la estaba usando; si se desploma, esa variable era load-bearing.

Ambos enfoques tienen límites que el laboratorio hace explícitos. Las atribuciones dependen de decisiones —el baseline elegido en Integrated Gradients, la correlación entre variables en la permutación— y pueden ser inestables: pequeñas perturbaciones de la entrada, o variables muy correlacionadas entre sí, pueden repartir el crédito de formas distintas sin que la predicción cambie. Una explicación describe cómo actúa el modelo, no un mecanismo causal del mundo; confundir atribución con causalidad es el error de interpretación central que hay que evitar.

Protocolo científico

Riesgos de interpretación

Incluye advertencias éticas sobre variables demográficas y sesgo.

El dataset refleja su proceso de recolección y no representa automáticamente otros períodos, países o poblaciones. Una asociación predictiva no demuestra causalidad.

Pregunta crítica

¿La explicación es estable ante pequeñas perturbaciones?

🔗 Referencias

Las referencias apuntan a las obras; no se reproduce su contenido, la redacción es original.

🔬 Experimentos

Plan de experimentos — Explicabilidad

Hipótesis principal

Explicar predicciones con Integrated Gradients y permutación. La hipótesis debe aceptarse o rechazarse comparando el modelo con Regresión logística interpretable y no solo observando que la pérdida disminuye.

Experimento mínimo

  1. Ejecutar baseline.yaml con tres semillas.
  2. Ejecutar improved.yaml con las mismas semillas.
  3. Mantener fija la partición de datos dentro de cada semilla.
  4. Elegir la variante con validation.
  5. Comparar la variante elegida contra la línea base en test.
  6. Revisar intervalos de confianza, errores y costo computacional.

Experimento específico

Contrastar explicaciones con permutaciones.

Variables controladas

Tabla que debe completarse

Variante Semilla Métrica validation Métrica test Tiempo Parámetros Observación
baseline 41
baseline 42
baseline 43
improved 41
improved 42
improved 43

Criterio de conclusión

La conclusión debe declarar magnitud de la mejora, incertidumbre, costo adicional, errores relevantes y condiciones bajo las cuales el resultado podría no repetirse.

📝 Evaluación

Evaluación — Explicabilidad

Evidencias obligatorias

Preguntas

  1. Explique con sus palabras: Atribución por integración del gradiente entre baseline y entrada.
  2. ¿Qué información del dataset solo puede utilizarse durante entrenamiento?
  3. ¿Por qué la línea base Regresión logística interpretable es una comparación razonable?
  4. ¿La explicación es estable ante pequeñas perturbaciones?
  5. ¿Qué cambiaría antes de usar este modelo fuera del laboratorio?

Rúbrica

Criterio Insuficiente Adecuado Excelente Peso
Integridad de datos mezcla particiones separación correcta auditoría, hashes y justificación 20%
Implementación no ejecuta entrena y evalúa código claro, reusable y probado 20%
Diseño experimental resultado aislado comparación controlada multi-semilla e incertidumbre 20%
Análisis repite métricas interpreta errores identifica sesgos, límites y costo 25%
Comunicación incompleta reporte entendible model card y conclusiones verificables 15%

La aprobación exige al menos 70% y cero errores críticos de fuga de datos.