Explicabilidad
Objetivo
Explicar predicciones con Integrated Gradients y permutación.
Dataset real
- Dataset:
adult_census - Fuente: UCI
- Referencia: https://archive.ics.uci.edu/dataset/2/adult
- Licencia/condiciones: CC BY 4.0
- Uso: los datos se descargan desde la fuente; no hay ejemplos sintéticos ni archivos inventados.
Incluye advertencias éticas sobre variables demográficas y sesgo.
Fundamento matemático
Atribución por integración del gradiente entre baseline y entrada.
Protocolo experimental
- Descargar y verificar la procedencia.
- Conservar o crear una partición reproducible.
- Ajustar transformaciones únicamente con
train. - Seleccionar modelo e hiperparámetros usando
validation. - Evaluar
testuna sola vez tras congelar la decisión. - Comparar con la línea base: Regresión logística interpretable.
- Guardar configuración, entorno, métricas, predicciones, gráficos y modelo.
Ejecución
python labs/21_explainability/train.py --quick
python labs/21_explainability/train.py --config improved
Preparar únicamente el dataset:
python -m neural_labs.cli dataset --lab 21_explainability
Inferencia y exportación:
neural-labs predict --lab 21_explainability --run latest --input sample.json
neural-labs export --lab 21_explainability --run latest --format onnx --verify
Métricas
accuracy, f1, roc_auc, pr_auc.
Archivos
notebook.ipynb: recorrido completo y ejecutable.notebook_student.ipynb: actividades evaluables sin soluciones.notebook_solution.ipynb: resolución docente y pruebas de referencia.train.py: interfaz de terminal que usa el mismo código del cuaderno.configs/baseline.yaml: configuración base.configs/improved.yaml: configuración ampliada.data/dataset.yaml: procedencia, licencia y política de partición.
Ejercicios
- Cambiar una decisión experimental y justificarla.
- Analizar errores por clase o segmento.
- Comparar costo, precisión y latencia.
- Documentar sesgos, limitaciones y usos no recomendados.
Material formativo v3
theory.md: fundamento, protocolo y riesgos de interpretación.experiments.md: hipótesis, variables controladas y tabla multi-semilla.assessment.md: preguntas y rúbrica de evaluación.lesson.yaml: resultados de aprendizaje, prerrequisitos y entregables.
Comandos profesionales
neural-labs quality --lab 21_explainability --quick
neural-labs benchmark --lab 21_explainability --quick --split-seed 42 --training-seeds 41 42 43
neural-labs leaderboard
Sellado del experimento
La partición se controla con split_seed; la inicialización y el entrenamiento con training_seed. El conjunto test se abre solamente después de seleccionar el checkpoint mediante validación y escribir experiment.lock.json.
🧠 Teoría
Teoría — Explicabilidad
Propósito
Explicar predicciones con Integrated Gradients y permutación.
Idea central
Este laboratorio estudia atribución de características usando adult_census, un dataset público real procedente de UCI.
Un modelo puede acertar mucho y, aun así, ser una caja negra: predice si el ingreso anual supera cierto umbral, pero no dice por qué. La explicabilidad busca responder esa pregunta asignando a cada característica de entrada una atribución: cuánto empujó ese atributo la predicción hacia una clase u otra. En un dataset con variables demográficas y laborales como adult_census, esa atribución no es un lujo académico —es un requisito de auditoría, porque una explicación revela si el modelo se apoya en señales legítimas o en correlaciones espurias con atributos sensibles.
El laboratorio contrasta métodos locales y globales. Integrated Gradients explica una predicción concreta (por qué este individuo fue clasificado así) integrando el gradiente del modelo a lo largo de un camino desde una entrada de referencia. La importancia por permutación mide, en cambio, cuánto se degrada el rendimiento global cuando se destruye la información de una variable barajándola. Comparamos siempre contra una regresión logística interpretable, cuyo peso por variable ofrece un patrón de referencia de qué debería "importar".
Fundamento matemático
Atribución por integración del gradiente entre baseline y entrada.
Integrated Gradients parte de una idea de teoría de juegos y cálculo: para explicar la salida f(x) de un modelo, comparamos x con una entrada de referencia (baseline) x′ que representa "ausencia de información" (por ejemplo, el vector de medias o de ceros). La contribución de la característica i es la integral del gradiente parcial ∂f/∂xᵢ a lo largo del segmento recto que va de x′ a x:
IGᵢ(x) = (xᵢ − x′ᵢ) · ∫₀¹ ∂f(x′ + α·(x − x′)) / ∂xᵢ · dα
Intuitivamente recorremos el camino de x′ hasta x en pasos infinitesimales, acumulamos cuánto responde la salida a la variable i en cada punto del trayecto, y lo multiplicamos por cuánto cambió esa variable, (xᵢ − x′ᵢ). Usar la integral del gradiente —y no el gradiente en un solo punto— evita el problema de la saturación: cuando f está en una zona plana, el gradiente local es casi cero aunque la variable sea decisiva, y la integral a lo largo del camino sí captura su efecto. En la práctica la integral se aproxima por una suma de Riemann con m pasos: IGᵢ ≈ (xᵢ − x′ᵢ)·(1/m)·Σₖ ∂f(x′ + (k/m)(x − x′))/∂xᵢ. El método cumple dos propiedades deseables: sensibilidad (una variable que cambia la predicción recibe atribución no nula) y completitud (la suma de las atribuciones iguala la diferencia f(x) − f(x′)).
La importancia por permutación es un método agnóstico al modelo y de alcance global. Se mide una métrica de referencia s (por ejemplo, exactitud o AUC) sobre datos de validación; luego, para la característica j, se baraja aleatoriamente su columna —rompiendo su relación con la etiqueta pero conservando su distribución marginal— y se vuelve a medir s_j^perm. La importancia es la caída media Iⱼ = s − 𝔼[s_j^perm], normalmente promediada sobre varias permutaciones para estimar su variabilidad. La lógica es contrafactual: si al destruir la información de j el rendimiento no cae, el modelo no la estaba usando; si se desploma, esa variable era load-bearing.
Ambos enfoques tienen límites que el laboratorio hace explícitos. Las atribuciones dependen de decisiones —el baseline elegido en Integrated Gradients, la correlación entre variables en la permutación— y pueden ser inestables: pequeñas perturbaciones de la entrada, o variables muy correlacionadas entre sí, pueden repartir el crédito de formas distintas sin que la predicción cambie. Una explicación describe cómo actúa el modelo, no un mecanismo causal del mundo; confundir atribución con causalidad es el error de interpretación central que hay que evitar.
Protocolo científico
- Ajustar transformaciones, vocabulario, normalización y selección de variables solo con
train. - Usar
validationpara arquitectura, hiperparámetros, checkpoint y umbrales. - Evaluar
testuna vez, después de congelar las decisiones. - Comparar contra Regresión logística interpretable.
- Reportar variación entre semillas e intervalos de confianza; una métrica puntual no expresa toda la incertidumbre.
Riesgos de interpretación
Incluye advertencias éticas sobre variables demográficas y sesgo.
El dataset refleja su proceso de recolección y no representa automáticamente otros períodos, países o poblaciones. Una asociación predictiva no demuestra causalidad.
Pregunta crítica
¿La explicación es estable ante pequeñas perturbaciones?
🔗 Referencias
Las referencias apuntan a las obras; no se reproduce su contenido, la redacción es original.
- Molnar — Interpretable Machine Learning (libro online, molnar.github.io/interpretable-ml-book) — referencia integral sobre métodos de interpretabilidad, incluidos importancia por permutación, LIME y SHAP.
- Ribeiro, Singh y Guestrin (2016), "Why Should I Trust You?": Explaining the Predictions of Any Classifier (LIME), KDD — explicaciones locales mediante modelos sustitutos interpretables.
- Lundberg y Lee (2017), A Unified Approach to Interpreting Model Predictions (SHAP), NeurIPS — marco unificado de atribución basado en valores de Shapley.
- Selvaraju et al. (2017), Grad-CAM: Visual Explanations from Deep Networks via Gradient-based Localization, ICCV — mapas de atribución basados en gradientes para redes convolucionales.
- Fuente del dataset: https://archive.ics.uci.edu/dataset/2/adult
- Consulte
docs/experiment-protocol.md,docs/reproducibility.mdydocs/ethics-and-licenses.md.
🔬 Experimentos
Plan de experimentos — Explicabilidad
Hipótesis principal
Explicar predicciones con Integrated Gradients y permutación. La hipótesis debe aceptarse o rechazarse comparando el modelo con Regresión logística interpretable y no solo observando que la pérdida disminuye.
Experimento mínimo
- Ejecutar
baseline.yamlcon tres semillas. - Ejecutar
improved.yamlcon las mismas semillas. - Mantener fija la partición de datos dentro de cada semilla.
- Elegir la variante con
validation. - Comparar la variante elegida contra la línea base en
test. - Revisar intervalos de confianza, errores y costo computacional.
Experimento específico
Contrastar explicaciones con permutaciones.
Variables controladas
- Dataset y política de partición.
- Semillas declaradas.
- Presupuesto de épocas y criterio de parada.
- Métrica de selección:
accuracyo la especificada en la configuración. - Hardware y versiones registradas en
environment.json.
Tabla que debe completarse
| Variante | Semilla | Métrica validation | Métrica test | Tiempo | Parámetros | Observación |
|---|---|---|---|---|---|---|
| baseline | 41 | |||||
| baseline | 42 | |||||
| baseline | 43 | |||||
| improved | 41 | |||||
| improved | 42 | |||||
| improved | 43 |
Criterio de conclusión
La conclusión debe declarar magnitud de la mejora, incertidumbre, costo adicional, errores relevantes y condiciones bajo las cuales el resultado podría no repetirse.
📝 Evaluación
Evaluación — Explicabilidad
Evidencias obligatorias
- Dataset preparado y auditoría sin solapamientos.
- Notebook ejecutado sin celdas omitidas.
- Línea base y modelo neuronal comparados.
- Resultados de al menos tres semillas o justificación del costo.
- Análisis de errores y limitaciones.
- Model card actualizada.
Preguntas
- Explique con sus palabras: Atribución por integración del gradiente entre baseline y entrada.
- ¿Qué información del dataset solo puede utilizarse durante entrenamiento?
- ¿Por qué la línea base Regresión logística interpretable es una comparación razonable?
- ¿La explicación es estable ante pequeñas perturbaciones?
- ¿Qué cambiaría antes de usar este modelo fuera del laboratorio?
Rúbrica
| Criterio | Insuficiente | Adecuado | Excelente | Peso |
|---|---|---|---|---|
| Integridad de datos | mezcla particiones | separación correcta | auditoría, hashes y justificación | 20% |
| Implementación | no ejecuta | entrena y evalúa | código claro, reusable y probado | 20% |
| Diseño experimental | resultado aislado | comparación controlada | multi-semilla e incertidumbre | 20% |
| Análisis | repite métricas | interpreta errores | identifica sesgos, límites y costo | 25% |
| Comunicación | incompleta | reporte entendible | model card y conclusiones verificables | 15% |
La aprobación exige al menos 70% y cero errores críticos de fuga de datos.