🧮 Computational Mathematics

Inicio · Parte 17 — Frontera matemática para IA e investigación

355 — Causal inference

frontera-investigacion clase 15 de 20 4 horas demostración causal_inference

El coeficiente sin ajustar estima 1,02 un efecto que en realidad es cero.

Fórmulas

criterio de puerta trasera: bloquear todos los caminos X ← … → Y
confusor: Z → X y Z → Y
colisionador: X → C ← Y, condicionar crea asociación

Desarrollo

La inferencia causal formaliza qué significa que X cause Y y cuándo se puede estimar ese efecto a partir de datos observacionales. Su lenguaje son los grafos causales dirigidos, donde las flechas representan relaciones causales y los caminos determinan qué asociaciones aparecen.

El criterio de puerta trasera dice qué variables hay que ajustar: un conjunto que bloquee todos los caminos no causales entre X e Y. Ajustar por ese conjunto permite estimar el efecto causal correctamente. La demostración numérica es contundente: con un efecto causal real de cero, el coeficiente sin ajustar estima 1,02 —una relación fuerte e inexistente— y al ajustar por el confusor baja a 0,007.

El resultado que más contradice la intuición es el sesgo de colisionador. Si dos variables independientes causan una tercera, condicionar sobre esa tercera crea correlación entre ellas donde no había ninguna. Ajustar por todo lo disponible no es una estrategia conservadora: puede introducir sesgo donde no lo había.

La conclusión metodológica es que no se puede decidir qué ajustar mirando solo los datos. Hace falta un modelo causal, es decir, conocimiento del dominio sobre qué causa qué. Los datos por sí solos no distinguen un confusor de un colisionador, y esa es la razón profunda de que la aleatorización sea tan valiosa: rompe todos los caminos de puerta trasera a la vez, conocidos y desconocidos.

Ejemplo trabajado

Efecto real cero, estimado en 1,02 sin ajustar.

estructura: Z → X,  Z → Y,  X ↛ Y
efecto causal real de X sobre Y: 0,0

coeficiente sin ajustar:      1,0243        ✗
coeficiente ajustando por Z:  0,0074        ✓

El ajuste recupera el efecto real.

Criterio de puerta trasera:
  bloquear todos los caminos X ← … → Y

Colisionador (X → C ← Y):
  correlación X-Y sin condicionar C: −0,0145
  (independientes, como deben ser)
  al condicionar sobre C aparecería correlación
  donde no la hay.

Qué calcula el laboratorio

Confusión, ajuste por backdoor y el sesgo de colisionador.

python classes/part-17-frontera-matematica-para-ia-e-investigacion/355-causal-inference/lab.py
compmath run 355

Salidas del laboratorio (10)

Muestra de la ejecución real

{
  "efecto_causal_real_de_X_sobre_Y": 0.0,
  "coeficiente_sin_ajustar": 1.0243,
  "coeficiente_ajustando_por_Z": 0.0074,
  "el_ajuste_recupera_el_efecto": true,
  "criterio_backdoor": "bloquear todos los caminos X ← … → Y",
  "correlacion_X_Y_sin_condicionar_el_colisionador": -0.0145
}

Errores comunes

Dónde se usa

Evaluación de políticas y tratamientos, atribución en marketing, análisis de equidad algorítmica, epidemiología y diseño de experimentos.

Idea rectora de la parte

Las cotas PAC acotan el error esperado, no garantizan el error observado.

Error a evitar

Interpretar una cota teórica como predicción del error real.

Conexión con IA

Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.

Bibliografía de la clase

Archivos de la clase