P95 — Herramientas causales

Ruta probabilística · Ver no es hacer. Tres peldaños —asociar, intervenir, imaginar— y ninguna cantidad de datos permite subir del primero sin declarar supuestos.

Nivel: L3 · Motor: causalidad · Notebook: P95_causalidad.ipynb · Anexo: probabilidad y verosimilitud

1. Identificación

Campo Valor
Título original The Seven Tools of Causal Inference, with Reflections on Machine Learning
Autoría Judea Pearl
Año 2019
Venue Communications of the ACM, 62(3), 54–60
Fuente primaria doi:10.1145/3241036
Acceso Abierto
Fecha de consulta 2026-08-17

2. Problema anterior

El aprendizaje automático ajusta funciones sobre distribuciones observadas. Con eso responde preguntas de asociación: qué esperar de Y cuando se ve X.

Pero las decisiones que importan son de intervención: qué pasa con Y si hago X. Y esas dos preguntas tienen respuestas distintas cuando hay confusores — variables que influyen a la vez en quién recibe el tratamiento y en el resultado.

Ninguna cantidad de datos observacionales distingue un caso del otro. Es una limitación estructural, no de tamaño de muestra ni de capacidad del modelo.

3. Propuesta

La escalera de la causalidad, con tres peldaños que exigen cada vez más:

1. ASOCIACIÓN     P(Y | X)         ver           lo que hace el aprendizaje automático
2. INTERVENCIÓN   P(Y | do(X))     hacer         exige el grafo causal
3. CONTRAFÁCTICO  P(Y_x | X', Y')  imaginar      exige el modelo estructural completo

Y siete herramientas para operar en los peldaños superiores: modelos gráficos, el operador do, el criterio de puerta trasera, la fórmula de ajuste, el análisis de mediación, la transportabilidad entre poblaciones y el tratamiento de datos faltantes.

La tesis central: la estructura causal se declara, no se estima de la tabla.

4. Intuición sin fórmulas

Los termómetros y la fiebre. Ver un termómetro alto predice fiebre perfectamente. Romper el termómetro no cura a nadie.

La correlación es idéntica en los dos casos; la consecuencia de intervenir, opuesta. Y no hay forma de distinguirlas mirando más lecturas de termómetro.

Dónde deja de funcionar la analogía: aquí sabemos cuál causa a cuál. En un problema real esa es justamente la pregunta, y responderla exige conocimiento del dominio, experimentos o supuestos defendidos — nunca solo datos observacionales.

5. Matemática mínima

Confusor: variable que influye en el tratamiento Y en el resultado

Fórmula de ajuste (criterio de puerta trasera):
    P(Y | do(X)) = Σ_z P(Y | X, Z = z) · P(Z = z)
                          ────────────    ────────
                          dentro de cada   ponderado por
                          estrato          la población total

La miniatura reproduce la paradoja de Simpson con un tratamiento y dos grupos de gravedad:

Grupo Tasa con tratamiento Tasa sin tratamiento ¿Gana el tratamiento?
leves 0,931 0,8667
graves 0,730 0,6875
agregado 0,780 0,8257 no
tras ajustar por gravedad 0,8325 0,7789

Gana en los dos subgrupos y pierde en el total. Los tres números son correctos. Cuál hay que creer depende de si la gravedad es causa del tratamiento —hay que ajustar— o consecuencia suya —ajustar sería el error—. Los datos son idénticos en ambos casos.

💡 Consejo

Puente matemático. Esta sección da por sabido lo siguiente. Si algo no te suena, léelo primero: está explicado una sola vez, en un solo sitio, y sirve para todas las fichas.

Dónde Qué necesitas de ahí
A02 §3 · Verosimilitud y entropía cruzada qué es exactamente una probabilidad condicional, y por qué P(Y|X) no es P(Y|do(X))

6. Arquitectura o flujo

flowchart TD
    G["gravedad<br/>(confusor)"] --> T["tratamiento"]
    G --> R["resultado"]
    T --> R
    T -.->|"P(R | T)<br/>asociación"| A["contaminada por G"]
    T -.->|"P(R | do(T))<br/>intervención"| B["ajustar por G:<br/>fórmula de puerta trasera"]
    style B fill:#1a3a2a,stroke:#3fb950,color:#f0f6fc

7. Qué observar en el paper original

8. Evidencia y resultados

Es un artículo de posición y síntesis en una revista de divulgación técnica. Presenta el marco y las herramientas; las demostraciones están en la literatura previa del autor.

No hay experimentos. Su fuerza es la claridad del marco y la precisión con la que separa lo que se puede y no se puede concluir de datos observacionales.

La miniatura construye un caso de Simpson con números elegidos para que la inversión sea nítida, y muestra que ninguna operación sobre la tabla decide cuál lectura es la correcta.

9. Impacto

10. Limitaciones

  1. El grafo hay que ponerlo, y en la mayoría de los problemas reales no se conoce. El artículo no resuelve cómo descubrirlo.
  2. El ajuste correcto depende del grafo supuesto. Con otro grafo, ajustar por la misma variable puede ser el error.
  3. El tercer peldaño exige el modelo estructural completo, mucho más que un grafo, y rara vez está disponible.
  4. La comunidad de resultados potenciales (Rubin) discute parte del énfasis y del vocabulario; los dos marcos son en buena medida traducibles y la disputa es más de estilo de lo que parece.
  5. Es un artículo programático: enuncia herramientas, no las enseña. Para aplicarlas hace falta la literatura técnica.

11. Errores comunes

Error Corrección
«Con suficientes datos se puede inferir causalidad» No de datos puramente observacionales. La paradoja de Simpson se vuelve más nítida con más datos, no desaparece.
«Correlación no implica causalidad, y ya está» El artículo va mucho más allá: da las condiciones bajo las cuales sí se puede estimar un efecto causal de datos observacionales, y cuáles son.
«Ajustar por todas las variables disponibles es lo seguro» Ajustar por un mediador o por un colisionador introduce sesgo. Qué ajustar depende del grafo, y ajustar de más también es un error.
«El aprendizaje automático resolverá esto con más capacidad» Es una limitación estructural del primer peldaño, no de capacidad. Un modelo más grande ajusta mejor la misma distribución observada.
«Los contrafácticos se calculan con el grafo» El tercer peldaño exige el modelo estructural completo —las ecuaciones, no solo las flechas—, y eso rara vez se tiene.

12. Relación con trabajos anteriores

13. Relación con trabajos posteriores

14. Notebook asociado

P95_causalidad.ipynb

Qué implementa: la escalera de la causalidad con sus tres operaciones, una paradoja de Simpson completa con la inversión de signo, y el ajuste por el confusor con la fórmula de puerta trasera.

Qué NO implementa: no hay descubrimiento de estructura causal, ni criterio de puerta trasera implementado en general, ni contrafácticos —que exigen el modelo estructural completo—.

ai-evolution paper-lab P95 --seed 7

15. Actividades Bloom

Nivel Actividad
Recordar Enumera los tres peldaños de la escalera y su operación.
Explicar Explica qué es un confusor.
Aplicar Ejecuta el notebook y comprueba la inversión de signo.
Analizar Analiza por qué ajustar por la gravedad es correcto solo bajo un supuesto causal concreto.
Evaluar «Con más datos la paradoja de Simpson desaparece». Evalúa la afirmación.
Crear Toma una decisión de tu trabajo justificada por una correlación, dibuja el grafo causal que estás suponiendo sin decirlo y comprueba si el ajuste cambia la conclusión.

16. Autoevaluación

  1. ¿Cuáles son los tres peldaños de la escalera?
  2. ¿Qué diferencia hay entre P(Y|X) y P(Y|do(X))?
  3. ¿Qué es la paradoja de Simpson?
  4. ¿Qué decide cuál lectura es la correcta?
  5. ¿Es seguro ajustar por todas las variables?
  6. ¿Puede el aprendizaje automático subir de peldaño con más datos?
  7. ¿Qué exige el tercer peldaño?

17. Respuestas esperadas

  1. Asociación —P(Y|X), ver—, intervención —P(Y|do(X)), hacer— y contrafáctico —P(Y_x|X',Y'), imaginar lo que habría pasado—.
  2. El primero es la distribución observada de Y entre quienes tienen X. El segundo es lo que ocurriría si se impusiera X, eliminando las causas que normalmente determinan quién lo recibe.
  3. Que una asociación puede invertir su signo al agregar o desagregar por un tercer factor. En la miniatura el tratamiento gana en los dos subgrupos y pierde en el total.
  4. Un supuesto causal declarado fuera de los datos: si la gravedad causa el tratamiento hay que ajustar; si es consecuencia suya, ajustar es el error. Los números son idénticos en ambos casos.
  5. No. Ajustar por un mediador o por un colisionador introduce sesgo. El criterio de puerta trasera dice exactamente qué conjunto ajustar.
  6. No. Es una limitación estructural del primer peldaño. Más datos y más capacidad ajustan mejor la misma distribución observada, que no contiene la respuesta.
  7. El modelo estructural completo: las ecuaciones que generan cada variable, no solo el grafo de quién influye en quién.

18. Fuentes primarias


⬅️ Anterior: P94 Programación probabilística · 📇 Índice · 📝 Evaluación · 🏫 Clase 035 · Programación probabilística y causalidad · ➡️ Siguiente: P96 Filtro de Kalman