🧮 Computational Mathematics

Inicio · Parte 10 — Estadística e inferencia

216 — Estimación MAP

universitario-avanzado clase 16 de 20 4 horas demostración map_estimation

MAP es verosimilitud más prior, y ese prior es exactamente la regularización.

Fórmulas

θ_MAP = argmax [ log L(θ) + log p(θ) ]
prior uniforme ⟹ MAP = MLE
prior gaussiano ⟹ penalización L2;  prior Laplace ⟹ L1

Desarrollo

La estimación MAP añade a la verosimilitud una creencia previa sobre el parámetro y maximiza la posterior. Formalmente es un cambio pequeño —sumar log p(θ) al objetivo— pero cambia el comportamiento del estimador cuando hay pocos datos, que es justo cuando hace falta ayuda.

La equivalencia con la regularización es exacta y merece verse una vez con detalle. Un prior gaussiano centrado en cero aporta un término −λ‖θ‖² al objetivo, que es la penalización L2 o weight decay. Un prior de Laplace aporta −λ‖θ‖₁, que es Lasso y produce soluciones dispersas. Regularizar no es un truco de ingeniería: es declarar una creencia previa.

El comportamiento asintótico es el esperado: al crecer n, la verosimilitud domina y el MAP converge al MLE. El prior importa cuando la evidencia es escasa, se diluye cuando abunda, y desaparece por completo si es uniforme. Esa es la respuesta a la objeción de que el prior contamina el resultado.

La diferencia con la inferencia bayesiana completa de la clase siguiente es que MAP se queda con un punto: el máximo de la posterior. Es rápido y encaja con cualquier optimizador, pero descarta toda la información sobre incertidumbre. Y en dimensión alta el máximo puede estar en una región de probabilidad casi nula, lo que hace de MAP un resumen engañoso de la posterior.

Ejemplo trabajado

Prior sesgado hacia 0,8 frente a un parámetro real de 0,4.

parámetro real = 0,40      prior = Beta(8,2), centrado en 0,8

     n     MLE      MAP     distancia MAP al real
     5   0,6000   0,7692        0,3692
    20   0,4500   0,5357        0,1357
   100   0,4100   0,4340        0,0340
  1000   0,4030   0,4055        0,0055

Con n = 5 el prior domina y empeora la estimación.
Con n = 1000 el prior es irrelevante: MAP → MLE.

Equivalencias:
  prior uniforme   →  MAP = MLE
  prior gaussiano  →  regularización L2
  prior Laplace    →  regularización L1

Qué calcula el laboratorio

MAP: verosimilitud más prior, y su límite con muchos datos.

python classes/part-10-estadistica-e-inferencia/216-estimacion-map/lab.py
compmath run 216

Salidas del laboratorio (6)

Muestra de la ejecución real

{
  "parametro_real": 0.4,
  "prior": "Beta(8,2) — sesgado hacia 0.8",
  "informe": [
    {
      "n": 5,
      "MLE": 0.6,
      "MAP": 0.769231,
      "distancia_al_real": 0.369231
    },
    {
      "n": 20,
      "MLE": 0.45,
      "MAP": 0.571429,
      "distancia_al_real": 0.171429
    },
    {
      "n": 100,
      "MLE": 0.46,
      "MAP": 0.490741,
      "distancia_al_real": 0.090741
    },
    {
      "n": 500,
      "MLE": 0.424,
      "MAP": 0.431102,
      "distancia_al_real": 0.031102
    }
  ],
  "MAP_converge_al_MLE": true,
  "el_prior_domina_con_pocos_datos": true,
  "MAP_con_prior_uniforme_es_MLE": true
}

Errores comunes

Dónde se usa

Weight decay y Lasso, suavizado de Laplace en modelos de lenguaje, estimación con datos escasos y calibración con conocimiento del dominio.

Idea rectora de la parte

El p-value es P(datos tan extremos | H0), nunca P(H0 | datos).

Error a evitar

p-hacking por comparaciones múltiples sin corrección.

Conexión con IA

Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.

Bibliografía de la clase

Archivos de la clase