Inicio · Parte 10 — Estadística e inferencia
θ_MAP = argmax [ log L(θ) + log p(θ) ]
prior uniforme ⟹ MAP = MLE
prior gaussiano ⟹ penalización L2; prior Laplace ⟹ L1
La estimación MAP añade a la verosimilitud una creencia previa sobre el parámetro y maximiza la posterior. Formalmente es un cambio pequeño —sumar log p(θ) al objetivo— pero cambia el comportamiento del estimador cuando hay pocos datos, que es justo cuando hace falta ayuda.
La equivalencia con la regularización es exacta y merece verse una vez con detalle. Un prior gaussiano centrado en cero aporta un término −λ‖θ‖² al objetivo, que es la penalización L2 o weight decay. Un prior de Laplace aporta −λ‖θ‖₁, que es Lasso y produce soluciones dispersas. Regularizar no es un truco de ingeniería: es declarar una creencia previa.
El comportamiento asintótico es el esperado: al crecer n, la verosimilitud domina y el MAP converge al MLE. El prior importa cuando la evidencia es escasa, se diluye cuando abunda, y desaparece por completo si es uniforme. Esa es la respuesta a la objeción de que el prior contamina el resultado.
La diferencia con la inferencia bayesiana completa de la clase siguiente es que MAP se queda con un punto: el máximo de la posterior. Es rápido y encaja con cualquier optimizador, pero descarta toda la información sobre incertidumbre. Y en dimensión alta el máximo puede estar en una región de probabilidad casi nula, lo que hace de MAP un resumen engañoso de la posterior.
Prior sesgado hacia 0,8 frente a un parámetro real de 0,4.
parámetro real = 0,40 prior = Beta(8,2), centrado en 0,8
n MLE MAP distancia MAP al real
5 0,6000 0,7692 0,3692
20 0,4500 0,5357 0,1357
100 0,4100 0,4340 0,0340
1000 0,4030 0,4055 0,0055
Con n = 5 el prior domina y empeora la estimación.
Con n = 1000 el prior es irrelevante: MAP → MLE.
Equivalencias:
prior uniforme → MAP = MLE
prior gaussiano → regularización L2
prior Laplace → regularización L1
MAP: verosimilitud más prior, y su límite con muchos datos.
python classes/part-10-estadistica-e-inferencia/216-estimacion-map/lab.py
compmath run 216
parametro_realpriorinformeMAP_converge_al_MLEel_prior_domina_con_pocos_datosMAP_con_prior_uniforme_es_MLE{
"parametro_real": 0.4,
"prior": "Beta(8,2) — sesgado hacia 0.8",
"informe": [
{
"n": 5,
"MLE": 0.6,
"MAP": 0.769231,
"distancia_al_real": 0.369231
},
{
"n": 20,
"MLE": 0.45,
"MAP": 0.571429,
"distancia_al_real": 0.171429
},
{
"n": 100,
"MLE": 0.46,
"MAP": 0.490741,
"distancia_al_real": 0.090741
},
{
"n": 500,
"MLE": 0.424,
"MAP": 0.431102,
"distancia_al_real": 0.031102
}
],
"MAP_converge_al_MLE": true,
"el_prior_domina_con_pocos_datos": true,
"MAP_con_prior_uniforme_es_MLE": true
}
Weight decay y Lasso, suavizado de Laplace en modelos de lenguaje, estimación con datos escasos y calibración con conocimiento del dominio.
Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.