🧮 Computational Mathematics

Inicio · Parte 10 — Estadística e inferencia

215 — Máxima verosimilitud

universitario-avanzado clase 15 de 20 4 horas demostración maximum_likelihood

La máxima verosimilitud elige el parámetro que hace más probables los datos observados.

Fórmulas

L(θ) = Π f(xᵢ | θ)
ℓ(θ) = Σ log f(xᵢ | θ)
para la normal: μ̂ = x̄,  σ̂² = Σ(xᵢ − x̄)²/n

Desarrollo

La máxima verosimilitud invierte la pregunta habitual. En vez de fijar el parámetro y preguntar qué datos son probables, fija los datos observados y pregunta qué valor del parámetro los habría hecho más probables. Ese valor es el estimador MLE.

Se trabaja siempre con el logaritmo de la verosimilitud, por dos razones. La primera es algebraica: convierte productos en sumas y las derivadas se vuelven manejables. La segunda es numérica y decisiva: multiplicar mil densidades menores que 1 produce subdesbordamiento a cero en punto flotante, mientras que sumar mil logaritmos no tiene ese problema. Es la misma lección de la parte 01.

Para la normal el resultado es especialmente limpio: el MLE de la media es la media muestral, y el de la varianza es la versión que divide entre n, que es sesgada. Eso ya dice algo importante: el MLE no tiene por qué ser insesgado, aunque sí es consistente y asintóticamente eficiente bajo condiciones de regularidad.

El vínculo con el aprendizaje automático es de identidad, no de analogía. Minimizar el error cuadrático medio es maximizar la verosimilitud bajo ruido gaussiano; minimizar la entropía cruzada es maximizar la verosimilitud bajo un modelo categórico. Las funciones de pérdida no se inventan: se derivan del modelo probabilístico que se supone para los datos.

Ejemplo trabajado

Ajuste normal por máxima verosimilitud sobre 20 observaciones.

n = 20

μ̂ (MLE) = 12,6050        coincide con la media muestral
σ̂ (MLE) =  0,8411        divide entre n, no entre n−1

log-verosimilitud máxima = −24,9182

Barrido en μ manteniendo σ̂:
  μ = 11,61   →  ℓ = −39,0530
  μ = 12,11   →  ℓ = −28,4519
  μ = 12,61   →  ℓ = −24,9182     ← máximo
  μ = 13,11   →  ℓ = −28,4519
  μ = 13,61   →  ℓ = −39,0530

La curva es simétrica y su máximo cae en la media muestral.
Su curvatura en el máximo determina la precisión del estimador.

Qué calcula el laboratorio

MLE para la normal: la media muestral maximiza la verosimilitud.

python classes/part-10-estadistica-e-inferencia/215-maxima-verosimilitud/lab.py
compmath run 215

Salidas del laboratorio (8)

Muestra de la ejecución real

{
  "n": 20,
  "mu_MLE": 12.605,
  "sigma_MLE": 0.841115,
  "log_verosimilitud_maxima": -24.918241,
  "barrido_en_mu": {
    "11.61": -39.053,
    "12.11": -28.4519,
    "12.61": -24.9182,
    "13.11": -28.4519,
    "13.61": -39.053
  },
  "el_maximo_esta_en_la_media": true
}

Errores comunes

Dónde se usa

Derivación de funciones de pérdida, ajuste de modelos paramétricos, criterios AIC y BIC y entrenamiento de modelos generativos.

Idea rectora de la parte

El bootstrap estima la variabilidad sin suponer la distribución poblacional.

Error a evitar

Evaluar sobre datos que participaron en la selección del modelo.

Conexión con IA

Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.

Bibliografía de la clase

Archivos de la clase