Inicio · Parte 10 — Estadística e inferencia
L(θ) = Π f(xᵢ | θ)
ℓ(θ) = Σ log f(xᵢ | θ)
para la normal: μ̂ = x̄, σ̂² = Σ(xᵢ − x̄)²/n
La máxima verosimilitud invierte la pregunta habitual. En vez de fijar el parámetro y preguntar qué datos son probables, fija los datos observados y pregunta qué valor del parámetro los habría hecho más probables. Ese valor es el estimador MLE.
Se trabaja siempre con el logaritmo de la verosimilitud, por dos razones. La primera es algebraica: convierte productos en sumas y las derivadas se vuelven manejables. La segunda es numérica y decisiva: multiplicar mil densidades menores que 1 produce subdesbordamiento a cero en punto flotante, mientras que sumar mil logaritmos no tiene ese problema. Es la misma lección de la parte 01.
Para la normal el resultado es especialmente limpio: el MLE de la media es la media muestral, y el de la varianza es la versión que divide entre n, que es sesgada. Eso ya dice algo importante: el MLE no tiene por qué ser insesgado, aunque sí es consistente y asintóticamente eficiente bajo condiciones de regularidad.
El vínculo con el aprendizaje automático es de identidad, no de analogía. Minimizar el error cuadrático medio es maximizar la verosimilitud bajo ruido gaussiano; minimizar la entropía cruzada es maximizar la verosimilitud bajo un modelo categórico. Las funciones de pérdida no se inventan: se derivan del modelo probabilístico que se supone para los datos.
Ajuste normal por máxima verosimilitud sobre 20 observaciones.
n = 20
μ̂ (MLE) = 12,6050 coincide con la media muestral
σ̂ (MLE) = 0,8411 divide entre n, no entre n−1
log-verosimilitud máxima = −24,9182
Barrido en μ manteniendo σ̂:
μ = 11,61 → ℓ = −39,0530
μ = 12,11 → ℓ = −28,4519
μ = 12,61 → ℓ = −24,9182 ← máximo
μ = 13,11 → ℓ = −28,4519
μ = 13,61 → ℓ = −39,0530
La curva es simétrica y su máximo cae en la media muestral.
Su curvatura en el máximo determina la precisión del estimador.
MLE para la normal: la media muestral maximiza la verosimilitud.
python classes/part-10-estadistica-e-inferencia/215-maxima-verosimilitud/lab.py
compmath run 215
nmu_MLEsigma_MLElog_verosimilitud_maximabarrido_en_muel_maximo_esta_en_la_mediasigma_MLE_es_sesgadoconexion_con_ML{
"n": 20,
"mu_MLE": 12.605,
"sigma_MLE": 0.841115,
"log_verosimilitud_maxima": -24.918241,
"barrido_en_mu": {
"11.61": -39.053,
"12.11": -28.4519,
"12.61": -24.9182,
"13.11": -28.4519,
"13.61": -39.053
},
"el_maximo_esta_en_la_media": true
}
Derivación de funciones de pérdida, ajuste de modelos paramétricos, criterios AIC y BIC y entrenamiento de modelos generativos.
Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.
9780387217369 verificado en International ISBN Agency (2026-08-19).