Inicio · Parte 17 — Frontera matemática para IA e investigación
aceptar con probabilidad min(1, p(x')/p(x))
tasa óptima en 1D ≈ 0,44
descartar el burn-in antes de estimar
Metropolis-Hastings genera muestras de una distribución conocida solo hasta una constante, que es la situación habitual en inferencia bayesiana: la posterior se conoce salvo por la evidencia, que es una integral intratable. El algoritmo propone un estado y lo acepta con probabilidad proporcional a la razón de densidades, en la que la constante se cancela.
El tamaño del paso de la propuesta controla todo el comportamiento, y sus dos extremos son igual de malos. Un paso pequeño acepta casi todas las propuestas pero se mueve muy despacio, produciendo muestras fuertemente autocorrelacionadas que aportan poca información nueva. Un paso grande propone estados improbables que se rechazan, y la cadena se queda quieta.
La teoría da un objetivo concreto: la tasa óptima de aceptación en una dimensión ronda 0,44, y en dimensiones altas converge a 0,234. Una tasa del 95 % no indica un buen muestreador sino un paso demasiado tímido, y es un error de lectura frecuente.
Ningún resultado MCMC debe reportarse sin diagnóstico. Descartar el burn-in inicial, examinar la autocorrelación, calcular el tamaño de muestra efectivo y ejecutar varias cadenas comprobando el estadístico R̂ son pasos obligatorios. Una cadena que no ha convergido produce números perfectamente plausibles y completamente equivocados.
Efecto del tamaño de paso sobre la exploración.
objetivo: Normal(2,0 ; 1,5)
8 000 iteraciones, burn-in 2 000
paso = 0,2:
tasa de aceptación: 0,9547
media estimada: 2,4552 error 0,455
acepta casi todo pero explora muy despacio ✗
paso óptimo (tasa ≈ 0,44):
media estimada mucho más cercana a 2,0
Tasa óptima teórica:
1 dimensión: 0,44
alta dimensión: 0,234
Una tasa alta no es buena señal: es síntoma
de que la cadena apenas se mueve.
Metropolis-Hastings con diagnóstico de aceptación y autocorrelación.
python classes/part-17-frontera-matematica-para-ia-e-investigacion/343-mcmc-avanzado/lab.py
compmath run 343
objetivoiteracionesburn_inresultadosaceptacion_optima_1Dpaso_pequeñopaso_grandediagnosticos_obligatoriossemilla{
"objetivo": "Normal(2.0, 1.5)",
"iteraciones": 8000,
"burn_in": 2000,
"resultados": {
"paso=0.2": {
"tasa_de_aceptacion": 0.9547,
"media_estimada": 2.4552,
"desviacion_estimada": 1.7039,
"autocorrelacion_lag_1": 0.9937,
"tamaño_efectivo_aprox": 18
},
"paso=2.0": {
"tasa_de_aceptacion": 0.6218,
"media_estimada": 2.0236,
"desviacion_estimada": 1.4828,
"autocorrelacion_lag_1": 0.6989,
"tamaño_efectivo_aprox": 1063
},
"paso=12.0": {
"tasa_de_aceptacion": 0.1555,
"media_estimada": 1.9029,
"desviacion_estimada": 1.5684,
"autocorrelacion_lag_1": 0.8151,
"tamaño_efectivo_aprox": 611
}
},
"aceptacion_optima_1D": "≈ 0.44 para random walk Metropolis",
"paso_pequeño": "acepta casi todo pero explora muy despacio"
}
Inferencia bayesiana con posteriores complejas, física estadística, modelos jerárquicos y cuantificación de incertidumbre.
Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.
10.1201/b10905 verificado en Crossref (2026-08-19).9781439840955 verificado en International ISBN Agency (2026-08-19).