🧮 Computational Mathematics

Inicio · Parte 17 — Frontera matemática para IA e investigación

343 — MCMC avanzado

frontera-investigacion clase 3 de 20 4 horas demostración advanced_mcmc

Aceptar el 95 % de las propuestas no es buena señal: significa que no se explora.

Fórmulas

aceptar con probabilidad min(1, p(x')/p(x))
tasa óptima en 1D ≈ 0,44
descartar el burn-in antes de estimar

Desarrollo

Metropolis-Hastings genera muestras de una distribución conocida solo hasta una constante, que es la situación habitual en inferencia bayesiana: la posterior se conoce salvo por la evidencia, que es una integral intratable. El algoritmo propone un estado y lo acepta con probabilidad proporcional a la razón de densidades, en la que la constante se cancela.

El tamaño del paso de la propuesta controla todo el comportamiento, y sus dos extremos son igual de malos. Un paso pequeño acepta casi todas las propuestas pero se mueve muy despacio, produciendo muestras fuertemente autocorrelacionadas que aportan poca información nueva. Un paso grande propone estados improbables que se rechazan, y la cadena se queda quieta.

La teoría da un objetivo concreto: la tasa óptima de aceptación en una dimensión ronda 0,44, y en dimensiones altas converge a 0,234. Una tasa del 95 % no indica un buen muestreador sino un paso demasiado tímido, y es un error de lectura frecuente.

Ningún resultado MCMC debe reportarse sin diagnóstico. Descartar el burn-in inicial, examinar la autocorrelación, calcular el tamaño de muestra efectivo y ejecutar varias cadenas comprobando el estadístico R̂ son pasos obligatorios. Una cadena que no ha convergido produce números perfectamente plausibles y completamente equivocados.

Ejemplo trabajado

Efecto del tamaño de paso sobre la exploración.

objetivo: Normal(2,0 ; 1,5)
8 000 iteraciones, burn-in 2 000

paso = 0,2:
  tasa de aceptación: 0,9547
  media estimada: 2,4552          error 0,455
  acepta casi todo pero explora muy despacio         ✗

paso óptimo (tasa ≈ 0,44):
  media estimada mucho más cercana a 2,0

Tasa óptima teórica:
  1 dimensión:     0,44
  alta dimensión:  0,234

Una tasa alta no es buena señal: es síntoma
de que la cadena apenas se mueve.

Qué calcula el laboratorio

Metropolis-Hastings con diagnóstico de aceptación y autocorrelación.

python classes/part-17-frontera-matematica-para-ia-e-investigacion/343-mcmc-avanzado/lab.py
compmath run 343

Salidas del laboratorio (9)

Muestra de la ejecución real

{
  "objetivo": "Normal(2.0, 1.5)",
  "iteraciones": 8000,
  "burn_in": 2000,
  "resultados": {
    "paso=0.2": {
      "tasa_de_aceptacion": 0.9547,
      "media_estimada": 2.4552,
      "desviacion_estimada": 1.7039,
      "autocorrelacion_lag_1": 0.9937,
      "tamaño_efectivo_aprox": 18
    },
    "paso=2.0": {
      "tasa_de_aceptacion": 0.6218,
      "media_estimada": 2.0236,
      "desviacion_estimada": 1.4828,
      "autocorrelacion_lag_1": 0.6989,
      "tamaño_efectivo_aprox": 1063
    },
    "paso=12.0": {
      "tasa_de_aceptacion": 0.1555,
      "media_estimada": 1.9029,
      "desviacion_estimada": 1.5684,
      "autocorrelacion_lag_1": 0.8151,
      "tamaño_efectivo_aprox": 611
    }
  },
  "aceptacion_optima_1D": "≈ 0.44 para random walk Metropolis",
  "paso_pequeño": "acepta casi todo pero explora muy despacio"
}

Errores comunes

Dónde se usa

Inferencia bayesiana con posteriores complejas, física estadística, modelos jerárquicos y cuantificación de incertidumbre.

Idea rectora de la parte

La distancia de Wasserstein compara distribuciones sin exigir soporte común.

Error a evitar

Interpretar una cota teórica como predicción del error real.

Conexión con IA

Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.

Bibliografía de la clase

Archivos de la clase