🧮 Computational Mathematics

Inicio · Parte 17 — Frontera matemática para IA e investigación

347 — Wasserstein distance

frontera-investigacion clase 7 de 20 4 horas demostración wasserstein_distance

Wasserstein mide la separación real cuando la KL se vuelve infinita o constante.

Fórmulas

W₁(P,Q) = ínfimo del coste de transporte con coste |x−y|
en 1D: W₁ = ∫|F_P(x) − F_Q(x)| dx
es una métrica verdadera

Desarrollo

La distancia de Wasserstein es el coste del transporte óptimo, y a diferencia de la KL o la JS es una métrica en sentido estricto: simétrica, no negativa, nula solo si las distribuciones coinciden, y cumple la desigualdad triangular.

Su ventaja decisiva aparece cuando los soportes no se solapan. Dos distribuciones disjuntas tienen KL infinita y JS constante en su valor máximo; en ambos casos el gradiente es inútil para acercarlas. Wasserstein, en cambio, mide cuán lejos están y su gradiente apunta en la dirección correcta. Esa es exactamente la motivación de WGAN.

Su interpretación es intuitiva y le da el nombre informal de distancia del transportista: si cada distribución es un montón de tierra, la distancia es el trabajo mínimo necesario para transformar uno en el otro. En una dimensión tiene una forma especialmente simple: el área entre las funciones de distribución acumuladas.

El resultado numérico es limpio: para dos normales con la misma varianza, W₁ es aproximadamente la diferencia de medias, y lo sigue siendo cuando están muy separadas. Con medias 0 y 5, W₁ ≈ 5,04 mientras que la KL empírica se vuelve inestable. La distancia escala con la separación real, que es lo que se quiere de una medida geométrica.

Ejemplo trabajado

Wasserstein-1 entre normales cercanas y lejanas.

2 000 muestras de cada distribución

W₁(N(0,1) , N(0,5;1)) = 0,535306
  diferencia de medias teórica: 0,5             ✓

W₁(N(0,1) , N(5;1))   = 5,042759
  diferencia teórica: 5,0                       ✓

KL empírica en el caso cercano: 0,144536
KL empírica en el caso lejano: inestable o infinita

Wasserstein escala linealmente con la separación.
La KL no distingue "lejos" de "muy lejos": ambas
son igual de infinitas.

Qué calcula el laboratorio

Wasserstein-1 en 1D: comparar distribuciones sin soporte común.

python classes/part-17-frontera-matematica-para-ia-e-investigacion/347-wasserstein-distance/lab.py
compmath run 347

Salidas del laboratorio (11)

Muestra de la ejecución real

{
  "muestras": 2000,
  "W1(N(0,1), N(0.5,1))": 0.535306,
  "diferencia_de_medias_teorica": 0.5,
  "W1(N(0,1), N(5,1))": 5.042759,
  "diferencia_teorica_lejana": 5.0,
  "KL_empirica_cercana": 0.144536
}

Errores comunes

Dónde se usa

WGAN, evaluación de modelos generativos, adaptación de dominios, análisis de formas y comparación de distribuciones empíricas.

Idea rectora de la parte

HMC usa gradientes para proponer estados lejanos con alta aceptación.

Error a evitar

Reportar resultados de MCMC sin diagnóstico de convergencia.

Conexión con IA

Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.

Bibliografía de la clase

Archivos de la clase