Inicio · Parte 17 — Frontera matemática para IA e investigación
W₁(P,Q) = ínfimo del coste de transporte con coste |x−y|
en 1D: W₁ = ∫|F_P(x) − F_Q(x)| dx
es una métrica verdadera
La distancia de Wasserstein es el coste del transporte óptimo, y a diferencia de la KL o la JS es una métrica en sentido estricto: simétrica, no negativa, nula solo si las distribuciones coinciden, y cumple la desigualdad triangular.
Su ventaja decisiva aparece cuando los soportes no se solapan. Dos distribuciones disjuntas tienen KL infinita y JS constante en su valor máximo; en ambos casos el gradiente es inútil para acercarlas. Wasserstein, en cambio, mide cuán lejos están y su gradiente apunta en la dirección correcta. Esa es exactamente la motivación de WGAN.
Su interpretación es intuitiva y le da el nombre informal de distancia del transportista: si cada distribución es un montón de tierra, la distancia es el trabajo mínimo necesario para transformar uno en el otro. En una dimensión tiene una forma especialmente simple: el área entre las funciones de distribución acumuladas.
El resultado numérico es limpio: para dos normales con la misma varianza, W₁ es aproximadamente la diferencia de medias, y lo sigue siendo cuando están muy separadas. Con medias 0 y 5, W₁ ≈ 5,04 mientras que la KL empírica se vuelve inestable. La distancia escala con la separación real, que es lo que se quiere de una medida geométrica.
Wasserstein-1 entre normales cercanas y lejanas.
2 000 muestras de cada distribución
W₁(N(0,1) , N(0,5;1)) = 0,535306
diferencia de medias teórica: 0,5 ✓
W₁(N(0,1) , N(5;1)) = 5,042759
diferencia teórica: 5,0 ✓
KL empírica en el caso cercano: 0,144536
KL empírica en el caso lejano: inestable o infinita
Wasserstein escala linealmente con la separación.
La KL no distingue "lejos" de "muy lejos": ambas
son igual de infinitas.
Wasserstein-1 en 1D: comparar distribuciones sin soporte común.
python classes/part-17-frontera-matematica-para-ia-e-investigacion/347-wasserstein-distance/lab.py
compmath run 347
muestrasW1(N(0,1), N(0.5,1))diferencia_de_medias_teoricaW1(N(0,1), N(5,1))diferencia_teorica_lejanaKL_empirica_cercanaKL_empirica_lejana_(soportes_casi_disjuntos)W1_crece_de_forma_proporcionalKL_no_informa_cuando_no_hay_solapepor_que_importa_en_GANformula_1D{
"muestras": 2000,
"W1(N(0,1), N(0.5,1))": 0.535306,
"diferencia_de_medias_teorica": 0.5,
"W1(N(0,1), N(5,1))": 5.042759,
"diferencia_teorica_lejana": 5.0,
"KL_empirica_cercana": 0.144536
}
WGAN, evaluación de modelos generativos, adaptación de dominios, análisis de formas y comparación de distribuciones empíricas.
Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.
10.48550/arxiv.1701.07875 verificado en DataCite (2026-08-19).9783540710509 verificado en International ISBN Agency (2026-08-19).