Inicio · Parte 17 — Frontera matemática para IA e investigación
I(θ) = E[(∂ log p/∂θ)²]
KL(p_θ ‖ p_{θ+ε}) ≈ ½·I(θ)·ε²
Cramér-Rao: Var(θ̂) ≥ 1/(n·I(θ))
La geometría de la información trata el conjunto de distribuciones de una familia paramétrica como una variedad, donde cada punto es una distribución. La pregunta natural es qué métrica usar en ese espacio, y la respuesta es la información de Fisher.
Su significado es que la KL, localmente, se comporta como una forma cuadrática cuya matriz es Fisher. La comprobación numérica lo confirma: para un desplazamiento minúsculo ε, la KL entre p y p+ε coincide con ½·I(p)·ε² con razón 1,0. Esa identidad es lo que convierte a Fisher en la métrica natural del espacio de parámetros, no una elección arbitraria.
De ahí salen dos resultados centrales. La cota de Cramér-Rao establece un límite inferior a la varianza de cualquier estimador insesgado: donde la información es alta, se puede estimar con precisión; donde es baja, ningún estimador puede ser preciso. En la Bernoulli, la información es máxima en los extremos —11,1 para p = 0,1— y mínima en 0,5, lo que dice que es más fácil estimar un parámetro cercano a los extremos.
El gradiente natural preacondiciona el gradiente con la inversa de Fisher, con lo que la dirección de descenso deja de depender de cómo se hayan parametrizado los pesos. Es elegante y costoso —requiere invertir Fisher— y de ahí vienen aproximaciones prácticas como K-FAC. La restricción de KL de PPO en la clase 339 es una manifestación de la misma idea: medir el cambio de la política en el espacio de distribuciones, no en el de parámetros.
Información de Fisher y su relación con la KL.
Bernoulli:
p = 0,1 → I = 11,111111
p = 0,5 → I = 4,000000
p = 0,9 → I = 11,111111
máxima en los extremos ✓
Normal:
σ = 0,5 → I = 4,00
σ = 1,0 → I = 1,00
σ = 2,0 → I = 0,25
KL localmente es una métrica (p = 0,1):
KL(p ‖ p+ε) = 5,5523e-08
½·I(p)·ε² = 5,5556e-08
razón ≈ 1,0 ✓
Cramér-Rao: Var(θ̂) ≥ 1/(n·I(θ))
Gradiente natural: ∇̃ = I(θ)⁻¹∇
Información de Fisher: la métrica natural del espacio de parámetros.
python classes/part-17-frontera-matematica-para-ia-e-investigacion/350-information-geometry/lab.py
compmath run 350
informacion_de_Fisher_Bernoullila_informacion_es_maxima_en_los_extremosinformacion_de_Fisher_NormalKL_localmente_es_una_metricacota_de_Cramer_Raogradiente_naturalconexion_con_ML{
"informacion_de_Fisher_Bernoulli": {
"p=0.1": 11.111111,
"p=0.5": 4.0,
"p=0.9": 11.111111
},
"la_informacion_es_maxima_en_los_extremos": true,
"informacion_de_Fisher_Normal": {
"σ=0.5": 4.0,
"σ=1.0": 1.0,
"σ=2.0": 0.25
},
"KL_localmente_es_una_metrica": {
"p=0.1": {
"KL(p ‖ p+ε)": 5.5523e-08,
"½·I(p)·ε²": 5.5556e-08,
"razon": 0.999408
},
"p=0.5": {
"KL(p ‖ p+ε)": 2e-08,
"½·I(p)·ε²": 2e-08,
"razon": 1.0
},
"p=0.9": {
"KL(p ‖ p+ε)": 5.5589e-08,
"½·I(p)·ε²": 5.5556e-08,
"razon": 1.000593
}
},
"cota_de_Cramer_Rao": "Var(estimador insesgado) ≥ 1/(n·I(θ))",
"gradiente_natural": "∇̃ = I(θ)⁻¹∇: invariante a la reparametrización"
}
Gradiente natural y K-FAC, PPO, diseño experimental óptimo, cotas de precisión de estimadores y análisis de identificabilidad.
Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.
9784431559788 verificado en International ISBN Agency (2026-08-19).10.48550/arxiv.1412.1193 verificado en DataCite (2026-08-19).