🧮 Computational Mathematics

Inicio · Parte 17 — Frontera matemática para IA e investigación

350 — Information geometry

frontera-investigacion clase 10 de 20 4 horas demostración information_geometry

La información de Fisher es la curvatura de la KL, y de ella salen Cramér-Rao y el gradiente natural.

Fórmulas

I(θ) = E[(∂ log p/∂θ)²]
KL(p_θ ‖ p_{θ+ε}) ≈ ½·I(θ)·ε²
Cramér-Rao: Var(θ̂) ≥ 1/(n·I(θ))

Desarrollo

La geometría de la información trata el conjunto de distribuciones de una familia paramétrica como una variedad, donde cada punto es una distribución. La pregunta natural es qué métrica usar en ese espacio, y la respuesta es la información de Fisher.

Su significado es que la KL, localmente, se comporta como una forma cuadrática cuya matriz es Fisher. La comprobación numérica lo confirma: para un desplazamiento minúsculo ε, la KL entre p y p+ε coincide con ½·I(p)·ε² con razón 1,0. Esa identidad es lo que convierte a Fisher en la métrica natural del espacio de parámetros, no una elección arbitraria.

De ahí salen dos resultados centrales. La cota de Cramér-Rao establece un límite inferior a la varianza de cualquier estimador insesgado: donde la información es alta, se puede estimar con precisión; donde es baja, ningún estimador puede ser preciso. En la Bernoulli, la información es máxima en los extremos —11,1 para p = 0,1— y mínima en 0,5, lo que dice que es más fácil estimar un parámetro cercano a los extremos.

El gradiente natural preacondiciona el gradiente con la inversa de Fisher, con lo que la dirección de descenso deja de depender de cómo se hayan parametrizado los pesos. Es elegante y costoso —requiere invertir Fisher— y de ahí vienen aproximaciones prácticas como K-FAC. La restricción de KL de PPO en la clase 339 es una manifestación de la misma idea: medir el cambio de la política en el espacio de distribuciones, no en el de parámetros.

Ejemplo trabajado

Información de Fisher y su relación con la KL.

Bernoulli:
  p = 0,1  →  I = 11,111111
  p = 0,5  →  I =  4,000000
  p = 0,9  →  I = 11,111111
máxima en los extremos                               ✓

Normal:
  σ = 0,5  →  I = 4,00
  σ = 1,0  →  I = 1,00
  σ = 2,0  →  I = 0,25

KL localmente es una métrica (p = 0,1):
  KL(p ‖ p+ε)  = 5,5523e-08
  ½·I(p)·ε²    = 5,5556e-08
  razón ≈ 1,0                                        ✓

Cramér-Rao: Var(θ̂) ≥ 1/(n·I(θ))
Gradiente natural: ∇̃ = I(θ)⁻¹∇

Qué calcula el laboratorio

Información de Fisher: la métrica natural del espacio de parámetros.

python classes/part-17-frontera-matematica-para-ia-e-investigacion/350-information-geometry/lab.py
compmath run 350

Salidas del laboratorio (7)

Muestra de la ejecución real

{
  "informacion_de_Fisher_Bernoulli": {
    "p=0.1": 11.111111,
    "p=0.5": 4.0,
    "p=0.9": 11.111111
  },
  "la_informacion_es_maxima_en_los_extremos": true,
  "informacion_de_Fisher_Normal": {
    "σ=0.5": 4.0,
    "σ=1.0": 1.0,
    "σ=2.0": 0.25
  },
  "KL_localmente_es_una_metrica": {
    "p=0.1": {
      "KL(p ‖ p+ε)": 5.5523e-08,
      "½·I(p)·ε²": 5.5556e-08,
      "razon": 0.999408
    },
    "p=0.5": {
      "KL(p ‖ p+ε)": 2e-08,
      "½·I(p)·ε²": 2e-08,
      "razon": 1.0
    },
    "p=0.9": {
      "KL(p ‖ p+ε)": 5.5589e-08,
      "½·I(p)·ε²": 5.5556e-08,
      "razon": 1.000593
    }
  },
  "cota_de_Cramer_Rao": "Var(estimador insesgado) ≥ 1/(n·I(θ))",
  "gradiente_natural": "∇̃ = I(θ)⁻¹∇: invariante a la reparametrización"
}

Errores comunes

Dónde se usa

Gradiente natural y K-FAC, PPO, diseño experimental óptimo, cotas de precisión de estimadores y análisis de identificabilidad.

Idea rectora de la parte

Las cotas PAC acotan el error esperado, no garantizan el error observado.

Error a evitar

Reportar resultados de MCMC sin diagnóstico de convergencia.

Conexión con IA

Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.

Bibliografía de la clase

Archivos de la clase