🧮 Computational Mathematics

Inicio · Parte 17 — Frontera matemática para IA e investigación

341 — Gaussian Processes

frontera-investigacion clase 1 de 20 4 horas demostración gaussian_processes

Un proceso gaussiano distribuye sobre funciones, y su incertidumbre crece donde no hay datos.

Fórmulas

f ~ GP(m(x), k(x,x'))
media posterior: K*ᵀ(K + σ²I)⁻¹y
varianza posterior: k** − K*ᵀ(K + σ²I)⁻¹K*

Desarrollo

Un proceso gaussiano cambia el objeto sobre el que se pone la distribución. En vez de definir un modelo paramétrico y distribuir sobre sus parámetros, distribuye directamente sobre funciones: cualquier conjunto finito de evaluaciones sigue una normal multivariante determinada por el kernel.

Su propiedad más valiosa es que la incertidumbre es honesta. Cerca de un punto observado la varianza posterior es casi nula, porque la función tiene que pasar por ahí; lejos de todos los datos, vuelve a la varianza del prior. Ningún modelo paramétrico da eso gratis, y es la razón de que los GP dominen la optimización bayesiana, donde hay que decidir dónde explorar a continuación.

El precio es el coste. Invertir la matriz de covarianza cuesta O(n³) en tiempo y O(n²) en memoria, lo que limita el método a unos miles de puntos sin aproximaciones. Las técnicas de puntos inductores y los GP dispersos existen precisamente para sortear ese muro.

Una advertencia de implementación que no es opcional: la matriz de covarianza es teóricamente definida positiva pero numéricamente casi singular cuando hay puntos próximos. Sin sumar un pequeño jitter a la diagonal, la factorización de Cholesky falla. Es el mismo problema de condicionamiento de la parte 11, y la solución es la misma idea que Ridge: sumar λI.

Ejemplo trabajado

GP con kernel RBF sobre cinco observaciones.

observaciones: 5      kernel: RBF con escala 1,0
ruido: 0,0001

predicción en x = −1,0:
  media = −0,841409
  desviación = 0,009999
  valor real de sin(−1) = −0,841471                  ✓

En un punto observado la varianza es mínima          ✓
Lejos de los datos la varianza vuelve al prior: 1,0

Esa es la propiedad clave: el modelo sabe
dónde no sabe.

Coste: invertir la covarianza es O(n³).
Con n = 10 000 ya es inviable sin aproximar.

Qué calcula el laboratorio

GP: distribución sobre funciones, con media y varianza posterior.

python classes/part-17-frontera-matematica-para-ia-e-investigacion/341-gaussian-processes/lab.py
compmath run 341

Salidas del laboratorio (9)

Muestra de la ejecución real

{
  "observaciones": 5,
  "kernel": "RBF con escala 1.0",
  "ruido": 0.0001,
  "predicciones": {
    "x=-1.0": {
      "media": -0.841409,
      "desviacion": 0.009999,
      "valor_real_sin(x)": -0.841471
    },
    "x=0.5": {
      "media": 0.503349,
      "desviacion": 0.228552,
      "valor_real_sin(x)": 0.479426
    },
    "x=2.0": {
      "media": 0.81665,
      "desviacion": 0.290259,
      "valor_real_sin(x)": 0.909297
    },
    "x=6.0": {
      "media": -0.002208,
      "desviacion": 0.99993,
      "valor_real_sin(x)": -0.279415
    }
  },
  "en_un_punto_observado_la_varianza_es_minima": true,
  "lejos_de_los_datos_vuelve_al_prior": 1.0
}

Errores comunes

Dónde se usa

Optimización bayesiana de hiperparámetros, regresión con incertidumbre calibrada, geoestadística, diseño experimental y modelos sustitutos de simuladores costosos.

Idea rectora de la parte

Un proceso gaussiano define una distribución sobre funciones, no sobre parámetros.

Error a evitar

Reportar resultados de MCMC sin diagnóstico de convergencia.

Conexión con IA

Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.

Bibliografía de la clase

Archivos de la clase