Inicio · Parte 17 — Frontera matemática para IA e investigación
f ~ GP(m(x), k(x,x'))
media posterior: K*ᵀ(K + σ²I)⁻¹y
varianza posterior: k** − K*ᵀ(K + σ²I)⁻¹K*
Un proceso gaussiano cambia el objeto sobre el que se pone la distribución. En vez de definir un modelo paramétrico y distribuir sobre sus parámetros, distribuye directamente sobre funciones: cualquier conjunto finito de evaluaciones sigue una normal multivariante determinada por el kernel.
Su propiedad más valiosa es que la incertidumbre es honesta. Cerca de un punto observado la varianza posterior es casi nula, porque la función tiene que pasar por ahí; lejos de todos los datos, vuelve a la varianza del prior. Ningún modelo paramétrico da eso gratis, y es la razón de que los GP dominen la optimización bayesiana, donde hay que decidir dónde explorar a continuación.
El precio es el coste. Invertir la matriz de covarianza cuesta O(n³) en tiempo y O(n²) en memoria, lo que limita el método a unos miles de puntos sin aproximaciones. Las técnicas de puntos inductores y los GP dispersos existen precisamente para sortear ese muro.
Una advertencia de implementación que no es opcional: la matriz de covarianza es teóricamente definida positiva pero numéricamente casi singular cuando hay puntos próximos. Sin sumar un pequeño jitter a la diagonal, la factorización de Cholesky falla. Es el mismo problema de condicionamiento de la parte 11, y la solución es la misma idea que Ridge: sumar λI.
GP con kernel RBF sobre cinco observaciones.
observaciones: 5 kernel: RBF con escala 1,0
ruido: 0,0001
predicción en x = −1,0:
media = −0,841409
desviación = 0,009999
valor real de sin(−1) = −0,841471 ✓
En un punto observado la varianza es mínima ✓
Lejos de los datos la varianza vuelve al prior: 1,0
Esa es la propiedad clave: el modelo sabe
dónde no sabe.
Coste: invertir la covarianza es O(n³).
Con n = 10 000 ya es inviable sin aproximar.
GP: distribución sobre funciones, con media y varianza posterior.
python classes/part-17-frontera-matematica-para-ia-e-investigacion/341-gaussian-processes/lab.py
compmath run 341
observacioneskernelruidoprediccionesen_un_punto_observado_la_varianza_es_minimalejos_de_los_datos_vuelve_al_priorcostepor_que_jitterreferencia{
"observaciones": 5,
"kernel": "RBF con escala 1.0",
"ruido": 0.0001,
"predicciones": {
"x=-1.0": {
"media": -0.841409,
"desviacion": 0.009999,
"valor_real_sin(x)": -0.841471
},
"x=0.5": {
"media": 0.503349,
"desviacion": 0.228552,
"valor_real_sin(x)": 0.479426
},
"x=2.0": {
"media": 0.81665,
"desviacion": 0.290259,
"valor_real_sin(x)": 0.909297
},
"x=6.0": {
"media": -0.002208,
"desviacion": 0.99993,
"valor_real_sin(x)": -0.279415
}
},
"en_un_punto_observado_la_varianza_es_minima": true,
"lejos_de_los_datos_vuelve_al_prior": 1.0
}
Optimización bayesiana de hiperparámetros, regresión con incertidumbre calibrada, geoestadística, diseño experimental y modelos sustitutos de simuladores costosos.
Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.
9781423769903 verificado en International ISBN Agency (2026-08-19).10.48550/arxiv.1206.2944 verificado en DataCite (2026-08-19).