🧮 Computational Mathematics

Inicio · Parte 17 — Frontera matemática para IA e investigación

342 — Kernel methods avanzados

frontera-investigacion clase 2 de 20 4 horas demostración advanced_kernels

Una función es kernel válido si y solo si su matriz de Gram es siempre semidefinida positiva.

Fórmulas

K(a,b) = φ(a)ᵀφ(b) para alguna φ
Mercer: matriz de Gram semidefinida positiva
suma y producto de kernels son kernels

Desarrollo

Un kernel codifica una noción de similitud, y elegirlo es elegir qué se considera parecido. Cada familia impone supuestos distintos sobre las funciones que el modelo puede representar, y esos supuestos son la parte del modelado que realmente importa.

El RBF o gaussiano supone funciones infinitamente suaves y decae con la distancia; es el punto de partida razonable. El polinómico captura interacciones de grado fijo. La familia Matérn es más flexible: su parámetro controla la suavidad, y Matérn 3/2 o 5/2 suelen ajustarse mejor a datos reales que el RBF, que a menudo es demasiado suave.

La condición de Mercer caracteriza qué funciones son kernels legítimos: aquellas cuya matriz de Gram es semidefinida positiva para cualquier conjunto de puntos. Esa condición garantiza que existe un espacio de características —posiblemente de dimensión infinita— donde el kernel es el producto escalar, y es lo que hace válido el truco de la clase 290.

Las reglas de composición permiten construir kernels a medida sin verificar Mercer cada vez: sumas, productos y escalados de kernels válidos siguen siendo válidos. Con eso se combinan estructuras —periodicidad más tendencia más ruido— de forma modular, que es como se modelan series temporales complejas con GP.

Ejemplo trabajado

Cuatro kernels y la verificación de Mercer.

valores sobre un mismo par de puntos:
  RBF                  0,32465247
  polinómico grado 3  42,87500000
  Matérn 3/2           0,26770000

matriz de Gram del RBF (4 puntos):
  [1,000000  0,882497  0,606531  0,324652]
  [0,882497  1,000000  0,882497  0,606531]
  [ ...                                  ]

autovalores:
  [3,11850065 ; 0,78879628 ; 0,08864872 ; 0,00405435]

todos ≥ 0  →  semidefinida positiva                  ✓
cumple Mercer                                        ✓

El menor autovalor es 0,004: casi singular.
Sin jitter, Cholesky fallaría.

Qué calcula el laboratorio

Familias de kernels y la condición de Mercer.

python classes/part-17-frontera-matematica-para-ia-e-investigacion/342-kernel-methods-avanzados/lab.py
compmath run 342

Salidas del laboratorio (8)

Muestra de la ejecución real

{
  "kernels": {
    "RBF": 0.32465247,
    "polinomico_grado_3": 42.875,
    "matern_3/2": 0.26775661,
    "periodico": 0.36787944
  },
  "matriz_de_Gram_RBF": [
    [
      1.0,
      0.882497,
      0.606531,
      0.324652
    ],
    [
      0.882497,
      1.0,
      0.882497,
      0.606531
    ],
    [
      0.606531,
      0.882497,
      1.0,
      0.882497
    ],
    [
      0.324652,
      0.606531,
      0.882497,
      1.0
    ]
  ],
  "autovalores_de_Gram": [
    3.11850065,
    0.78879628,
    0.08864872,
    0.00405435
  ],
  "es_semidefinida_positiva": true,
  "condicion_de_Mercer": "toda matriz de Gram debe ser semidefinida positiva",
  "suma_de_kernels_es_kernel": true
}

Errores comunes

Dónde se usa

Procesos gaussianos, SVM no lineales, PCA con kernel, modelado de series temporales estructuradas y comparación de objetos complejos.

Idea rectora de la parte

HMC usa gradientes para proponer estados lejanos con alta aceptación.

Error a evitar

Invertir una matriz de covarianza sin jitter numérico.

Conexión con IA

Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.

Bibliografía de la clase

Archivos de la clase