Inicio · Parte 17 — Frontera matemática para IA e investigación
K(a,b) = φ(a)ᵀφ(b) para alguna φ
Mercer: matriz de Gram semidefinida positiva
suma y producto de kernels son kernels
Un kernel codifica una noción de similitud, y elegirlo es elegir qué se considera parecido. Cada familia impone supuestos distintos sobre las funciones que el modelo puede representar, y esos supuestos son la parte del modelado que realmente importa.
El RBF o gaussiano supone funciones infinitamente suaves y decae con la distancia; es el punto de partida razonable. El polinómico captura interacciones de grado fijo. La familia Matérn es más flexible: su parámetro controla la suavidad, y Matérn 3/2 o 5/2 suelen ajustarse mejor a datos reales que el RBF, que a menudo es demasiado suave.
La condición de Mercer caracteriza qué funciones son kernels legítimos: aquellas cuya matriz de Gram es semidefinida positiva para cualquier conjunto de puntos. Esa condición garantiza que existe un espacio de características —posiblemente de dimensión infinita— donde el kernel es el producto escalar, y es lo que hace válido el truco de la clase 290.
Las reglas de composición permiten construir kernels a medida sin verificar Mercer cada vez: sumas, productos y escalados de kernels válidos siguen siendo válidos. Con eso se combinan estructuras —periodicidad más tendencia más ruido— de forma modular, que es como se modelan series temporales complejas con GP.
Cuatro kernels y la verificación de Mercer.
valores sobre un mismo par de puntos:
RBF 0,32465247
polinómico grado 3 42,87500000
Matérn 3/2 0,26770000
matriz de Gram del RBF (4 puntos):
[1,000000 0,882497 0,606531 0,324652]
[0,882497 1,000000 0,882497 0,606531]
[ ... ]
autovalores:
[3,11850065 ; 0,78879628 ; 0,08864872 ; 0,00405435]
todos ≥ 0 → semidefinida positiva ✓
cumple Mercer ✓
El menor autovalor es 0,004: casi singular.
Sin jitter, Cholesky fallaría.
Familias de kernels y la condición de Mercer.
python classes/part-17-frontera-matematica-para-ia-e-investigacion/342-kernel-methods-avanzados/lab.py
compmath run 342
kernelsmatriz_de_Gram_RBFautovalores_de_Grames_semidefinida_positivacondicion_de_Mercersuma_de_kernels_es_kernelproducto_de_kernels_es_kernelmatern_es_menos_suave_que_RBF{
"kernels": {
"RBF": 0.32465247,
"polinomico_grado_3": 42.875,
"matern_3/2": 0.26775661,
"periodico": 0.36787944
},
"matriz_de_Gram_RBF": [
[
1.0,
0.882497,
0.606531,
0.324652
],
[
0.882497,
1.0,
0.882497,
0.606531
],
[
0.606531,
0.882497,
1.0,
0.882497
],
[
0.324652,
0.606531,
0.882497,
1.0
]
],
"autovalores_de_Gram": [
3.11850065,
0.78879628,
0.08864872,
0.00405435
],
"es_semidefinida_positiva": true,
"condicion_de_Mercer": "toda matriz de Gram debe ser semidefinida positiva",
"suma_de_kernels_es_kernel": true
}
Procesos gaussianos, SVM no lineales, PCA con kernel, modelado de series temporales estructuradas y comparación de objetos complejos.
Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.
9780262536578 verificado en International ISBN Agency (2026-08-19).