🧮 Computational Mathematics

Inicio · Parte 17

Frontera matemática para IA e investigación

frontera-investigacion 20 clases 80 horas estimadas motor part17

Procesos gaussianos, MCMC avanzado, inferencia variacional, transporte óptimo, geometría diferencial e informacional, SDE, Neural ODE, score matching y teoría del aprendizaje.

Panorama de la parte

Esta última parte recorre la matemática que aparece en los artículos de investigación actuales y que rara vez se enseña en un curso introductorio. No es un apéndice decorativo: score matching es el fundamento de los modelos de difusión, el transporte óptimo aparece en flow matching, y la teoría estadística del aprendizaje es lo que da marco a las leyes de escala. Quien quiera leer papers y reproducirlos necesita estas herramientas.

Las clases 341 a 345 tratan la inferencia. Un proceso gaussiano define una distribución sobre funciones en vez de sobre parámetros, y su virtud es que la incertidumbre es honesta: mínima donde hay datos, y de vuelta al prior donde no los hay. Los métodos de muestreo aparecen con su diagnóstico obligatorio: Metropolis-Hastings tiene una tasa de aceptación óptima cercana a 0,44 y un paso mal elegido produce cadenas que aceptan casi todo y no exploran nada. HMC usa el gradiente para proponer estados lejanos con altísima aceptación, y la inferencia variacional cambia muestrear por optimizar.

Las clases 346 y 347 introducen el transporte óptimo, que responde a cuánto cuesta mover una distribución hasta otra. Su ventaja decisiva sobre la KL es que funciona sin soporte común: cuando dos distribuciones no se solapan, la KL es infinita o constante y su gradiente inútil, mientras que Wasserstein sigue midiendo la separación real. Eso es exactamente lo que arregló WGAN, y lo que hace del transporte óptimo el lenguaje del flow matching.

Las clases 348 a 350 aportan geometría. La hipótesis de la variedad —los datos reales viven en una variedad de dimensión intrínseca mucho menor que la del espacio ambiente— es lo que explica que el aprendizaje sea posible en dimensión alta. La geometría de la información dota al espacio de parámetros de una métrica natural: la información de Fisher es la curvatura local de la divergencia KL, y de ahí salen la cota de Cramér-Rao y el gradiente natural, invariante a reparametrizaciones.

Las clases 351 a 355 tratan la dinámica y la causalidad. Las ecuaciones diferenciales estocásticas describen procesos con ruido continuo y son la formulación en tiempo continuo de la difusión; los Neural ODE tratan la profundidad como variable continua y usan el método adjunto para no almacenar toda la trayectoria; el score matching aprende ∇ log p sin necesitar la constante de normalización, que es precisamente la cantidad intratable; y la inferencia causal muestra con números cómo el ajuste por puerta trasera recupera un efecto real de cero que la correlación cruda estimaba en 1,02.

El cierre (356 a 359) es teoría del aprendizaje: riesgo empírico frente a riesgo verdadero, dimensión VC, cotas PAC y teoría de aproximación. Conviene decir con claridad qué aportan y qué no. Las cotas PAC son correctas y enormemente holgadas en la práctica: predicen que las redes profundas no deberían generalizar y generalizan. Su valor es cualitativo —cómo escala la muestra necesaria con 1/ε y con la complejidad— no cuantitativo.

El capstone reproduce el núcleo matemático de un resultado publicado: el estimador de Sinkhorn converge al transporte óptimo cuando la regularización entrópica tiende a cero. Verificar un resultado de un artículo con código propio y datos donde el óptimo se conoce por fuerza bruta es la habilidad que este programa entero ha estado construyendo desde la primera clase.

Recorrido de la parte

Ideas centrales

Por qué importa en IA

Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.

Errores frecuentes

Secuencia de clases

#ClaseDemostración ejecutable
341 Gaussian Processes gaussian_processes
342 Kernel methods avanzados advanced_kernels
343 MCMC avanzado advanced_mcmc
344 Hamiltonian Monte Carlo hamiltonian_monte_carlo
345 Variational inference avanzada advanced_variational_inference
346 Optimal transport optimal_transport
347 Wasserstein distance wasserstein_distance
348 Manifold learning manifold_learning
349 Geometría diferencial para ML differential_geometry
350 Information geometry information_geometry
351 Stochastic differential equations stochastic_differential_equations
352 Neural ODEs neural_odes
353 Score matching score_matching
354 Spectral graph theory spectral_graph_theory
355 Causal inference causal_inference
356 Statistical learning theory statistical_learning_theory
357 VC dimension vc_dimension
358 PAC learning pac_learning
359 Approximation theory y scaling approximation_theory
360 Capstone final: reproducir una idea matemática de un paper capstone_reproduce_paper_idea

Ejecutar la parte completa

compmath run --part 17

Glosario de la parte (38 términos)

TérminoDefiniciónClase
Proceso gaussiano Distribución sobre funciones definida por una media y un kernel de covarianza. 341
Jitter numérico Pequeña constante sumada a la diagonal para que la covarianza sea invertible. 341
Condición de Mercer Una función es kernel válido si su matriz de Gram es siempre semidefinida positiva. 342
Matriz de Gram Matriz de todos los productos kernel entre pares de puntos. 342
Metropolis-Hastings Propone un estado y lo acepta con probabilidad dependiente de la razón de densidades. 343
Tasa de aceptación Fracción de propuestas aceptadas. El óptimo en una dimensión ronda 0,44. 343
Burn-in Iteraciones iniciales descartadas hasta que la cadena alcanza su distribución estacionaria. 343
Hamiltonian Monte Carlo Usa el gradiente y dinámica hamiltoniana para proponer estados lejanos con alta aceptación. 344
Leapfrog Integrador simpléctico que conserva el volumen y hace válida la propuesta de HMC. 344
Inferencia variacional Aproximar una posterior optimizando dentro de una familia en vez de muestrear. 345
Familia variacional Conjunto de distribuciones candidatas entre las que se busca la mejor aproximación. 345
Transporte óptimo Plan de mínimo coste para transformar una distribución en otra. 346
Algoritmo de Sinkhorn Resuelve el transporte con regularización entrópica mediante escalados alternos. 346
Distancia de Wasserstein Coste mínimo de transporte. Es una métrica verdadera y funciona sin soporte común. 347
Hipótesis de la variedad Los datos reales viven cerca de una variedad de dimensión mucho menor que la ambiente. 348
Dimensión intrínseca Número de grados de libertad reales de los datos, independiente del espacio de representación. 348
Tensor métrico Objeto que define distancias y ángulos localmente en una variedad. 349
Geodésica Curva de longitud mínima entre dos puntos de una variedad. 349
Información de Fisher Curvatura local de la KL. Métrica natural del espacio de parámetros. 350
Cota de Cramér-Rao Ningún estimador insesgado tiene varianza menor que la inversa de la información de Fisher. 350
Gradiente natural Gradiente preacondicionado por la inversa de Fisher. Invariante a reparametrizaciones. 350
Ecuación diferencial estocástica Ecuación con un término de deriva y otro de ruido browniano. 351
Euler-Maruyama Integrador de SDE. El ruido escala como √dt, no como dt. 351
Neural ODE Red donde la profundidad es continua y la salida es la solución de una EDO aprendida. 352
Método adjunto Calcula gradientes resolviendo una EDO hacia atrás, con memoria constante. 352
Score ∇ₓ log p(x). No depende de la constante de normalización. 353
Constante de normalización Z que hace que la densidad integre 1. Suele ser intratable y el score la evita. 353
Vector de Fiedler Autovector del segundo autovalor del Laplaciano. Su signo sugiere el corte del grafo. 354
Conectividad algebraica Segundo autovalor del Laplaciano. Mide cuán difícil es partir el grafo. 354
Criterio de puerta trasera Ajustar por un conjunto que bloquee todos los caminos no causales entre X e Y. 355
Colisionador Variable causada por dos otras. Condicionar sobre ella crea asociación espuria. 355
Riesgo empírico Error medido sobre la muestra de entrenamiento. 356
Brecha de generalización Diferencia entre riesgo verdadero y riesgo empírico. 356
Dimensión VC Tamaño del mayor conjunto que la clase de hipótesis puede etiquetar de todas las formas. 357
Fragmentar Realizar todas las 2ⁿ etiquetaciones posibles de n puntos. 357
Aprendizaje PAC Probablemente aproximadamente correcto: error ≤ ε con probabilidad ≥ 1 − δ. 358
Complejidad muestral Número de ejemplos necesarios para garantizar (ε, δ). Crece como 1/ε y log(1/δ). 358
Ley de escala Error que decae como una potencia del número de parámetros o de datos. 359

Bibliografía

Ver el motor en GitHub