Inicio · Parte 17
Procesos gaussianos, MCMC avanzado, inferencia variacional, transporte óptimo, geometría diferencial e informacional, SDE, Neural ODE, score matching y teoría del aprendizaje.
Esta última parte recorre la matemática que aparece en los artículos de investigación actuales y que rara vez se enseña en un curso introductorio. No es un apéndice decorativo: score matching es el fundamento de los modelos de difusión, el transporte óptimo aparece en flow matching, y la teoría estadística del aprendizaje es lo que da marco a las leyes de escala. Quien quiera leer papers y reproducirlos necesita estas herramientas.
Las clases 341 a 345 tratan la inferencia. Un proceso gaussiano define una distribución sobre funciones en vez de sobre parámetros, y su virtud es que la incertidumbre es honesta: mínima donde hay datos, y de vuelta al prior donde no los hay. Los métodos de muestreo aparecen con su diagnóstico obligatorio: Metropolis-Hastings tiene una tasa de aceptación óptima cercana a 0,44 y un paso mal elegido produce cadenas que aceptan casi todo y no exploran nada. HMC usa el gradiente para proponer estados lejanos con altísima aceptación, y la inferencia variacional cambia muestrear por optimizar.
Las clases 346 y 347 introducen el transporte óptimo, que responde a cuánto cuesta mover una distribución hasta otra. Su ventaja decisiva sobre la KL es que funciona sin soporte común: cuando dos distribuciones no se solapan, la KL es infinita o constante y su gradiente inútil, mientras que Wasserstein sigue midiendo la separación real. Eso es exactamente lo que arregló WGAN, y lo que hace del transporte óptimo el lenguaje del flow matching.
Las clases 348 a 350 aportan geometría. La hipótesis de la variedad —los datos reales viven en una variedad de dimensión intrínseca mucho menor que la del espacio ambiente— es lo que explica que el aprendizaje sea posible en dimensión alta. La geometría de la información dota al espacio de parámetros de una métrica natural: la información de Fisher es la curvatura local de la divergencia KL, y de ahí salen la cota de Cramér-Rao y el gradiente natural, invariante a reparametrizaciones.
Las clases 351 a 355 tratan la dinámica y la causalidad. Las ecuaciones diferenciales estocásticas describen procesos con ruido continuo y son la formulación en tiempo continuo de la difusión; los Neural ODE tratan la profundidad como variable continua y usan el método adjunto para no almacenar toda la trayectoria; el score matching aprende ∇ log p sin necesitar la constante de normalización, que es precisamente la cantidad intratable; y la inferencia causal muestra con números cómo el ajuste por puerta trasera recupera un efecto real de cero que la correlación cruda estimaba en 1,02.
El cierre (356 a 359) es teoría del aprendizaje: riesgo empírico frente a riesgo verdadero, dimensión VC, cotas PAC y teoría de aproximación. Conviene decir con claridad qué aportan y qué no. Las cotas PAC son correctas y enormemente holgadas en la práctica: predicen que las redes profundas no deberían generalizar y generalizan. Su valor es cualitativo —cómo escala la muestra necesaria con 1/ε y con la complejidad— no cuantitativo.
El capstone reproduce el núcleo matemático de un resultado publicado: el estimador de Sinkhorn converge al transporte óptimo cuando la regularización entrópica tiende a cero. Verificar un resultado de un artículo con código propio y datos donde el óptimo se conoce por fuerza bruta es la habilidad que este programa entero ha estado construyendo desde la primera clase.
| # | Clase | Demostración ejecutable |
|---|---|---|
341 |
Gaussian Processes | gaussian_processes |
342 |
Kernel methods avanzados | advanced_kernels |
343 |
MCMC avanzado | advanced_mcmc |
344 |
Hamiltonian Monte Carlo | hamiltonian_monte_carlo |
345 |
Variational inference avanzada | advanced_variational_inference |
346 |
Optimal transport | optimal_transport |
347 |
Wasserstein distance | wasserstein_distance |
348 |
Manifold learning | manifold_learning |
349 |
Geometría diferencial para ML | differential_geometry |
350 |
Information geometry | information_geometry |
351 |
Stochastic differential equations | stochastic_differential_equations |
352 |
Neural ODEs | neural_odes |
353 |
Score matching | score_matching |
354 |
Spectral graph theory | spectral_graph_theory |
355 |
Causal inference | causal_inference |
356 |
Statistical learning theory | statistical_learning_theory |
357 |
VC dimension | vc_dimension |
358 |
PAC learning | pac_learning |
359 |
Approximation theory y scaling | approximation_theory |
360 |
Capstone final: reproducir una idea matemática de un paper | capstone_reproduce_paper_idea |
compmath run --part 17
| Término | Definición | Clase |
|---|---|---|
| Proceso gaussiano | Distribución sobre funciones definida por una media y un kernel de covarianza. | 341 |
| Jitter numérico | Pequeña constante sumada a la diagonal para que la covarianza sea invertible. | 341 |
| Condición de Mercer | Una función es kernel válido si su matriz de Gram es siempre semidefinida positiva. | 342 |
| Matriz de Gram | Matriz de todos los productos kernel entre pares de puntos. | 342 |
| Metropolis-Hastings | Propone un estado y lo acepta con probabilidad dependiente de la razón de densidades. | 343 |
| Tasa de aceptación | Fracción de propuestas aceptadas. El óptimo en una dimensión ronda 0,44. | 343 |
| Burn-in | Iteraciones iniciales descartadas hasta que la cadena alcanza su distribución estacionaria. | 343 |
| Hamiltonian Monte Carlo | Usa el gradiente y dinámica hamiltoniana para proponer estados lejanos con alta aceptación. | 344 |
| Leapfrog | Integrador simpléctico que conserva el volumen y hace válida la propuesta de HMC. | 344 |
| Inferencia variacional | Aproximar una posterior optimizando dentro de una familia en vez de muestrear. | 345 |
| Familia variacional | Conjunto de distribuciones candidatas entre las que se busca la mejor aproximación. | 345 |
| Transporte óptimo | Plan de mínimo coste para transformar una distribución en otra. | 346 |
| Algoritmo de Sinkhorn | Resuelve el transporte con regularización entrópica mediante escalados alternos. | 346 |
| Distancia de Wasserstein | Coste mínimo de transporte. Es una métrica verdadera y funciona sin soporte común. | 347 |
| Hipótesis de la variedad | Los datos reales viven cerca de una variedad de dimensión mucho menor que la ambiente. | 348 |
| Dimensión intrínseca | Número de grados de libertad reales de los datos, independiente del espacio de representación. | 348 |
| Tensor métrico | Objeto que define distancias y ángulos localmente en una variedad. | 349 |
| Geodésica | Curva de longitud mínima entre dos puntos de una variedad. | 349 |
| Información de Fisher | Curvatura local de la KL. Métrica natural del espacio de parámetros. | 350 |
| Cota de Cramér-Rao | Ningún estimador insesgado tiene varianza menor que la inversa de la información de Fisher. | 350 |
| Gradiente natural | Gradiente preacondicionado por la inversa de Fisher. Invariante a reparametrizaciones. | 350 |
| Ecuación diferencial estocástica | Ecuación con un término de deriva y otro de ruido browniano. | 351 |
| Euler-Maruyama | Integrador de SDE. El ruido escala como √dt, no como dt. | 351 |
| Neural ODE | Red donde la profundidad es continua y la salida es la solución de una EDO aprendida. | 352 |
| Método adjunto | Calcula gradientes resolviendo una EDO hacia atrás, con memoria constante. | 352 |
| Score | ∇ₓ log p(x). No depende de la constante de normalización. | 353 |
| Constante de normalización | Z que hace que la densidad integre 1. Suele ser intratable y el score la evita. | 353 |
| Vector de Fiedler | Autovector del segundo autovalor del Laplaciano. Su signo sugiere el corte del grafo. | 354 |
| Conectividad algebraica | Segundo autovalor del Laplaciano. Mide cuán difícil es partir el grafo. | 354 |
| Criterio de puerta trasera | Ajustar por un conjunto que bloquee todos los caminos no causales entre X e Y. | 355 |
| Colisionador | Variable causada por dos otras. Condicionar sobre ella crea asociación espuria. | 355 |
| Riesgo empírico | Error medido sobre la muestra de entrenamiento. | 356 |
| Brecha de generalización | Diferencia entre riesgo verdadero y riesgo empírico. | 356 |
| Dimensión VC | Tamaño del mayor conjunto que la clase de hipótesis puede etiquetar de todas las formas. | 357 |
| Fragmentar | Realizar todas las 2ⁿ etiquetaciones posibles de n puntos. | 357 |
| Aprendizaje PAC | Probablemente aproximadamente correcto: error ≤ ε con probabilidad ≥ 1 − δ. | 358 |
| Complejidad muestral | Número de ejemplos necesarios para garantizar (ε, δ). Crece como 1/ε y log(1/δ). | 358 |
| Ley de escala | Error que decae como una potencia del número de parámetros o de datos. | 359 |