Inicio · Parte 17 — Frontera matemática para IA e investigación
R(h) = R_emp(h) + brecha de generalización
la brecha crece con la complejidad y decrece con n
cota uniforme: sup_h |R(h) − R_emp(h)|
La teoría estadística del aprendizaje separa dos cantidades que se confunden a diario. El riesgo empírico es el error medido sobre la muestra de entrenamiento; el riesgo verdadero es el error esperado sobre la distribución real. Minimizar el primero es lo que se puede hacer; controlar el segundo es lo que interesa.
La diferencia entre ambos es la brecha de generalización, y depende de dos cosas: la complejidad de la clase de hipótesis y el número de ejemplos. Con muchos datos y una clase simple la brecha es pequeña; con pocos datos y una clase rica puede ser enorme, y el modelo memoriza en vez de aprender.
La demostración usa etiquetas completamente aleatorias, sin ninguna señal que aprender, y por tanto con accuracy esperada de 0,5. Con 30 observaciones y 25 parámetros, el modelo acierta el 80 % en entrenamiento y el 48,5 % en test: la brecha entera es memorización. El número de entrenamiento no mide nada.
Las cotas teóricas acotan el peor caso sobre toda la clase de hipótesis, no el caso concreto. Esa uniformidad es lo que las hace válidas y también lo que las hace holgadas: son correctas y muy pesimistas. En redes profundas predicen que no debería haber generalización, y la hay. Explicar esa discrepancia es un área abierta, y conviene presentarla así en vez de fingir que la teoría clásica describe lo que ocurre.
Memorización pura sobre etiquetas aleatorias.
señal real en los datos: NINGUNA
accuracy esperada: 0,5
n = 30, d = 25:
accuracy train: 0,800
accuracy test: 0,485
brecha: 0,315
El 80 % de entrenamiento es memorización completa:
con 25 parámetros y 30 datos hay capacidad de sobra
para ajustar ruido.
El test confirma que no se aprendió nada: 0,485
es indistinguible del azar.
Descomposición: R(h) = R_emp(h) + brecha
Riesgo empírico frente a riesgo verdadero y la brecha de generalización.
python classes/part-17-frontera-matematica-para-ia-e-investigacion/356-statistical-learning-theory/lab.py
compmath run 356
señal_real_en_los_datosaccuracy_esperadaresultadosmas_parametros_que_datos_memorizadescomposicioncota_uniformeel_riesgo_empirico_solo_no_bastasemilla{
"señal_real_en_los_datos": "ninguna (etiquetas aleatorias)",
"accuracy_esperada": 0.5,
"resultados": {
"n=30, d=25": {
"accuracy_train": 0.8,
"accuracy_test": 0.485,
"brecha": 0.315
},
"n=30, d=5": {
"accuracy_train": 0.6667,
"accuracy_test": 0.47,
"brecha": 0.1967
},
"n=300, d=25": {
"accuracy_train": 0.4967,
"accuracy_test": 0.475,
"brecha": 0.0217
}
},
"mas_parametros_que_datos_memoriza": true,
"descomposicion": "R(h) = R_emp(h) + brecha de generalización",
"cota_uniforme": "sup_h |R(h) - R_emp(h)| controla el peor caso de la clase"
}
Diseño de experimentos de aprendizaje, elección de capacidad, comprensión del sobreajuste y justificación de la validación.
Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.
9781139950619 verificado en International ISBN Agency (2026-08-19).10.48550/arxiv.1611.03530 verificado en DataCite (2026-08-19).