🧮 Computational Mathematics

Inicio · Parte 17 — Frontera matemática para IA e investigación

356 — Statistical learning theory

frontera-investigacion clase 16 de 20 4 horas demostración statistical_learning_theory

Con 25 parámetros y 30 datos se acierta el 80 % en entrenamiento sobre etiquetas aleatorias.

Fórmulas

R(h) = R_emp(h) + brecha de generalización
la brecha crece con la complejidad y decrece con n
cota uniforme: sup_h |R(h) − R_emp(h)|

Desarrollo

La teoría estadística del aprendizaje separa dos cantidades que se confunden a diario. El riesgo empírico es el error medido sobre la muestra de entrenamiento; el riesgo verdadero es el error esperado sobre la distribución real. Minimizar el primero es lo que se puede hacer; controlar el segundo es lo que interesa.

La diferencia entre ambos es la brecha de generalización, y depende de dos cosas: la complejidad de la clase de hipótesis y el número de ejemplos. Con muchos datos y una clase simple la brecha es pequeña; con pocos datos y una clase rica puede ser enorme, y el modelo memoriza en vez de aprender.

La demostración usa etiquetas completamente aleatorias, sin ninguna señal que aprender, y por tanto con accuracy esperada de 0,5. Con 30 observaciones y 25 parámetros, el modelo acierta el 80 % en entrenamiento y el 48,5 % en test: la brecha entera es memorización. El número de entrenamiento no mide nada.

Las cotas teóricas acotan el peor caso sobre toda la clase de hipótesis, no el caso concreto. Esa uniformidad es lo que las hace válidas y también lo que las hace holgadas: son correctas y muy pesimistas. En redes profundas predicen que no debería haber generalización, y la hay. Explicar esa discrepancia es un área abierta, y conviene presentarla así en vez de fingir que la teoría clásica describe lo que ocurre.

Ejemplo trabajado

Memorización pura sobre etiquetas aleatorias.

señal real en los datos: NINGUNA
accuracy esperada: 0,5

n = 30, d = 25:
  accuracy train: 0,800
  accuracy test:  0,485
  brecha: 0,315

El 80 % de entrenamiento es memorización completa:
con 25 parámetros y 30 datos hay capacidad de sobra
para ajustar ruido.

El test confirma que no se aprendió nada: 0,485
es indistinguible del azar.

Descomposición: R(h) = R_emp(h) + brecha

Qué calcula el laboratorio

Riesgo empírico frente a riesgo verdadero y la brecha de generalización.

python classes/part-17-frontera-matematica-para-ia-e-investigacion/356-statistical-learning-theory/lab.py
compmath run 356

Salidas del laboratorio (8)

Muestra de la ejecución real

{
  "señal_real_en_los_datos": "ninguna (etiquetas aleatorias)",
  "accuracy_esperada": 0.5,
  "resultados": {
    "n=30, d=25": {
      "accuracy_train": 0.8,
      "accuracy_test": 0.485,
      "brecha": 0.315
    },
    "n=30, d=5": {
      "accuracy_train": 0.6667,
      "accuracy_test": 0.47,
      "brecha": 0.1967
    },
    "n=300, d=25": {
      "accuracy_train": 0.4967,
      "accuracy_test": 0.475,
      "brecha": 0.0217
    }
  },
  "mas_parametros_que_datos_memoriza": true,
  "descomposicion": "R(h) = R_emp(h) + brecha de generalización",
  "cota_uniforme": "sup_h |R(h) - R_emp(h)| controla el peor caso de la clase"
}

Errores comunes

Dónde se usa

Diseño de experimentos de aprendizaje, elección de capacidad, comprensión del sobreajuste y justificación de la validación.

Idea rectora de la parte

Un proceso gaussiano define una distribución sobre funciones, no sobre parámetros.

Error a evitar

Reportar resultados de MCMC sin diagnóstico de convergencia.

Conexión con IA

Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.

Bibliografía de la clase

Archivos de la clase