🧮 Computational Mathematics

Inicio · Parte 17 — Frontera matemática para IA e investigación

359 — Approximation theory y scaling

frontera-investigacion clase 19 de 20 4 horas demostración approximation_theory

El error decae como una potencia del tamaño, y ese exponente es lo que predice el escalado.

Fórmulas

error ≈ C·(parámetros)^α
polinomios sobre funciones suaves: convergencia muy rápida
lineal por trozos: error / 4 al duplicar los trozos

Desarrollo

La teoría de aproximación estudia con qué precisión una familia de funciones puede representar otra, y cómo mejora esa precisión al aumentar los recursos. Es la base teórica de las leyes de escala que gobiernan el desarrollo de modelos grandes.

La forma general del resultado es una ley de potencias: el error decae como el número de parámetros elevado a un exponente negativo. Ese exponente depende de la suavidad de la función objetivo y de la familia aproximante, y es lo que determina si merece la pena aumentar el tamaño.

El ejemplo lo muestra en dos regímenes. Con polinomios sobre una función suave, el exponente empírico es −7,68: convergencia extraordinariamente rápida, porque la función es analítica. Con aproximación lineal por trozos, duplicar el número de trozos divide el error por 4, lo que corresponde a un exponente de −2: mucho más lento pero robusto, sin depender de la suavidad global.

La conexión con el aprendizaje profundo es directa. Las leyes de escala de Kaplan y de Hoffmann son leyes de potencias empíricas que relacionan pérdida con parámetros, datos y cómputo, y permiten predecir el rendimiento de un modelo antes de entrenarlo. La corrección de Chinchilla —que los modelos estaban infraentrenados en datos— salió de tomar en serio esos exponentes. Ninguna ley de potencias es eterna: hay saturación cuando se agota la información disponible, y ese límite es hoy una pregunta abierta.

Ejemplo trabajado

Dos regímenes de aproximación sobre la misma función.

objetivo: e^(−x)·sin(4x) en [0,1]

Aproximación polinómica:
  grado 1  (2 parámetros):  error máximo 0,7920526488
  grado 3  ( ... ):          error mucho menor
  exponente de escala empírico: −7,6813
  convergencia rapidísima: la función es analítica

Aproximación lineal por trozos:
  2 trozos:  error máximo 0,3797908445
  4 trozos:  error menor
  razón de error al duplicar: 3,9755 ≈ 4
  exponente ≈ −2

Lectura: error ≈ C·(parámetros)^exponente

Los polinomios ganan aquí porque la función es suave;
con una función con esquinas, la victoria sería
del método por trozos.

Qué calcula el laboratorio

Teoría de aproximación y leyes de escala: el error como potencia del tamaño.

python classes/part-17-frontera-matematica-para-ia-e-investigacion/359-approximation-theory-y-scaling/lab.py
compmath run 359

Salidas del laboratorio (11)

Muestra de la ejecución real

{
  "funcion_objetivo": "e^(-x)·sin(4x) en [0,1]",
  "aproximacion_polinomica": [
    {
      "grado": 1,
      "parametros": 2,
      "error_maximo": 0.7920526488
    },
    {
      "grado": 3,
      "parametros": 4,
      "error_maximo": 0.0443703433
    },
    {
      "grado": 5,
      "parametros": 6,
      "error_maximo": 0.0018471928
    },
    {
      "grado": 9,
      "parametros": 10,
      "error_maximo": 2.5797e-06
    }
  ],
  "exponente_de_escala_empirico": -7.6813,
  "lectura": "error ≈ C·(parámetros)^(exponente)",
  "aproximacion_lineal_por_trozos": [
    {
      "trozos": 2,
      "error_maximo": 0.3797908445
    },
    {
      "trozos": 4,
      "error_maximo": 0.0955322826
    },
    {
      "trozos": 8,
      "error_maximo": 0.0258500401
    },
    {
      "trozos": 16,
      "error_maximo": 0.00650932
    }
  ],
  "razon_de_error_al_duplicar_trozos": 3.9755
}

Errores comunes

Dónde se usa

Leyes de escala de modelos de lenguaje, planificación de presupuestos de cómputo, elección de arquitecturas y teoría de aproximación con redes neuronales.

Idea rectora de la parte

La geometría de la información dota al espacio de parámetros de una métrica natural.

Error a evitar

Reportar resultados de MCMC sin diagnóstico de convergencia.

Conexión con IA

Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.

Bibliografía de la clase

Archivos de la clase