Inicio · Parte 17 — Frontera matemática para IA e investigación
error ≈ C·(parámetros)^α
polinomios sobre funciones suaves: convergencia muy rápida
lineal por trozos: error / 4 al duplicar los trozos
La teoría de aproximación estudia con qué precisión una familia de funciones puede representar otra, y cómo mejora esa precisión al aumentar los recursos. Es la base teórica de las leyes de escala que gobiernan el desarrollo de modelos grandes.
La forma general del resultado es una ley de potencias: el error decae como el número de parámetros elevado a un exponente negativo. Ese exponente depende de la suavidad de la función objetivo y de la familia aproximante, y es lo que determina si merece la pena aumentar el tamaño.
El ejemplo lo muestra en dos regímenes. Con polinomios sobre una función suave, el exponente empírico es −7,68: convergencia extraordinariamente rápida, porque la función es analítica. Con aproximación lineal por trozos, duplicar el número de trozos divide el error por 4, lo que corresponde a un exponente de −2: mucho más lento pero robusto, sin depender de la suavidad global.
La conexión con el aprendizaje profundo es directa. Las leyes de escala de Kaplan y de Hoffmann son leyes de potencias empíricas que relacionan pérdida con parámetros, datos y cómputo, y permiten predecir el rendimiento de un modelo antes de entrenarlo. La corrección de Chinchilla —que los modelos estaban infraentrenados en datos— salió de tomar en serio esos exponentes. Ninguna ley de potencias es eterna: hay saturación cuando se agota la información disponible, y ese límite es hoy una pregunta abierta.
Dos regímenes de aproximación sobre la misma función.
objetivo: e^(−x)·sin(4x) en [0,1]
Aproximación polinómica:
grado 1 (2 parámetros): error máximo 0,7920526488
grado 3 ( ... ): error mucho menor
exponente de escala empírico: −7,6813
convergencia rapidísima: la función es analítica
Aproximación lineal por trozos:
2 trozos: error máximo 0,3797908445
4 trozos: error menor
razón de error al duplicar: 3,9755 ≈ 4
exponente ≈ −2
Lectura: error ≈ C·(parámetros)^exponente
Los polinomios ganan aquí porque la función es suave;
con una función con esquinas, la victoria sería
del método por trozos.
Teoría de aproximación y leyes de escala: el error como potencia del tamaño.
python classes/part-17-frontera-matematica-para-ia-e-investigacion/359-approximation-theory-y-scaling/lab.py
compmath run 359
funcion_objetivoaproximacion_polinomicaexponente_de_escala_empiricolecturaaproximacion_lineal_por_trozosrazon_de_error_al_duplicar_trozosorden_teorico_por_trozosteorema_de_aproximacion_universalmaldicion_de_la_dimensionleyes_de_escala_en_LLMlo_que_no_dicen_las_leyes_de_escala{
"funcion_objetivo": "e^(-x)·sin(4x) en [0,1]",
"aproximacion_polinomica": [
{
"grado": 1,
"parametros": 2,
"error_maximo": 0.7920526488
},
{
"grado": 3,
"parametros": 4,
"error_maximo": 0.0443703433
},
{
"grado": 5,
"parametros": 6,
"error_maximo": 0.0018471928
},
{
"grado": 9,
"parametros": 10,
"error_maximo": 2.5797e-06
}
],
"exponente_de_escala_empirico": -7.6813,
"lectura": "error ≈ C·(parámetros)^(exponente)",
"aproximacion_lineal_por_trozos": [
{
"trozos": 2,
"error_maximo": 0.3797908445
},
{
"trozos": 4,
"error_maximo": 0.0955322826
},
{
"trozos": 8,
"error_maximo": 0.0258500401
},
{
"trozos": 16,
"error_maximo": 0.00650932
}
],
"razon_de_error_al_duplicar_trozos": 3.9755
}
Leyes de escala de modelos de lenguaje, planificación de presupuestos de cómputo, elección de arquitecturas y teoría de aproximación con redes neuronales.
Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.
10.48550/arxiv.2001.08361 verificado en DataCite (2026-08-19).10.48550/arxiv.2203.15556 verificado en DataCite (2026-08-19).