Inicio · Parte 07 — Cálculo diferencial e integral
(f∘g)'(x) = f'(g(x)) · g'(x)
cadena de L funciones: producto de L derivadas
La regla de la cadena dice que la derivada de una composición es el producto de las derivadas de sus piezas, evaluadas en los puntos correctos. La intuición de tasas encadenadas lo hace evidente: si y cambia 3 veces más rápido que u, y u cambia 2 veces más rápido que x, entonces y cambia 6 veces más rápido que x.
Esta clase es la más importante del programa para quien quiera entender deep learning. Una red de L capas es una composición de L funciones (clase 057), así que su gradiente respecto a los parámetros de la primera capa es un producto de L factores. Ese producto explica de golpe tres fenómenos que suelen presentarse por separado:
Si cada factor es menor que 1, el producto tiende a cero exponencialmente: el gradiente se desvanece y las primeras capas dejan de aprender (clase 314). Si cada factor es mayor que 1, el producto diverge: el gradiente explota. Y como la derivada de ReLU vale exactamente 1 en el semieje positivo, sustituir la sigmoide —cuya derivada máxima es 0.25— por ReLU evita que el producto se atenúe.
La regla se generaliza a varias variables como una suma de productos sobre todos los caminos del grafo de cómputo (clase 167), y su implementación eficiente en modo reverso es la autodiferenciación (clase 179). Todo lo demás en el entrenamiento de una red es ingeniería alrededor de esta regla.
Derivar sin(x²+1) y una cadena de tres niveles.
f(u) = sin(u), g(x) = x²+1, x = 1.5
g(x) = 3.25
df/du en g(x) = cos(3.25) = −0.9940
dg/dx = 2x = 3.0
producto: −0.9940 × 3.0 = −2.9821
derivada numérica: −2.9821 ✓
Cadena de tres: e^(sin(x²)) en x = 0.8
derivada = 2.0871
En una red de L capas: el gradiente es un producto de L factores.
La regla de la cadena: el mecanismo entero de backpropagation.
python classes/part-07-calculo-diferencial-e-integral/147-regla-de-la-cadena/lab.py
compmath run 147
composicionxdf/du_en_g(x)dg/dxproducto_de_la_cadenaderivada_numericacoincidencadena_de_3_nivelesen_deep_learning{
"composicion": "sin(x²+1)",
"x": 1.5,
"df/du_en_g(x)": -0.9941296760805463,
"dg/dx": 3.0,
"producto_de_la_cadena": -2.98238903,
"derivada_numerica": -2.98238903
}
Backpropagation, autodiferenciación, cambio de variable en integrales, propagación de incertidumbre y análisis de gradientes que se desvanecen o explotan.
Sin regla de la cadena no hay entrenamiento por gradiente; sin Taylor no hay métodos de segundo orden ni análisis de convergencia.
10.1038/323533a0 verificado en Crossref (2026-08-19).9780262337373 verificado en International ISBN Agency (2026-08-19).