🧮 Computational Mathematics

Inicio · Parte 07 — Cálculo diferencial e integral

147 — Regla de la cadena

universitario clase 7 de 20 4 horas demostración chain_rule

La regla de la cadena es el mecanismo completo de backpropagation: derivar una composición es multiplicar factores.

Fórmulas

(f∘g)'(x) = f'(g(x)) · g'(x)
cadena de L funciones: producto de L derivadas

Desarrollo

La regla de la cadena dice que la derivada de una composición es el producto de las derivadas de sus piezas, evaluadas en los puntos correctos. La intuición de tasas encadenadas lo hace evidente: si y cambia 3 veces más rápido que u, y u cambia 2 veces más rápido que x, entonces y cambia 6 veces más rápido que x.

Esta clase es la más importante del programa para quien quiera entender deep learning. Una red de L capas es una composición de L funciones (clase 057), así que su gradiente respecto a los parámetros de la primera capa es un producto de L factores. Ese producto explica de golpe tres fenómenos que suelen presentarse por separado:

Si cada factor es menor que 1, el producto tiende a cero exponencialmente: el gradiente se desvanece y las primeras capas dejan de aprender (clase 314). Si cada factor es mayor que 1, el producto diverge: el gradiente explota. Y como la derivada de ReLU vale exactamente 1 en el semieje positivo, sustituir la sigmoide —cuya derivada máxima es 0.25— por ReLU evita que el producto se atenúe.

La regla se generaliza a varias variables como una suma de productos sobre todos los caminos del grafo de cómputo (clase 167), y su implementación eficiente en modo reverso es la autodiferenciación (clase 179). Todo lo demás en el entrenamiento de una red es ingeniería alrededor de esta regla.

Ejemplo trabajado

Derivar sin(x²+1) y una cadena de tres niveles.

f(u) = sin(u),  g(x) = x²+1,  x = 1.5

g(x) = 3.25
df/du en g(x) = cos(3.25) = −0.9940
dg/dx = 2x = 3.0

producto: −0.9940 × 3.0 = −2.9821
derivada numérica:        −2.9821          ✓

Cadena de tres: e^(sin(x²)) en x = 0.8
  derivada = 2.0871

En una red de L capas: el gradiente es un producto de L factores.

Qué calcula el laboratorio

La regla de la cadena: el mecanismo entero de backpropagation.

python classes/part-07-calculo-diferencial-e-integral/147-regla-de-la-cadena/lab.py
compmath run 147

Salidas del laboratorio (9)

Muestra de la ejecución real

{
  "composicion": "sin(x²+1)",
  "x": 1.5,
  "df/du_en_g(x)": -0.9941296760805463,
  "dg/dx": 3.0,
  "producto_de_la_cadena": -2.98238903,
  "derivada_numerica": -2.98238903
}

Errores comunes

Dónde se usa

Backpropagation, autodiferenciación, cambio de variable en integrales, propagación de incertidumbre y análisis de gradientes que se desvanecen o explotan.

Idea rectora de la parte

La regla de la cadena es el mecanismo entero de backpropagation.

Error a evitar

Usar diferencias finitas con h demasiado pequeño y amplificar el error de redondeo.

Conexión con IA

Sin regla de la cadena no hay entrenamiento por gradiente; sin Taylor no hay métodos de segundo orden ni análisis de convergencia.

Bibliografía de la clase

Archivos de la clase