🧮 Computational Mathematics

Inicio · Parte 08 — Cálculo multivariable, matricial y autodiferenciación

170 — Taylor multivariable

universitario-avanzado clase 10 de 20 4 horas demostración multivariable_taylor

Taylor de segundo orden usa el Hessiano y reduce el error de cuadrático a cúbico.

Fórmulas

f(x+d) ≈ f(x) + ∇fᵀd + ½dᵀHd
error de orden 1: O(‖d‖²); de orden 2: O(‖d‖³)

Desarrollo

El desarrollo de Taylor multivariable tiene la misma estructura que el de una variable, con el gradiente en el término lineal y el Hessiano en el cuadrático. La expresión ½dᵀHd es una forma cuadrática (clase 128), y su valor depende de la dirección del desplazamiento.

La ganancia de precisión es sustancial: el término de orden 2 reduce el error de O(‖d‖²) a O(‖d‖³). Para un desplazamiento de 0.05, eso significa pasar de un error del orden de 0.0025 a uno del orden de 0.000125: veinte veces mejor.

Esa mejora es la que justifica los métodos de segundo orden. Newton aproxima la función por su Taylor cuadrático y salta directamente al mínimo de esa parábola, lo que converge cuadráticamente cerca del óptimo. El precio es calcular e invertir el Hessiano.

Todos los optimizadores adaptativos de la parte 12 —AdaGrad, RMSProp, Adam— son intentos de capturar información de segundo orden sin calcular el Hessiano, usando en su lugar estadísticas acumuladas del gradiente. Entender qué aproximan exige entender este desarrollo.

Ejemplo trabajado

Órdenes 0, 1 y 2 alrededor de (1,1).

f(x,y) = x²y + 3xy² + 2,  desplazamiento d = (0.05, −0.03)

valor exacto:  6.0296

orden 0:  6.0000     error 2.96e−02
orden 1:  6.0250     error 4.60e−03
orden 2:  6.0296     error 1.11e−04

Cada orden reduce el error en más de un factor 10.

Qué calcula el laboratorio

Taylor de segundo orden en dos variables.

python classes/part-08-calculo-multivariable-matricial-y-autodiferenciacion/170-taylor-multivariable/lab.py
compmath run 170

Salidas del laboratorio (8)

Muestra de la ejecución real

{
  "punto_base": [
    1.0,
    1.0
  ],
  "desplazamiento": [
    0.05,
    -0.03
  ],
  "valor_exacto": 6.03326,
  "orden_0": 6.0,
  "orden_1": 6.04,
  "orden_2": 6.0332
}

Errores comunes

Dónde se usa

Método de Newton, análisis de convergencia, aproximación de Laplace y justificación de los optimizadores adaptativos.

Idea rectora de la parte

Lagrange convierte una restricción en un término de la función objetivo.

Error a evitar

Confundir la convención de layout (numerador vs denominador) en cálculo matricial.

Conexión con IA

Autograd de PyTorch y JAX es exactamente el modo reverso del grafo de cómputo que se construye en esta parte a mano.

Bibliografía de la clase

Archivos de la clase