🧮 Computational Mathematics

Inicio · Parte 06

Álgebra lineal II: descomposiciones y tensores

intermedio-avanzado 20 clases 80 horas estimadas motor part06

Cambio de base, autovalores, diagonalización, LU, QR, mínimos cuadrados, SVD, pseudoinversa, PCA y álgebra tensorial.

Panorama de la parte

Si la parte 05 enseñó qué es una matriz, esta enseña a desarmarla. Una descomposición escribe una matriz como producto de matrices más simples, y esa reescritura convierte problemas difíciles en fáciles: resolver muchos sistemas, calcular potencias, comprimir datos, encontrar direcciones principales o diagnosticar mal condicionamiento.

Las clases 121 a 124 preparan el terreno con el concepto que más cuesta y más rinde: la base es una elección. Un vector no cambia al cambiar de base; lo que cambia es su lista de coordenadas. La matriz A' = P⁻¹AP representa la misma transformación vista desde otra base, y toda la teoría de autovalores consiste en buscar la base donde la transformación se ve lo más simple posible.

Las clases 125 a 128 son autovalores y diagonalización. Un autovector es una dirección que la transformación solo escala, y en esa base la matriz se convierte en diagonal: aplicarla cien veces cuesta elevar números a la centésima, no multiplicar cien matrices. Las matrices simétricas —que incluyen toda covarianza y todo Hessiano— son siempre diagonalizables con base ortonormal, resultado conocido como teorema espectral.

Las clases 129 a 134 son las descomposiciones de trabajo: LU para resolver muchos sistemas, QR para mínimos cuadrados estables, y SVD, que es la más general y la más útil. La SVD existe para toda matriz, incluso rectangular y singular, y de ella se leen el rango, el número de condición, la mejor aproximación de rango bajo y la pseudoinversa. Si hubiera que quedarse con un solo resultado de álgebra lineal aplicada, sería la SVD.

El teorema de Eckart-Young, que la clase 133 comprueba numéricamente, dice algo muy fuerte: truncar la SVD da la mejor aproximación posible de rango k, no una buena. Ese resultado es el que fundamenta PCA, la compresión de imágenes, los sistemas de recomendación por factorización y LoRA.

El cierre (135 a 139) conecta con la práctica moderna: PCA como SVD de datos centrados, producto de Kronecker, tensores, broadcasting y notación de Einstein. Broadcasting y einsum no son algoritmos nuevos: son notación para expresar operaciones tensoriales sin bucles, y saber leerlos es requisito para leer código de deep learning.

Recorrido de la parte

Ideas centrales

Por qué importa en IA

LoRA factoriza matrices de bajo rango, la atención se define con productos tensoriales y la estabilidad del entrenamiento depende del espectro de los pesos.

Errores frecuentes

Secuencia de clases

#ClaseDemostración ejecutable
121 Bases y coordenadas bases_coordinates
122 Cambio de base change_of_basis
123 Transformaciones lineales linear_transformations
124 Núcleo e imagen kernel_image
125 Autovalores y autovectores eigen
126 Diagonalización diagonalization
127 Matrices positivas definidas positive_definite
128 Formas cuadráticas quadratic_forms
129 Descomposición LU lu_decomposition
130 Descomposición QR qr_decomposition
131 Mínimos cuadrados lineales least_squares
132 SVD desde la intuición svd_intuition
133 SVD y compresión svd_compression
134 Pseudoinversa de Moore-Penrose pseudoinverse
135 PCA desde álgebra lineal pca
136 Producto de Kronecker kronecker
137 Tensores: índices, shape y orden tensors
138 Broadcasting como operación tensorial broadcasting
139 Einstein summation einsum
140 Capstone: PCA y compresión de imágenes capstone_pca_compression

Ejecutar la parte completa

compmath run --part 06

Glosario de la parte (20 términos)

TérminoDefiniciónClase
Base Conjunto independiente que genera todo el espacio. Las coordenadas de un vector dependen de la base elegida. 121
Cambio de base Transformación A' = P⁻¹AP que expresa la misma aplicación lineal en otra base. 122
Matrices semejantes A y P⁻¹AP. Representan la misma transformación y comparten traza, determinante y autovalores. 122
Núcleo Conjunto de vectores que la transformación manda al cero. Su dimensión es la nulidad. 124
Autovalor Factor λ por el que la transformación escala su autovector: Av = λv. 125
Teorema espectral Toda matriz simétrica real es diagonalizable con autovectores ortonormales y autovalores reales. 126
Definida positiva Matriz simétrica con todos los autovalores positivos; equivale a xᵀAx > 0 para todo x no nulo. 127
Forma cuadrática q(x) = xᵀAx. Sus curvas de nivel son elipses si A es definida positiva. 128
Factorización LU A = LU con L triangular inferior y U superior. Factoriza una vez, resuelve muchos sistemas. 129
Factorización QR A = QR con Q ortogonal y R triangular superior. Numéricamente más estable que las ecuaciones normales. 130
Mínimos cuadrados Solución que minimiza ‖Ax − b‖². Es la proyección de b sobre el espacio columna de A. 131
Valor singular Raíz cuadrada de los autovalores de AᵀA. Miden cuánto estira A en cada dirección principal. 132
SVD A = UΣVᵀ. Existe para toda matriz. De ella se leen rango, condición y mejor aproximación de rango bajo. 132
Teorema de Eckart-Young La SVD truncada a rango k es la mejor aproximación de rango k en norma de Frobenius y espectral. 133
Pseudoinversa A⁺, generalización de la inversa a matrices rectangulares o singulares. Da la solución de mínima norma. 134
PCA Proyección sobre los autovectores de la covarianza. Es la SVD de los datos centrados. 135
Producto de Kronecker A⊗B, matriz en bloques cuyo rango es el producto de los rangos. 136
Orden de un tensor Número de índices necesarios para localizar un elemento. Un lote de imágenes es de orden 4. 137
Broadcasting Regla que alinea shapes por la derecha y estira las dimensiones de tamaño 1 sin copiar memoria. 138
Notación de Einstein Convenio en el que los índices repetidos se suman. Unifica producto, traza, contracción y transposición. 139

Bibliografía

Ver el motor en GitHub