Inicio · Parte 05 — Álgebra lineal I: vectores y matrices
L1 = Σ|xᵢ| · L2 = √Σxᵢ² · L∞ = máx|xᵢ|
L∞ ≤ L2 ≤ L1
Una norma asigna una magnitud a un vector cumpliendo tres condiciones: es positiva salvo en el cero, escala con el valor absoluto del escalar y satisface la desigualdad triangular. Hay infinitas normas; las tres de la familia Lp son las que se usan en la práctica.
La elección no es estética: cambia qué se penaliza. La L2 eleva al cuadrado, así que castiga desproporcionadamente los componentes grandes y tiende a repartir el valor entre todos. La L1 trata todos los componentes por igual y, usada como penalización, empuja los pequeños exactamente a cero. Esa diferencia es la que separa Ridge de Lasso (clases 283 y 284) y es puramente geométrica: la bola L1 tiene vértices sobre los ejes y el óptimo tiende a caer en ellos.
La L∞ solo mira el peor componente. Es la norma adecuada cuando lo que importa es garantizar que ningún error individual supere un umbral, y aparece en robustez adversarial: un ataque «acotado en L∞» limita cuánto puede cambiar cada píxel.
El orden L∞ ≤ L2 ≤ L1 se cumple siempre y conviene verificarlo numéricamente una vez. Explica que la misma perturbación parezca grande o pequeña según la norma con la que se mida, y por qué comparar magnitudes exige declarar la norma.
Tres normas del mismo vector.
v = (3, −4, 12)
L1 = 3 + 4 + 12 = 19
L2 = √(9 + 16 + 144) = √169 = 13
L∞ = máx(3, 4, 12) = 12
Orden: 12 ≤ 13 ≤ 19 ✓
Interpretación:
L1 penaliza la suma total de desviaciones → dispersión
L2 penaliza los componentes grandes → reparto
L∞ solo mira el peor componente → garantía
L1, L2 e L∞ sobre el mismo vector.
python classes/part-05-algebra-lineal-i-vectores-y-matrices/104-normas-y-distancias/lab.py
compmath run 104
vL1L2LinfL2_es_la_hipotenusaordenL1_induce_sparsidad{
"v": [
3.0,
-4.0,
12.0
],
"L1": 19.0,
"L2": 13.0,
"Linf": 12.0,
"L2_es_la_hipotenusa": true,
"orden": "L∞ ≤ L2 ≤ L1"
}
Regularización Ridge y Lasso, funciones de pérdida MSE y MAE, robustez adversarial acotada en L∞ y criterios de convergencia.
Cada capa densa es un producto matriz-vector. Los embeddings viven en subespacios y la similitud entre ellos es producto punto normalizado.
10.1111/j.2517-6161.1996.tb02080.x verificado en Crossref (2026-08-19).9780511804441 verificado en International ISBN Agency (2026-08-19).