Inicio · Parte 02 — Álgebra y funciones
ReLU(x) = max(0, x)
continuidad en el corte: límite por la izquierda = límite por la derecha = valor
Definir una función por tramos es lo natural cuando el fenómeno cambia de régimen: una tarifa con tramos, un impuesto progresivo, una penalización que solo actúa por encima de un umbral. La única pregunta técnica es qué ocurre en los puntos de corte, y ahí hay que comprobar dos cosas: si la función es continua (los límites laterales coinciden con el valor) y si es derivable (las pendientes laterales coinciden).
Continua y derivable no son lo mismo. ReLU es continua en 0 —ambos lados tienden a 0— pero no derivable, porque la pendiente salta de 0 a 1. En la práctica, los frameworks definen la derivada en 0 por convenio (habitualmente 0), y eso funciona porque el punto exacto tiene medida nula.
ReLU es la activación más usada en deep learning y es literalmente una función por tramos. Su éxito frente a la sigmoide tiene una explicación directa que la clase 303 desarrolla: su derivada vale exactamente 1 en el semieje positivo, así que el gradiente no se atenúa al propagarse por muchas capas. La sigmoide, cuya derivada máxima es 0.25, hace que el gradiente se desvanezca (clase 314).
La contrapartida también es visible aquí: para x < 0 la derivada de ReLU es 0, así que una neurona que caiga en esa región deja de recibir gradiente y «muere». Leaky ReLU —otro tramo, con pendiente pequeña en lugar de nula— existe para evitarlo.
Analizar una función de tres tramos.
f(x) = |x| si x < 0
x² si 0 ≤ x < 2
4 si x ≥ 2
f(−3) = 3
f(0) = 0
f(1.999) = 3.996
f(2) = 4
Continuidad en x = 0: lím⁻ = 0, lím⁺ = 0, f(0) = 0 ✓
Continuidad en x = 2: lím⁻ = 4, lím⁺ = 4, f(2) = 4 ✓
Derivabilidad en x = 0:
pendiente por la izquierda: −1
pendiente por la derecha: 0 ✗ no derivable
Una función por tramos y su continuidad en el punto de corte.
python classes/part-02-algebra-y-funciones/059-funciones-por-tramos/lab.py
compmath run 059
definicionf(-3)f(0)f(1.999)f(2)continua_en_0continua_en_2relu_es_por_tramos{
"definicion": "|x| si x<0; x² si 0<=x<2; 4 si x>=2",
"f(-3)": 3.0,
"f(0)": 0.0,
"f(1.999)": 3.9960010000000006,
"f(2)": 4.0,
"continua_en_0": true
}
Activaciones ReLU y Leaky ReLU, funciones de pérdida robustas como Huber (clase 304), tarifas por tramos e impuestos progresivos.
Una red neuronal es una composición de funciones parametrizadas. La sigmoide, la softmax y la log-verosimilitud son álgebra de exponenciales y logaritmos.
9780262337373 verificado en International ISBN Agency (2026-08-19).