Inicio · Parte 09 — Probabilidad y procesos aleatorios
E[X] = Σ x·p(x) ó ∫ x·f(x) dx
E[aX + bY] = a·E[X] + b·E[Y] sin exigir independencia
en general E[g(X)] ≠ g(E[X])
La esperanza es la media ponderada por probabilidad: el valor alrededor del cual se equilibra la distribución. No tiene por qué ser un valor posible —la esperanza de un dado es 3,5— porque describe el comportamiento agregado, no un resultado individual.
Su propiedad más útil es la linealidad, y es más fuerte de lo que suele recordarse: E[X + Y] = E[X] + E[Y] vale siempre, sin ninguna hipótesis de independencia. Esa generosidad convierte problemas aparentemente imposibles en sumas triviales: el número esperado de puntos fijos de una permutación aleatoria es 1, y se obtiene sumando indicadores fuertemente dependientes.
Lo que no vale es intercambiar la esperanza con una función no lineal. E[X²] ≠ E[X]², y la diferencia entre ambas es exactamente la varianza. Para funciones convexas, la desigualdad de Jensen dice que E[g(X)] ≥ g(E[X]), y ese detalle es el que separa la media de los logaritmos del logaritmo de la media en toda derivación de ELBO o de verosimilitud.
En aprendizaje automático la esperanza está en la definición misma del objetivo: el riesgo es E[pérdida] sobre la distribución de datos, y como esa distribución es desconocida se estima con la media empírica. Toda la teoría del aprendizaje trata de cuánto se parece esa media a la esperanza que se quería minimizar.
Uniforme en el intervalo unitario: teoría frente a simulación.
X ~ Uniforme(0,1)
teórico simulado con 10⁶ muestras
E[X] = 0,5 0,499912
E[X²] = 1/3 0,333282
E[X]² = 0,25 ≠ E[X²] = 0,3333
diferencia = 0,3333 − 0,25 = 0,0833 = 1/12 = Var(X) ✓
Linealidad sin independencia:
E[X + X] = 2·E[X] = 1,0 aunque X no es independiente de sí misma
Linealidad de la esperanza, incluso sin independencia.
python classes/part-09-probabilidad-y-procesos-aleatorios/189-esperanza-matematica/lab.py
compmath run 189
E[X]_teorica_uniformeE[X]_muestralE[X²]_teoricaE[X²]_muestralE[X]²E[X²]≠E[X]²E[2X+3Y]2E[X]+3E[Y]linealidad_sin_independencia{
"E[X]_teorica_uniforme": 0.5,
"E[X]_muestral": 0.499912,
"E[X²]_teorica": 0.333333,
"E[X²]_muestral": 0.333282,
"E[X]²": 0.249912,
"E[X²]≠E[X]²": true
}
Riesgo esperado en aprendizaje, valoración de apuestas y carteras, análisis del tiempo medio de ejecución y estimadores de gradiente por muestreo.
Un modelo de lenguaje es una distribución condicional sobre el siguiente token; la difusión es un proceso estocástico con reverso aprendido.
9780134753119 verificado en International ISBN Agency (2026-08-20).