Inicio · Parte 09 — Probabilidad y procesos aleatorios
x̄ₙ → μ cuando n → ∞
error típico ≈ σ/√n
cuadruplicar n reduce el error a la mitad
La ley de los grandes números es el puente entre probabilidad y realidad: garantiza que promediar muchas observaciones independientes acerca la media muestral a la esperanza teórica. Sin ella, la probabilidad sería un juego formal sin conexión con los datos, y ninguna simulación tendría sentido.
Lo que la ley no dice es igual de importante. No dice que las desviaciones se compensen: si han salido diez caras seguidas, la moneda no «debe» ahora cruces. La convergencia ocurre porque las primeras observaciones se diluyen al crecer el denominador, no porque algo las corrija. Creer lo contrario es la falacia del jugador.
Tampoco garantiza nada sobre una muestra concreta. Es un enunciado asintótico: para cualquier margen de error, existe un n a partir del cual la desviación es improbable. Ese n puede ser enorme si la varianza es grande, y para distribuciones sin media finita —como la Cauchy— la ley sencillamente no se cumple.
La velocidad es la parte que más cuesta aceptar en la práctica. El error típico cae como σ/√n, de modo que pasar de 1000 a 4000 muestras solo reduce el error a la mitad, y ganar un dígito decimal cuesta multiplicar por cien el trabajo. Esa raíz cuadrada es la que gobierna el coste de toda simulación Monte Carlo.
Media muestral de una uniforme en el intervalo unitario.
distribución: Uniforme(0,1) media real = 0,5
n media error
10 0,607062 0,107062
100 0,509220 0,009220
1 000 0,503115 0,003115
10 000 0,500987 0,000987
El error cae aproximadamente como 1/√n:
de n=100 a n=10 000 → n × 100 → error / 10 ✓
Nada garantiza que una muestra concreta se comporte:
con n = 10 el error fue del 21 %.
La media muestral converge, pero lentamente.
python classes/part-09-probabilidad-y-procesos-aleatorios/196-ley-de-los-grandes-numeros/lab.py
compmath run 196
distribucioninformevelocidadcuadruplicar_n_reduce_el_error_a_la_mitadno_garantiza_ninguna_muestra_concreta{
"distribucion": "Uniforme(0,1), media 0.5",
"informe": [
{
"n": 10,
"media": 0.607062,
"error": 0.107062
},
{
"n": 100,
"media": 0.508776,
"error": 0.008776
},
{
"n": 1000,
"media": 0.508674,
"error": 0.008674
},
{
"n": 10000,
"media": 0.505849,
"error": 0.005849
},
{
"n": 50000,
"media": 0.501256,
"error": 0.001256
}
],
"velocidad": "el error cae como 1/√n",
"cuadruplicar_n_reduce_el_error_a_la_mitad": true,
"no_garantiza_ninguna_muestra_concreta": true
}
Justificación de la simulación, validación de estimadores, dimensionamiento de tests A/B y tamaño de lote en descenso estocástico.
Un modelo de lenguaje es una distribución condicional sobre el siguiente token; la difusión es un proceso estocástico con reverso aprendido.