🧮 Computational Mathematics

Inicio · Parte 09

Probabilidad y procesos aleatorios

universitario 20 clases 80 horas estimadas motor part09

Axiomas, probabilidad condicional, Bayes, variables aleatorias, esperanza, varianza, distribuciones clave, LGN, TCL, Monte Carlo y cadenas de Markov.

Panorama de la parte

La probabilidad es el lenguaje con el que se habla de lo que no se sabe. No mide ignorancia vaga: la mide con la misma precisión con la que el álgebra lineal mide una rotación. Esta parte construye ese lenguaje desde los axiomas hasta las cadenas de Markov, y en el camino desarma tres o cuatro confusiones que arruinan más análisis de datos que cualquier error de programación.

Las clases 181 a 186 son los cimientos. Un experimento aleatorio produce resultados de un espacio muestral, un evento es un subconjunto de ese espacio, y una probabilidad es una función que asigna números a eventos cumpliendo tres axiomas de Kolmogorov. Todo lo demás —la regla de la suma, la del producto, la probabilidad condicional, la independencia y el teorema de Bayes— se deduce de ahí. No hay nada más que memorizar.

El punto de inflexión es la clase 184, y merece detenerse: condicionar es cambiar de espacio muestral. P(A|B) no es una probabilidad distinta de A, es la probabilidad de A dentro de un mundo donde B ya ocurrió. De esa lectura sale de forma natural que P(A|B) y P(B|A) no tienen por qué parecerse en nada, y la clase 186 lo muestra con el ejemplo más costoso de la vida real: un test con 99 % de sensibilidad y 99 % de especificidad, aplicado a una enfermedad que afecta a 1 de cada 1000 personas, produce un positivo que solo acierta el 9 % de las veces. Diez falsos positivos por cada verdadero. Confundir esas dos probabilidades se llama falacia del fiscal y ha mandado gente a la cárcel.

Las clases 187 a 195 introducen las variables aleatorias y sus resúmenes. Una variable aleatoria no es una variable ni es aleatoria: es una función del espacio muestral a los números. Ese cambio de perspectiva permite hablar de esperanza, varianza, covarianza y correlación, y trabajar con distribuciones concretas —Bernoulli, binomial, Poisson, exponencial y normal— en vez de con espacios muestrales explícitos. Dos hechos hay que grabar: la esperanza es lineal siempre, incluso con variables dependientes; la varianza solo se suma bajo independencia.

Las clases 196 y 197 son los dos teoremas límite que sostienen toda la estadística. La ley de los grandes números dice que la media muestral converge a la media real; el teorema central del límite dice a qué velocidad y con qué forma. El TCL es el que explica por qué la campana de Gauss aparece en fenómenos que no tienen nada de gaussiano: si un resultado es la suma de muchos efectos pequeños e independientes, su distribución tiende a la normal, venga de donde venga.

Las clases 198 y 199 pasan a la simulación. Monte Carlo estima integrales y probabilidades muestreando, con un error que cae como 1/√n: cuadruplicar el número de muestras solo duplica la precisión, y esa lentitud es el precio a cambio de que la velocidad no dependa de la dimensión. Las cadenas de Markov formalizan los procesos sin memoria y su distribución estacionaria, que es la base de MCMC, de PageRank y del proceso de difusión que genera imágenes.

El vínculo con la inteligencia artificial es directo y no metafórico. Un modelo de lenguaje es literalmente una distribución condicional P(token | contexto); la temperatura de muestreo modifica esa distribución; un modelo de difusión es un proceso estocástico cuyo reverso se aprende; y toda función de pérdida por máxima verosimilitud es un enunciado probabilístico. Sin esta parte, el resto del programa se lee pero no se entiende.

Recorrido de la parte

Ideas centrales

Por qué importa en IA

Un modelo de lenguaje es una distribución condicional sobre el siguiente token; la difusión es un proceso estocástico con reverso aprendido.

Errores frecuentes

Secuencia de clases

#ClaseDemostración ejecutable
181 Experimentos, espacio muestral y eventos sample_space
182 Axiomas de probabilidad axioms
183 Reglas de suma y producto sum_product_rules
184 Probabilidad condicional conditional
185 Independencia independence
186 Teorema de Bayes bayes
187 Variables aleatorias discretas discrete_rv
188 Variables aleatorias continuas continuous_rv
189 Esperanza matemática expectation
190 Varianza y desviación estándar variance
191 Covarianza y correlación covariance_correlation
192 Bernoulli y binomial bernoulli_binomial
193 Poisson y exponencial poisson_exponential
194 Distribución normal normal_distribution
195 Distribuciones conjuntas y marginales joint_marginal
196 Ley de los grandes números law_large_numbers
197 Teorema central del límite central_limit
198 Métodos Monte Carlo monte_carlo
199 Cadenas de Markov markov_chains
200 Capstone: simulador probabilístico y bayesiano capstone_probabilistic_simulator

Ejecutar la parte completa

compmath run --part 09

Glosario de la parte (35 términos)

TérminoDefiniciónClase
Experimento aleatorio Procedimiento cuyo resultado no se puede predecir individualmente, pero sí describir en conjunto. 181
Espacio muestral Conjunto Ω de todos los resultados posibles de un experimento. Se escribe antes que cualquier cálculo. 181
Evento Subconjunto del espacio muestral. Ocurre si el resultado observado pertenece a él. 181
Axiomas de Kolmogorov P(A) ≥ 0, P(Ω) = 1 y aditividad para eventos disjuntos. Toda la teoría se deduce de estos tres. 182
Inclusión-exclusión P(A∪B) = P(A) + P(B) − P(A∩B). El término restado corrige el solapamiento contado dos veces. 183
Probabilidad condicional P(A|B) = P(A∩B)/P(B). Es la probabilidad de A dentro del espacio reducido a B. 184
Independencia A y B son independientes si P(A∩B) = P(A)·P(B). Se comprueba, no se supone. 185
Teorema de Bayes P(H|E) = P(E|H)·P(H)/P(E). Invierte el condicionamiento y actualiza una creencia con evidencia. 186
Probabilidad base Prevalencia del evento antes de ver evidencia. Ignorarla es la falacia de la tasa base. 186
Variable aleatoria Función que asigna un número a cada resultado del espacio muestral. Ni es variable ni es aleatoria. 187
Función de masa pmf. Asigna a cada valor discreto su probabilidad; todas suman 1. 187
Función de densidad pdf. Su integral sobre un intervalo da la probabilidad. Puede superar 1 sin contradicción. 188
Función de distribución cdf. F(x) = P(X ≤ x). Es no decreciente y va de 0 a 1. 188
Esperanza E[X] = Σ x·P(X=x). Media ponderada por probabilidad; es lineal incluso sin independencia. 189
Varianza Var(X) = E[(X−μ)²] = E[X²] − E[X]². Mide dispersión en unidades al cuadrado. 190
Corrección de Bessel Dividir entre n−1 en vez de n para que la varianza muestral sea un estimador insesgado. 190
Covarianza E[(X−μₓ)(Y−μᵧ)]. Mide variación conjunta; su valor depende de las unidades. 191
Correlación de Pearson Covarianza normalizada por las desviaciones. Vive en [−1, 1] y solo detecta relación lineal. 191
Ensayo de Bernoulli Experimento con dos resultados y probabilidad p de éxito. Ladrillo de la binomial. 192
Distribución binomial Número de éxitos en n ensayos independientes. Media np, varianza np(1−p). 192
Distribución de Poisson Cuenta eventos raros en un intervalo. Su media y su varianza valen ambas λ. 193
Falta de memoria Propiedad de la exponencial y la geométrica: P(X > s+t | X > s) = P(X > t). 193
Distribución normal Campana simétrica definida por μ y σ. Regla 68-95-99,7 dentro de una, dos y tres desviaciones. 194
Puntuación z z = (x − μ)/σ. Expresa un valor en desviaciones estándar y permite comparar escalas distintas. 194
Distribución conjunta Probabilidad de pares de valores. De ella se obtienen marginales sumando y condicionales dividiendo. 195
Distribución marginal Distribución de una variable obtenida sumando la conjunta sobre la otra. 195
Ley de los grandes números La media muestral converge a la esperanza cuando n crece. No dice nada de una muestra concreta. 196
Falacia del jugador Creer que los resultados pasados compensan a los futuros. La moneda no tiene memoria. 196
Teorema central del límite La media de n variables iid tiende a una normal de media μ y desviación σ/√n. 197
Error estándar σ/√n. Desviación estándar de la media muestral; cae como la raíz del tamaño. 197
Monte Carlo Estimar cantidades por muestreo aleatorio. Su error cae como 1/√n en cualquier dimensión. 198
Cadena de Markov Proceso donde el siguiente estado depende solo del actual, no de la historia previa. 199
Distribución estacionaria Vector π que cumple πP = π. Una cadena ergódica converge a él desde cualquier inicio. 199
Prior y posterior Creencia antes y después de ver datos. Bayes es la regla que lleva de una a otra. 200
Conjugación Prior y posterior de la misma familia. Beta es conjugada de la binomial y la actualización es sumar. 200

Bibliografía

Ver el motor en GitHub