Inicio · Parte 09
Axiomas, probabilidad condicional, Bayes, variables aleatorias, esperanza, varianza, distribuciones clave, LGN, TCL, Monte Carlo y cadenas de Markov.
La probabilidad es el lenguaje con el que se habla de lo que no se sabe. No mide ignorancia vaga: la mide con la misma precisión con la que el álgebra lineal mide una rotación. Esta parte construye ese lenguaje desde los axiomas hasta las cadenas de Markov, y en el camino desarma tres o cuatro confusiones que arruinan más análisis de datos que cualquier error de programación.
Las clases 181 a 186 son los cimientos. Un experimento aleatorio produce resultados de un espacio muestral, un evento es un subconjunto de ese espacio, y una probabilidad es una función que asigna números a eventos cumpliendo tres axiomas de Kolmogorov. Todo lo demás —la regla de la suma, la del producto, la probabilidad condicional, la independencia y el teorema de Bayes— se deduce de ahí. No hay nada más que memorizar.
El punto de inflexión es la clase 184, y merece detenerse: condicionar es cambiar de espacio muestral. P(A|B) no es una probabilidad distinta de A, es la probabilidad de A dentro de un mundo donde B ya ocurrió. De esa lectura sale de forma natural que P(A|B) y P(B|A) no tienen por qué parecerse en nada, y la clase 186 lo muestra con el ejemplo más costoso de la vida real: un test con 99 % de sensibilidad y 99 % de especificidad, aplicado a una enfermedad que afecta a 1 de cada 1000 personas, produce un positivo que solo acierta el 9 % de las veces. Diez falsos positivos por cada verdadero. Confundir esas dos probabilidades se llama falacia del fiscal y ha mandado gente a la cárcel.
Las clases 187 a 195 introducen las variables aleatorias y sus resúmenes. Una variable aleatoria no es una variable ni es aleatoria: es una función del espacio muestral a los números. Ese cambio de perspectiva permite hablar de esperanza, varianza, covarianza y correlación, y trabajar con distribuciones concretas —Bernoulli, binomial, Poisson, exponencial y normal— en vez de con espacios muestrales explícitos. Dos hechos hay que grabar: la esperanza es lineal siempre, incluso con variables dependientes; la varianza solo se suma bajo independencia.
Las clases 196 y 197 son los dos teoremas límite que sostienen toda la estadística. La ley de los grandes números dice que la media muestral converge a la media real; el teorema central del límite dice a qué velocidad y con qué forma. El TCL es el que explica por qué la campana de Gauss aparece en fenómenos que no tienen nada de gaussiano: si un resultado es la suma de muchos efectos pequeños e independientes, su distribución tiende a la normal, venga de donde venga.
Las clases 198 y 199 pasan a la simulación. Monte Carlo estima integrales y probabilidades muestreando, con un error que cae como 1/√n: cuadruplicar el número de muestras solo duplica la precisión, y esa lentitud es el precio a cambio de que la velocidad no dependa de la dimensión. Las cadenas de Markov formalizan los procesos sin memoria y su distribución estacionaria, que es la base de MCMC, de PageRank y del proceso de difusión que genera imágenes.
El vínculo con la inteligencia artificial es directo y no metafórico. Un modelo de lenguaje es literalmente una distribución condicional P(token | contexto); la temperatura de muestreo modifica esa distribución; un modelo de difusión es un proceso estocástico cuyo reverso se aprende; y toda función de pérdida por máxima verosimilitud es un enunciado probabilístico. Sin esta parte, el resto del programa se lee pero no se entiende.
| # | Clase | Demostración ejecutable |
|---|---|---|
181 |
Experimentos, espacio muestral y eventos | sample_space |
182 |
Axiomas de probabilidad | axioms |
183 |
Reglas de suma y producto | sum_product_rules |
184 |
Probabilidad condicional | conditional |
185 |
Independencia | independence |
186 |
Teorema de Bayes | bayes |
187 |
Variables aleatorias discretas | discrete_rv |
188 |
Variables aleatorias continuas | continuous_rv |
189 |
Esperanza matemática | expectation |
190 |
Varianza y desviación estándar | variance |
191 |
Covarianza y correlación | covariance_correlation |
192 |
Bernoulli y binomial | bernoulli_binomial |
193 |
Poisson y exponencial | poisson_exponential |
194 |
Distribución normal | normal_distribution |
195 |
Distribuciones conjuntas y marginales | joint_marginal |
196 |
Ley de los grandes números | law_large_numbers |
197 |
Teorema central del límite | central_limit |
198 |
Métodos Monte Carlo | monte_carlo |
199 |
Cadenas de Markov | markov_chains |
200 |
Capstone: simulador probabilístico y bayesiano | capstone_probabilistic_simulator |
compmath run --part 09
| Término | Definición | Clase |
|---|---|---|
| Experimento aleatorio | Procedimiento cuyo resultado no se puede predecir individualmente, pero sí describir en conjunto. | 181 |
| Espacio muestral | Conjunto Ω de todos los resultados posibles de un experimento. Se escribe antes que cualquier cálculo. | 181 |
| Evento | Subconjunto del espacio muestral. Ocurre si el resultado observado pertenece a él. | 181 |
| Axiomas de Kolmogorov | P(A) ≥ 0, P(Ω) = 1 y aditividad para eventos disjuntos. Toda la teoría se deduce de estos tres. | 182 |
| Inclusión-exclusión | P(A∪B) = P(A) + P(B) − P(A∩B). El término restado corrige el solapamiento contado dos veces. | 183 |
| Probabilidad condicional | P(A|B) = P(A∩B)/P(B). Es la probabilidad de A dentro del espacio reducido a B. | 184 |
| Independencia | A y B son independientes si P(A∩B) = P(A)·P(B). Se comprueba, no se supone. | 185 |
| Teorema de Bayes | P(H|E) = P(E|H)·P(H)/P(E). Invierte el condicionamiento y actualiza una creencia con evidencia. | 186 |
| Probabilidad base | Prevalencia del evento antes de ver evidencia. Ignorarla es la falacia de la tasa base. | 186 |
| Variable aleatoria | Función que asigna un número a cada resultado del espacio muestral. Ni es variable ni es aleatoria. | 187 |
| Función de masa | pmf. Asigna a cada valor discreto su probabilidad; todas suman 1. | 187 |
| Función de densidad | pdf. Su integral sobre un intervalo da la probabilidad. Puede superar 1 sin contradicción. | 188 |
| Función de distribución | cdf. F(x) = P(X ≤ x). Es no decreciente y va de 0 a 1. | 188 |
| Esperanza | E[X] = Σ x·P(X=x). Media ponderada por probabilidad; es lineal incluso sin independencia. | 189 |
| Varianza | Var(X) = E[(X−μ)²] = E[X²] − E[X]². Mide dispersión en unidades al cuadrado. | 190 |
| Corrección de Bessel | Dividir entre n−1 en vez de n para que la varianza muestral sea un estimador insesgado. | 190 |
| Covarianza | E[(X−μₓ)(Y−μᵧ)]. Mide variación conjunta; su valor depende de las unidades. | 191 |
| Correlación de Pearson | Covarianza normalizada por las desviaciones. Vive en [−1, 1] y solo detecta relación lineal. | 191 |
| Ensayo de Bernoulli | Experimento con dos resultados y probabilidad p de éxito. Ladrillo de la binomial. | 192 |
| Distribución binomial | Número de éxitos en n ensayos independientes. Media np, varianza np(1−p). | 192 |
| Distribución de Poisson | Cuenta eventos raros en un intervalo. Su media y su varianza valen ambas λ. | 193 |
| Falta de memoria | Propiedad de la exponencial y la geométrica: P(X > s+t | X > s) = P(X > t). | 193 |
| Distribución normal | Campana simétrica definida por μ y σ. Regla 68-95-99,7 dentro de una, dos y tres desviaciones. | 194 |
| Puntuación z | z = (x − μ)/σ. Expresa un valor en desviaciones estándar y permite comparar escalas distintas. | 194 |
| Distribución conjunta | Probabilidad de pares de valores. De ella se obtienen marginales sumando y condicionales dividiendo. | 195 |
| Distribución marginal | Distribución de una variable obtenida sumando la conjunta sobre la otra. | 195 |
| Ley de los grandes números | La media muestral converge a la esperanza cuando n crece. No dice nada de una muestra concreta. | 196 |
| Falacia del jugador | Creer que los resultados pasados compensan a los futuros. La moneda no tiene memoria. | 196 |
| Teorema central del límite | La media de n variables iid tiende a una normal de media μ y desviación σ/√n. | 197 |
| Error estándar | σ/√n. Desviación estándar de la media muestral; cae como la raíz del tamaño. | 197 |
| Monte Carlo | Estimar cantidades por muestreo aleatorio. Su error cae como 1/√n en cualquier dimensión. | 198 |
| Cadena de Markov | Proceso donde el siguiente estado depende solo del actual, no de la historia previa. | 199 |
| Distribución estacionaria | Vector π que cumple πP = π. Una cadena ergódica converge a él desde cualquier inicio. | 199 |
| Prior y posterior | Creencia antes y después de ver datos. Bayes es la regla que lleva de una a otra. | 200 |
| Conjugación | Prior y posterior de la misma familia. Beta es conjugada de la binomial y la actualización es sumar. | 200 |