Inicio · Parte 10
Descriptiva, muestreo, estimadores, intervalos de confianza, pruebas de hipótesis, p-value, potencia, verosimilitud, MAP, inferencia bayesiana, bootstrap y A/B testing.
La probabilidad va de la causa al efecto: dado un modelo, ¿qué datos son plausibles? La estadística recorre el camino inverso: dados unos datos, ¿qué modelo los explica y con cuánta confianza? Esa inversión es más difícil, más frágil y más fácil de hacer mal, y es donde se pierde la mayor parte de la credibilidad de los resultados publicados.
Las clases 201 a 204 preparan el terreno. La estadística descriptiva resume; el muestreo condiciona todo lo que vendrá después. La lección más cara está en la clase 202: el sesgo de selección no se corrige con más datos. Una muestra sesgada de un millón de personas es peor que una muestra aleatoria de mil, porque el error sistemático no se diluye al crecer n, y encima la mayor precisión hace más convincente la conclusión equivocada.
Las clases 205 a 209 son el núcleo de la inferencia frecuentista y contienen los tres errores de interpretación más extendidos de toda la ciencia aplicada. Un intervalo de confianza del 95 % no dice que el parámetro esté ahí con probabilidad 0,95: describe un procedimiento que, repetido muchas veces, atrapa el parámetro el 95 % de las veces. Un p-value no es la probabilidad de que la hipótesis nula sea cierta: es la probabilidad de ver datos así de extremos si la nula fuera cierta. Y un resultado no significativo en un estudio sin potencia declarada no significa nada: no distingue entre «no hay efecto» y «no había datos suficientes para verlo».
Las clases 210 a 214 son las pruebas de trabajo: t-test para medias, chi-cuadrado para tablas de contingencia, ANOVA para varios grupos y regresión lineal con su lectura estadística. Cada una tiene supuestos, y aplicarlas sin comprobarlos es la forma habitual de producir p-values que no significan lo que parece. La clase 213 se dedica entera a la confusión más famosa: correlación no implica causalidad, y un confusor basta para fabricar una correlación fuerte entre dos variables que no se tocan.
Las clases 215 a 218 introducen el punto de vista de la verosimilitud y el bayesiano. La máxima verosimilitud es el principio que fundamenta casi toda función de pérdida en aprendizaje automático; MAP le añade un prior, y ese prior es la regularización. La inferencia bayesiana devuelve una distribución entera sobre el parámetro, y su intervalo creíble sí admite la lectura probabilística que el intervalo de confianza no admite. El bootstrap cierra el bloque con una idea casi tramposa por lo simple: remuestrear los propios datos para estimar la variabilidad, sin suponer ninguna distribución poblacional.
El cierre (219 y 220) baja a la práctica: A/B testing con tamaño muestral calculado de antemano, y un estudio completo, reproducible, con semilla fija, intervalos declarados y limitaciones explícitas. Esa disciplina —fijar el análisis antes de ver los datos, reportar la incertidumbre, corregir por comparaciones múltiples y declarar lo que el estudio no puede concluir— es lo que separa un resultado de una anécdota con números.
Para quien viene de la inteligencia artificial, esta parte es la que enseña a evaluar. Comparar dos modelos por su exactitud puntual sin intervalo de confianza, elegir la mejor configuración entre veinte y reportar su rendimiento sin corregir por selección, o medir sobre datos que participaron en el ajuste, son exactamente los errores que esta parte nombra y desarma.
| # | Clase | Demostración ejecutable |
|---|---|---|
201 |
Estadística descriptiva | descriptive_statistics |
202 |
Población, muestra y sesgo de selección | population_sample |
203 |
Muestreo y distribuciones muestrales | sampling_distributions |
204 |
Estimadores y propiedades | estimators |
205 |
Intervalos de confianza | confidence_intervals |
206 |
Pruebas de hipótesis | hypothesis_testing |
207 |
p-value correctamente interpretado | p_value |
208 |
Errores tipo I y II | type_errors |
209 |
Potencia estadística | statistical_power |
210 |
t-test y comparación de medias | t_test |
211 |
Chi-cuadrado y tablas de contingencia | chi_square |
212 |
ANOVA | anova |
213 |
Correlación frente a causalidad | correlation_causation |
214 |
Regresión lineal estadística | linear_regression_stats |
215 |
Máxima verosimilitud | maximum_likelihood |
216 |
Estimación MAP | map_estimation |
217 |
Inferencia bayesiana | bayesian_inference |
218 |
Bootstrap y remuestreo | bootstrap |
219 |
A/B testing y diseño experimental | ab_testing |
220 |
Capstone: estudio estadístico reproducible | capstone_reproducible_study |
compmath run --part 10
| Término | Definición | Clase |
|---|---|---|
| Media, mediana y moda | Tres medidas de centro. La mediana resiste valores extremos; la media no. | 201 |
| Rango intercuartílico | Q3 − Q1. Dispersión robusta que ignora el 25 % de cada cola. | 201 |
| Asimetría | Sesgo de la distribución. Con cola derecha la media supera a la mediana. | 201 |
| Sesgo de selección | La muestra no representa a la población. No se corrige aumentando el tamaño. | 202 |
| Sesgo del superviviente | Analizar solo los casos que llegaron al final, ignorando los que desaparecieron. | 202 |
| Distribución muestral | Distribución de un estadístico al repetir el muestreo. Es el objeto que hace posible inferir. | 203 |
| Error estándar | Desviación típica de un estimador. Para la media vale σ/√n. | 203 |
| Estimador insesgado | Aquel cuya esperanza coincide con el parámetro. No implica que sea bueno. | 204 |
| Consistencia | El estimador converge al parámetro cuando n crece. Es una garantía asintótica. | 204 |
| Intervalo de confianza | Procedimiento que, repetido, contiene el parámetro en el 95 % de los casos. No es una probabilidad del parámetro. | 205 |
| Hipótesis nula | Enunciado de ausencia de efecto que se somete a prueba. Nunca se acepta, solo se rechaza o no. | 206 |
| Estadístico de contraste | Número calculado de la muestra cuya distribución bajo H0 se conoce. | 206 |
| p-value | P(estadístico tan o más extremo | H0 cierta). Nunca es P(H0 | datos). | 207 |
| p-hacking | Probar variantes de análisis hasta obtener p < 0,05. Invalida el significado del p-value. | 207 |
| Error tipo I | Rechazar una H0 verdadera. Su tasa es α, elegida de antemano. | 208 |
| Error tipo II | No rechazar una H0 falsa. Su tasa es β y depende del tamaño del efecto y de n. | 208 |
| Potencia | 1 − β. Probabilidad de detectar un efecto real. Sin ella, un no significativo no informa. | 209 |
| Tamaño del efecto | Magnitud de la diferencia en unidades de desviación, como la d de Cohen. Independiente de n. | 209 |
| t de Student | Contraste de medias con varianza desconocida. Sus colas son más pesadas que las de la normal. | 210 |
| Grados de libertad | Número de valores libres tras imponer las restricciones del modelo. | 210 |
| Chi-cuadrado | Contraste que compara frecuencias observadas con esperadas en una tabla. | 211 |
| Tabla de contingencia | Recuento cruzado de dos variables categóricas. | 211 |
| ANOVA | Compara varias medias descomponiendo la variabilidad entre grupos y dentro de ellos. | 212 |
| Comparaciones múltiples | Al hacer k contrastes, la probabilidad de algún falso positivo crece; exige corrección. | 212 |
| Variable de confusión | Causa común de dos variables que genera correlación sin relación causal directa. | 213 |
| Aleatorización | Asignar el tratamiento al azar para romper la influencia de confusores conocidos y desconocidos. | 213 |
| Coeficiente de determinación | R². Proporción de la variabilidad explicada por el modelo. Un R² alto no valida el modelo. | 214 |
| Residuo | Diferencia entre valor observado y predicho. Su patrón revela los fallos del modelo. | 214 |
| Máxima verosimilitud | Elegir el parámetro que hace más probables los datos observados. | 215 |
| Log-verosimilitud | Logaritmo de la verosimilitud. Convierte productos en sumas y evita el subdesbordamiento. | 215 |
| Estimación MAP | Máximo de la posterior: verosimilitud por prior. El prior actúa como regularización. | 216 |
| Intervalo creíble | Región que contiene el parámetro con probabilidad dada bajo la posterior. Sí es una probabilidad del parámetro. | 217 |
| Prior conjugado | Prior cuya posterior pertenece a la misma familia. Beta es conjugado de la binomial. | 217 |
| Bootstrap | Remuestrear con reposición los propios datos para estimar la variabilidad de un estadístico. | 218 |
| Lift | Mejora relativa de la variante frente al control en un experimento. | 219 |
| Preinscripción del análisis | Fijar hipótesis, métrica y tamaño muestral antes de recoger datos. Bloquea el p-hacking. | 220 |