🧮 Computational Mathematics

Inicio · Parte 10

Estadística e inferencia

universitario-avanzado 20 clases 80 horas estimadas motor part10

Descriptiva, muestreo, estimadores, intervalos de confianza, pruebas de hipótesis, p-value, potencia, verosimilitud, MAP, inferencia bayesiana, bootstrap y A/B testing.

Panorama de la parte

La probabilidad va de la causa al efecto: dado un modelo, ¿qué datos son plausibles? La estadística recorre el camino inverso: dados unos datos, ¿qué modelo los explica y con cuánta confianza? Esa inversión es más difícil, más frágil y más fácil de hacer mal, y es donde se pierde la mayor parte de la credibilidad de los resultados publicados.

Las clases 201 a 204 preparan el terreno. La estadística descriptiva resume; el muestreo condiciona todo lo que vendrá después. La lección más cara está en la clase 202: el sesgo de selección no se corrige con más datos. Una muestra sesgada de un millón de personas es peor que una muestra aleatoria de mil, porque el error sistemático no se diluye al crecer n, y encima la mayor precisión hace más convincente la conclusión equivocada.

Las clases 205 a 209 son el núcleo de la inferencia frecuentista y contienen los tres errores de interpretación más extendidos de toda la ciencia aplicada. Un intervalo de confianza del 95 % no dice que el parámetro esté ahí con probabilidad 0,95: describe un procedimiento que, repetido muchas veces, atrapa el parámetro el 95 % de las veces. Un p-value no es la probabilidad de que la hipótesis nula sea cierta: es la probabilidad de ver datos así de extremos si la nula fuera cierta. Y un resultado no significativo en un estudio sin potencia declarada no significa nada: no distingue entre «no hay efecto» y «no había datos suficientes para verlo».

Las clases 210 a 214 son las pruebas de trabajo: t-test para medias, chi-cuadrado para tablas de contingencia, ANOVA para varios grupos y regresión lineal con su lectura estadística. Cada una tiene supuestos, y aplicarlas sin comprobarlos es la forma habitual de producir p-values que no significan lo que parece. La clase 213 se dedica entera a la confusión más famosa: correlación no implica causalidad, y un confusor basta para fabricar una correlación fuerte entre dos variables que no se tocan.

Las clases 215 a 218 introducen el punto de vista de la verosimilitud y el bayesiano. La máxima verosimilitud es el principio que fundamenta casi toda función de pérdida en aprendizaje automático; MAP le añade un prior, y ese prior es la regularización. La inferencia bayesiana devuelve una distribución entera sobre el parámetro, y su intervalo creíble sí admite la lectura probabilística que el intervalo de confianza no admite. El bootstrap cierra el bloque con una idea casi tramposa por lo simple: remuestrear los propios datos para estimar la variabilidad, sin suponer ninguna distribución poblacional.

El cierre (219 y 220) baja a la práctica: A/B testing con tamaño muestral calculado de antemano, y un estudio completo, reproducible, con semilla fija, intervalos declarados y limitaciones explícitas. Esa disciplina —fijar el análisis antes de ver los datos, reportar la incertidumbre, corregir por comparaciones múltiples y declarar lo que el estudio no puede concluir— es lo que separa un resultado de una anécdota con números.

Para quien viene de la inteligencia artificial, esta parte es la que enseña a evaluar. Comparar dos modelos por su exactitud puntual sin intervalo de confianza, elegir la mejor configuración entre veinte y reportar su rendimiento sin corregir por selección, o medir sobre datos que participaron en el ajuste, son exactamente los errores que esta parte nombra y desarma.

Recorrido de la parte

Ideas centrales

Por qué importa en IA

Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.

Errores frecuentes

Secuencia de clases

#ClaseDemostración ejecutable
201 Estadística descriptiva descriptive_statistics
202 Población, muestra y sesgo de selección population_sample
203 Muestreo y distribuciones muestrales sampling_distributions
204 Estimadores y propiedades estimators
205 Intervalos de confianza confidence_intervals
206 Pruebas de hipótesis hypothesis_testing
207 p-value correctamente interpretado p_value
208 Errores tipo I y II type_errors
209 Potencia estadística statistical_power
210 t-test y comparación de medias t_test
211 Chi-cuadrado y tablas de contingencia chi_square
212 ANOVA anova
213 Correlación frente a causalidad correlation_causation
214 Regresión lineal estadística linear_regression_stats
215 Máxima verosimilitud maximum_likelihood
216 Estimación MAP map_estimation
217 Inferencia bayesiana bayesian_inference
218 Bootstrap y remuestreo bootstrap
219 A/B testing y diseño experimental ab_testing
220 Capstone: estudio estadístico reproducible capstone_reproducible_study

Ejecutar la parte completa

compmath run --part 10

Glosario de la parte (36 términos)

TérminoDefiniciónClase
Media, mediana y moda Tres medidas de centro. La mediana resiste valores extremos; la media no. 201
Rango intercuartílico Q3 − Q1. Dispersión robusta que ignora el 25 % de cada cola. 201
Asimetría Sesgo de la distribución. Con cola derecha la media supera a la mediana. 201
Sesgo de selección La muestra no representa a la población. No se corrige aumentando el tamaño. 202
Sesgo del superviviente Analizar solo los casos que llegaron al final, ignorando los que desaparecieron. 202
Distribución muestral Distribución de un estadístico al repetir el muestreo. Es el objeto que hace posible inferir. 203
Error estándar Desviación típica de un estimador. Para la media vale σ/√n. 203
Estimador insesgado Aquel cuya esperanza coincide con el parámetro. No implica que sea bueno. 204
Consistencia El estimador converge al parámetro cuando n crece. Es una garantía asintótica. 204
Intervalo de confianza Procedimiento que, repetido, contiene el parámetro en el 95 % de los casos. No es una probabilidad del parámetro. 205
Hipótesis nula Enunciado de ausencia de efecto que se somete a prueba. Nunca se acepta, solo se rechaza o no. 206
Estadístico de contraste Número calculado de la muestra cuya distribución bajo H0 se conoce. 206
p-value P(estadístico tan o más extremo | H0 cierta). Nunca es P(H0 | datos). 207
p-hacking Probar variantes de análisis hasta obtener p < 0,05. Invalida el significado del p-value. 207
Error tipo I Rechazar una H0 verdadera. Su tasa es α, elegida de antemano. 208
Error tipo II No rechazar una H0 falsa. Su tasa es β y depende del tamaño del efecto y de n. 208
Potencia 1 − β. Probabilidad de detectar un efecto real. Sin ella, un no significativo no informa. 209
Tamaño del efecto Magnitud de la diferencia en unidades de desviación, como la d de Cohen. Independiente de n. 209
t de Student Contraste de medias con varianza desconocida. Sus colas son más pesadas que las de la normal. 210
Grados de libertad Número de valores libres tras imponer las restricciones del modelo. 210
Chi-cuadrado Contraste que compara frecuencias observadas con esperadas en una tabla. 211
Tabla de contingencia Recuento cruzado de dos variables categóricas. 211
ANOVA Compara varias medias descomponiendo la variabilidad entre grupos y dentro de ellos. 212
Comparaciones múltiples Al hacer k contrastes, la probabilidad de algún falso positivo crece; exige corrección. 212
Variable de confusión Causa común de dos variables que genera correlación sin relación causal directa. 213
Aleatorización Asignar el tratamiento al azar para romper la influencia de confusores conocidos y desconocidos. 213
Coeficiente de determinación R². Proporción de la variabilidad explicada por el modelo. Un R² alto no valida el modelo. 214
Residuo Diferencia entre valor observado y predicho. Su patrón revela los fallos del modelo. 214
Máxima verosimilitud Elegir el parámetro que hace más probables los datos observados. 215
Log-verosimilitud Logaritmo de la verosimilitud. Convierte productos en sumas y evita el subdesbordamiento. 215
Estimación MAP Máximo de la posterior: verosimilitud por prior. El prior actúa como regularización. 216
Intervalo creíble Región que contiene el parámetro con probabilidad dada bajo la posterior. Sí es una probabilidad del parámetro. 217
Prior conjugado Prior cuya posterior pertenece a la misma familia. Beta es conjugado de la binomial. 217
Bootstrap Remuestrear con reposición los propios datos para estimar la variabilidad de un estadístico. 218
Lift Mejora relativa de la variante frente al control en un experimento. 219
Preinscripción del análisis Fijar hipótesis, métrica y tamaño muestral antes de recoger datos. Bloquea el p-hacking. 220

Bibliografía

Ver el motor en GitHub