🧮 Computational Mathematics

Inicio · Parte 10 — Estadística e inferencia

203 — Muestreo y distribuciones muestrales

universitario-avanzado clase 3 de 20 4 horas demostración sampling_distributions

El estadístico también tiene distribución, y esa distribución es la que permite inferir.

Fórmulas

x̄ ~ Normal(μ, σ²/n)  para n grande
SE = σ/√n
n × 4  ⟹  SE / 2

Desarrollo

La idea que abre la inferencia es un cambio de nivel: si se repitiera el muestreo muchas veces, cada muestra daría una media distinta, y esas medias tienen su propia distribución. Esa es la distribución muestral, y es el objeto sobre el que se construyen intervalos y contrastes.

Su desviación estándar recibe el nombre de error estándar para distinguirla de la desviación de los datos. Son cantidades distintas que se confunden constantemente: σ dice cuánto varía una observación individual, σ/√n cuánto varía la estimación de la media. Con n = 100 difieren por un factor 10.

La forma de esa distribución la garantiza el teorema central del límite de la clase 197: es aproximadamente normal aunque la población no lo sea. Por eso las mismas fórmulas funcionan para datos de origen muy variado, y por eso la normal aparece en todas partes en estadística sin que nadie suponga que los datos son normales.

La raíz cuadrada tiene consecuencias económicas directas. Reducir a la mitad el error exige cuadruplicar el tamaño muestral, y eso normalmente significa cuadruplicar el coste del experimento. Saber esto antes de diseñar un estudio evita descubrir a mitad de camino que el presupuesto no alcanza para la precisión prometida.

Ejemplo trabajado

Muestras de una población normal de media 50 y desviación 10.

población: Normal(50, 10)

   n     media de medias   SE observado   SE teórico σ/√n
   5         49,9483          4,4782          4,4721
  20         50,0142          2,2380          2,2361
  80         49,9911          1,1145          1,1180
 320         50,0037          0,5581          0,5590

La media de las medias acierta siempre; lo que cambia es la dispersión.

n de 5 a 20  → ×4  → SE de 4,47 a 2,24  → mitad         ✓
n de 20 a 80 → ×4  → SE de 2,24 a 1,11  → mitad         ✓

Qué calcula el laboratorio

La distribución de la media muestral y su error estándar.

python classes/part-10-estadistica-e-inferencia/203-muestreo-y-distribuciones-muestrales/lab.py
compmath run 203

Salidas del laboratorio (4)

Muestra de la ejecución real

{
  "poblacion": "Normal(50, 10)",
  "informe": [
    {
      "n": 5,
      "media_de_medias": 49.9483,
      "desviacion_observada": 4.4782,
      "error_estandar_teorico": 4.4721
    },
    {
      "n": 30,
      "media_de_medias": 50.0689,
      "desviacion_observada": 1.8342,
      "error_estandar_teorico": 1.8257
    },
    {
      "n": 100,
      "media_de_medias": 49.9936,
      "desviacion_observada": 0.994,
      "error_estandar_teorico": 1.0
    }
  ],
  "regla": "SE = σ/√n",
  "cuadruplicar_n_reduce_SE_a_la_mitad": true
}

Errores comunes

Dónde se usa

Dimensionado de experimentos, barras de error en gráficos, comparación de métricas entre modelos y control de precisión en simulaciones.

Idea rectora de la parte

Sin potencia declarada, un resultado no significativo no dice nada.

Error a evitar

Evaluar sobre datos que participaron en la selección del modelo.

Conexión con IA

Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.

Bibliografía de la clase

Archivos de la clase