🧮 Computational Mathematics

Inicio · Parte 14 — Matemática de Machine Learning

292 — Random Forest desde probabilidad

ml-avanzado clase 12 de 20 4 horas demostración random_forest

Promediar modelos solo reduce la varianza en la medida en que estén decorrelacionados.

Fórmulas

Var(media de k modelos) = ρσ² + (1−ρ)σ²/k
ρ = 0  ⟹  varianza / k
ρ = 1  ⟹  no hay ganancia

Desarrollo

El bagging entrena varios modelos sobre remuestras bootstrap de los datos y promedia sus predicciones. La idea es que los errores independientes se cancelan al promediarse, igual que el error de la media muestral decae en la clase 203.

La fórmula de la varianza del promedio dice exactamente cuánta ganancia hay, y su lectura es la lección de la clase. El segundo término se divide por k y desaparece con muchos modelos; el primero, ρσ², no depende de k y no se puede reducir añadiendo árboles. Si los modelos están muy correlacionados, promediar mil no sirve de mucho más que promediar diez.

De ahí viene la aportación específica de Random Forest sobre el bagging simple: además de remuestrear las observaciones, en cada corte considera solo un subconjunto aleatorio de características. Eso fuerza a los árboles a usar variables distintas y reduce ρ, que es el término que limita la ganancia. La aleatoriedad extra empeora cada árbol individual y mejora el conjunto.

El bagging ataca la varianza, no el sesgo. Promediar cien modelos igualmente sesgados da un modelo igual de sesgado. Por eso funciona tan bien con árboles profundos, que tienen sesgo bajo y varianza alta, y apenas aporta con modelos rígidos como la regresión lineal.

Ejemplo trabajado

Bosque de tocones frente a un tocón único.

25 árboles de profundidad 1 (tocones)
muestreo: bootstrap con reemplazo

accuracy de un árbol único: 0,9875
accuracy del bosque:        0,9875

Aquí no hay ganancia porque el problema es tan fácil
que el tocón único ya acierta casi todo: no queda
varianza que reducir.

Fórmula: Var = ρσ² + (1−ρ)σ²/k
  ρ = 0,0  →  varianza / 25
  ρ = 0,5  →  varianza × 0,52, no × 0,04
  ρ = 1,0  →  sin ganancia

Por eso Random Forest muestrea también características:
para bajar ρ, no para subir k.

Qué calcula el laboratorio

Bagging: promediar modelos decorrelacionados reduce la varianza.

python classes/part-14-matematica-de-machine-learning/292-random-forest-desde-probabilidad/lab.py
compmath run 292

Salidas del laboratorio (8)

Muestra de la ejecución real

{
  "arboles": 25,
  "profundidad": 1,
  "accuracy_arbol_unico": 0.9875,
  "accuracy_del_bosque": 0.9875,
  "muestreo": "bootstrap con reemplazo",
  "por_que_funciona": "Var(media de k modelos correlacionados ρ) = ρσ² + (1-ρ)σ²/k"
}

Errores comunes

Dónde se usa

Random Forest en datos tabulares, estimación de importancia de variables, ensembles de modelos y reducción de varianza en predicciones.

Idea rectora de la parte

Ridge y Lasso resuelven el mismo problema con normas distintas y geometría distinta.

Error a evitar

Interpretar coeficientes de un modelo con features correlacionadas.

Conexión con IA

Estos algoritmos siguen siendo la línea base honesta contra la que se debe comparar cualquier modelo profundo.

Bibliografía de la clase

Archivos de la clase