Inicio · Parte 14 — Matemática de Machine Learning
Var(media de k modelos) = ρσ² + (1−ρ)σ²/k
ρ = 0 ⟹ varianza / k
ρ = 1 ⟹ no hay ganancia
El bagging entrena varios modelos sobre remuestras bootstrap de los datos y promedia sus predicciones. La idea es que los errores independientes se cancelan al promediarse, igual que el error de la media muestral decae en la clase 203.
La fórmula de la varianza del promedio dice exactamente cuánta ganancia hay, y su lectura es la lección de la clase. El segundo término se divide por k y desaparece con muchos modelos; el primero, ρσ², no depende de k y no se puede reducir añadiendo árboles. Si los modelos están muy correlacionados, promediar mil no sirve de mucho más que promediar diez.
De ahí viene la aportación específica de Random Forest sobre el bagging simple: además de remuestrear las observaciones, en cada corte considera solo un subconjunto aleatorio de características. Eso fuerza a los árboles a usar variables distintas y reduce ρ, que es el término que limita la ganancia. La aleatoriedad extra empeora cada árbol individual y mejora el conjunto.
El bagging ataca la varianza, no el sesgo. Promediar cien modelos igualmente sesgados da un modelo igual de sesgado. Por eso funciona tan bien con árboles profundos, que tienen sesgo bajo y varianza alta, y apenas aporta con modelos rígidos como la regresión lineal.
Bosque de tocones frente a un tocón único.
25 árboles de profundidad 1 (tocones)
muestreo: bootstrap con reemplazo
accuracy de un árbol único: 0,9875
accuracy del bosque: 0,9875
Aquí no hay ganancia porque el problema es tan fácil
que el tocón único ya acierta casi todo: no queda
varianza que reducir.
Fórmula: Var = ρσ² + (1−ρ)σ²/k
ρ = 0,0 → varianza / 25
ρ = 0,5 → varianza × 0,52, no × 0,04
ρ = 1,0 → sin ganancia
Por eso Random Forest muestrea también características:
para bajar ρ, no para subir k.
Bagging: promediar modelos decorrelacionados reduce la varianza.
python classes/part-14-matematica-de-machine-learning/292-random-forest-desde-probabilidad/lab.py
compmath run 292
arbolesprofundidadaccuracy_arbol_unicoaccuracy_del_bosquemuestreopor_que_funcionareduce_varianza_no_sesgosemilla{
"arboles": 25,
"profundidad": 1,
"accuracy_arbol_unico": 0.9875,
"accuracy_del_bosque": 0.9875,
"muestreo": "bootstrap con reemplazo",
"por_que_funciona": "Var(media de k modelos correlacionados ρ) = ρσ² + (1-ρ)σ²/k"
}
Random Forest en datos tabulares, estimación de importancia de variables, ensembles de modelos y reducción de varianza en predicciones.
Estos algoritmos siguen siendo la línea base honesta contra la que se debe comparar cualquier modelo profundo.
10.1023/a:1010933404324 verificado en Crossref (2026-08-19).9780387848570 verificado en International ISBN Agency (2026-08-19).