Inicio · Parte 14 — Matemática de Machine Learning
entropía = −Σ p·log₂ p
Gini = 1 − Σ p²
ganancia = impureza(padre) − Σ (nᵢ/n)·impureza(hijoᵢ)
Un árbol de decisión parte el espacio con cortes paralelos a los ejes, eligiendo en cada nodo la característica y el umbral que producen hijos lo más puros posible. La construcción es voraz: se elige el mejor corte local sin garantía de optimalidad global, porque encontrar el árbol óptimo es un problema NP-completo.
Hay dos medidas habituales de impureza. La entropía es la de la clase 262 aplicada a la distribución de clases del nodo. El índice de Gini es la probabilidad de clasificar mal si se etiquetase al azar según la distribución del nodo. Ambas valen cero en un nodo puro y son máximas cuando las clases están equilibradas.
En la práctica rara vez producen árboles distintos. Gini es ligeramente más rápido porque evita el logaritmo, y por eso suele ser el valor por defecto. Elegir entre uno y otro es una de las decisiones menos importantes del modelado, pese a la atención que recibe.
La virtud del árbol es la interpretabilidad: la secuencia de decisiones se lee como reglas y se explica a cualquiera. Su defecto es la inestabilidad: cambiar unos pocos datos puede alterar el corte raíz y con él todo el árbol. Esa varianza alta es exactamente lo que el bagging de la clase siguiente ataca, y lo que hizo de los bosques aleatorios un método tan superior al árbol individual.
Elección del mejor corte en el nodo raíz.
nodo raíz con clases equilibradas:
entropía = 1,0 bits Gini = 0,5
cortes evaluados: 28
mejor corte: característica 0, umbral 0,5
ganancia de información = 0,915219 bits
Gini tras el corte = 0,02439
La impureza cae de 0,5 a 0,024: los hijos son
casi puros con un solo corte.
Entropía y Gini eligieron el mismo corte,
como ocurre en la inmensa mayoría de los casos.
Entropía y Gini: dos medidas de impureza para elegir el corte.
python classes/part-14-matematica-de-machine-learning/291-arboles-entropia-y-gini/lab.py
compmath run 291
entropia_del_nodo_raizgini_del_nodo_raizmejor_corteganancia_de_informaciongini_tras_el_cortecortes_evaluadosgini_es_mas_baratoambos_criterios_suelen_coincidir{
"entropia_del_nodo_raiz": 1.0,
"gini_del_nodo_raiz": 0.5,
"mejor_corte": {
"feature": 0,
"umbral": 0.5
},
"ganancia_de_informacion": 0.915219,
"gini_tras_el_corte": 0.02439,
"cortes_evaluados": 28
}
Modelos interpretables, segmentación de clientes, sistemas de reglas y componente base de Random Forest y gradient boosting.
Estos algoritmos siguen siendo la línea base honesta contra la que se debe comparar cualquier modelo profundo.
9781315139470 verificado en International ISBN Agency (2026-08-19).9780387848570 verificado en International ISBN Agency (2026-08-19).