Inicio · Parte 14 — Matemática de Machine Learning
mismo split, misma semilla, mismas características
línea base por azar: 0,5 en binario equilibrado
empate en accuracy ⟹ decidir por otros criterios
El capstone entrena seis algoritmos sobre los mismos datos con el mismo protocolo: idéntica partición, idéntica semilla, idénticas características. Solo así la comparación mide el algoritmo y no las condiciones del experimento, que es la lección de la clase 260 aplicada aquí.
El resultado es que todos aciertan el 100 %, y eso es informativo en sí mismo: cuando el problema es fácil, la elección de algoritmo no importa. Comparar modelos sobre datos separables no distingue nada, y muchas comparaciones publicadas adolecen de ese defecto. Un problema que no discrimina entre métodos no sirve para elegir método.
Lo que sí distingue a los seis es qué objetivo optimiza cada uno: la regresión logística maximiza la log-verosimilitud, el clasificador por centroides minimiza distancia a la media, k-NN no optimiza nada porque no entrena, Naive Bayes maximiza la posterior bajo independencia, el árbol minimiza impureza y la SVM maximiza el margen. Seis objetivos distintos, seis fronteras distintas, la misma respuesta en este conjunto.
Cuando el accuracy empata, la decisión debe tomarse con otros criterios, y conviene tenerlos listos: interpretabilidad, coste de inferencia, calidad de las probabilidades, robustez ante datos desplazados y facilidad de mantenimiento. Elegir el modelo con 0,3 puntos más de accuracy ignorando que cuesta cien veces más en inferencia es una mala decisión de ingeniería.
Seis algoritmos bajo el mismo protocolo.
protocolo: 80 observaciones, 56 train / 24 test
semilla 20260821, mismas características
algoritmo accuracy test objetivo optimizado
regresión logística 1,00 log-verosimilitud
centroides 1,00 distancia a la media
k-NN (k=5) 1,00 ninguno, sin entrenar
Naive Bayes 1,00 posterior con independencia
árbol de decisión 1,00 impureza
SVM lineal 1,00 margen máximo
línea base por azar: 0,50
Empate total: el problema es demasiado fácil para
discriminar entre métodos.
Criterios de desempate: interpretabilidad, coste de
inferencia, calibración y robustez.
Capstone: seis algoritmos derivados y comparados sobre los mismos datos.
python classes/part-14-matematica-de-machine-learning/300-capstone-derivar-y-comparar-6-algoritmos-ml/lab.py
compmath run 300
protocoloaccuracy_en_testmejorpeorlinea_base_por_azarobjetivos_optimizadosleccion{
"protocolo": {
"observaciones": 80,
"train": 56,
"test": 24,
"semilla": 20260821,
"features": 2,
"los_6_algoritmos_ven_exactamente_la_misma_particion": true
},
"accuracy_en_test": {
"regresion_logistica": 1.0,
"centroides": 1.0,
"knn_k5": 1.0,
"naive_bayes": 1.0,
"svm_lineal": 1.0,
"arbol_profundidad_1": 1.0
},
"mejor": "regresion_logistica",
"peor": "regresion_logistica",
"linea_base_por_azar": 0.5,
"objetivos_optimizados": {
"regresion_logistica": "log-verosimilitud",
"centroides": "distancia a la media de clase",
"knn_k5": "ninguno: memoriza",
"naive_bayes": "verosimilitud con independencia condicional",
"svm_lineal": "margen máximo con hinge loss",
"arbol_profundidad_1": "impureza mínima"
}
}
Selección de modelo en proyectos reales, informes de evaluación, decisiones de arquitectura y establecimiento de líneas base antes de probar modelos profundos.
Estos algoritmos siguen siendo la línea base honesta contra la que se debe comparar cualquier modelo profundo.
9780387848570 verificado en International ISBN Agency (2026-08-19).