🧮 Computational Mathematics

Inicio · Parte 14 — Matemática de Machine Learning

300 — Capstone: derivar y comparar 6 algoritmos ML

ml-avanzado clase 20 de 20 4 horas demostración capstone_six_algorithms

Seis algoritmos, un mismo protocolo: lo que cambia es el objetivo que cada uno optimiza.

Fórmulas

mismo split, misma semilla, mismas características
línea base por azar: 0,5 en binario equilibrado
empate en accuracy ⟹ decidir por otros criterios

Desarrollo

El capstone entrena seis algoritmos sobre los mismos datos con el mismo protocolo: idéntica partición, idéntica semilla, idénticas características. Solo así la comparación mide el algoritmo y no las condiciones del experimento, que es la lección de la clase 260 aplicada aquí.

El resultado es que todos aciertan el 100 %, y eso es informativo en sí mismo: cuando el problema es fácil, la elección de algoritmo no importa. Comparar modelos sobre datos separables no distingue nada, y muchas comparaciones publicadas adolecen de ese defecto. Un problema que no discrimina entre métodos no sirve para elegir método.

Lo que sí distingue a los seis es qué objetivo optimiza cada uno: la regresión logística maximiza la log-verosimilitud, el clasificador por centroides minimiza distancia a la media, k-NN no optimiza nada porque no entrena, Naive Bayes maximiza la posterior bajo independencia, el árbol minimiza impureza y la SVM maximiza el margen. Seis objetivos distintos, seis fronteras distintas, la misma respuesta en este conjunto.

Cuando el accuracy empata, la decisión debe tomarse con otros criterios, y conviene tenerlos listos: interpretabilidad, coste de inferencia, calidad de las probabilidades, robustez ante datos desplazados y facilidad de mantenimiento. Elegir el modelo con 0,3 puntos más de accuracy ignorando que cuesta cien veces más en inferencia es una mala decisión de ingeniería.

Ejemplo trabajado

Seis algoritmos bajo el mismo protocolo.

protocolo: 80 observaciones, 56 train / 24 test
           semilla 20260821, mismas características

algoritmo                accuracy test    objetivo optimizado
regresión logística          1,00       log-verosimilitud
centroides                   1,00       distancia a la media
k-NN (k=5)                   1,00       ninguno, sin entrenar
Naive Bayes                  1,00       posterior con independencia
árbol de decisión            1,00       impureza
SVM lineal                   1,00       margen máximo

línea base por azar: 0,50

Empate total: el problema es demasiado fácil para
discriminar entre métodos.

Criterios de desempate: interpretabilidad, coste de
inferencia, calibración y robustez.

Qué calcula el laboratorio

Capstone: seis algoritmos derivados y comparados sobre los mismos datos.

python classes/part-14-matematica-de-machine-learning/300-capstone-derivar-y-comparar-6-algoritmos-ml/lab.py
compmath run 300

Salidas del laboratorio (7)

Muestra de la ejecución real

{
  "protocolo": {
    "observaciones": 80,
    "train": 56,
    "test": 24,
    "semilla": 20260821,
    "features": 2,
    "los_6_algoritmos_ven_exactamente_la_misma_particion": true
  },
  "accuracy_en_test": {
    "regresion_logistica": 1.0,
    "centroides": 1.0,
    "knn_k5": 1.0,
    "naive_bayes": 1.0,
    "svm_lineal": 1.0,
    "arbol_profundidad_1": 1.0
  },
  "mejor": "regresion_logistica",
  "peor": "regresion_logistica",
  "linea_base_por_azar": 0.5,
  "objetivos_optimizados": {
    "regresion_logistica": "log-verosimilitud",
    "centroides": "distancia a la media de clase",
    "knn_k5": "ninguno: memoriza",
    "naive_bayes": "verosimilitud con independencia condicional",
    "svm_lineal": "margen máximo con hinge loss",
    "arbol_profundidad_1": "impureza mínima"
  }
}

Errores comunes

Dónde se usa

Selección de modelo en proyectos reales, informes de evaluación, decisiones de arquitectura y establecimiento de líneas base antes de probar modelos profundos.

Idea rectora de la parte

El leakage produce métricas excelentes y modelos inútiles.

Error a evitar

Elegir hiperparámetros con el conjunto de test.

Conexión con IA

Estos algoritmos siguen siendo la línea base honesta contra la que se debe comparar cualquier modelo profundo.

Bibliografía de la clase

Archivos de la clase