🧮 Computational Mathematics

Inicio · Parte 14

Matemática de Machine Learning

ml-avanzado 20 clases 80 horas estimadas motor part14

Derivación matemática de los algoritmos clásicos: regresión, regularización, clasificación, kernels, árboles, ensambles, clustering, EM y compromiso sesgo-varianza.

Panorama de la parte

Los algoritmos clásicos de aprendizaje automático se suelen presentar como una colección de recetas con nombres propios. No lo son. Cada uno es una función objetivo más un método de optimización, y una vez visto así el catálogo deja de ser una lista que memorizar y pasa a ser un conjunto de decisiones de diseño comparables entre sí. Esta parte deriva esos algoritmos desde sus objetivos, usando exactamente la matemática de las partes anteriores.

Las clases 281 a 284 empiezan por la regresión y su regularización. Regresión lineal es mínimos cuadrados, que ya se resolvió en la parte 05 como proyección y en la parte 11 como problema numérico. Ridge y Lasso resuelven el mismo problema con normas distintas, y la diferencia no es cosmética: la bola L2 es redonda y encoge todos los coeficientes sin anularlos; la bola L1 tiene vértices sobre los ejes y por eso el óptimo cae en ellos, produciendo ceros exactos. Esa geometría explica por qué Lasso selecciona variables y Ridge no, y es una de las conexiones más limpias entre álgebra y estadística de todo el programa.

Las clases 285 a 290 tratan la clasificación. La regresión logística se deriva de la log-verosimilitud, y su gradiente resulta ser (p − y)·x: idéntico en forma al de la regresión lineal, que es lo que permite tratar ambos casos con el mismo código. La entropía cruzada penaliza sin cota la confianza equivocada, a diferencia del error cuadrático, y eso es exactamente lo que se quiere. Naive Bayes declara un supuesto de independencia que casi siempre es falso y funciona igual, porque la decisión solo necesita el orden de las probabilidades y no su valor. k-NN no tiene entrenamiento pero depende críticamente de la métrica y del escalado. Y SVM introduce el margen máximo y el kernel trick: calcular productos escalares en un espacio de dimensión enorme sin construirlo jamás.

Las clases 291 a 293 recorren los métodos basados en árboles, que siguen siendo el estado del arte en datos tabulares. Un árbol elige cortes minimizando impureza; el bagging promedia modelos decorrelacionados y reduce la varianza según una fórmula explícita que muestra por qué la decorrelación importa más que el número de árboles; y el boosting es descenso de gradiente en el espacio de funciones, donde cada modelo nuevo corrige el residuo del conjunto anterior.

Las clases 294 a 297 pasan al aprendizaje no supervisado. k-means es minimización de inercia con asignación dura; las mezclas de gaussianas la hacen blanda y probabilística; y EM es el algoritmo general que las entrena, alternando expectativa y maximización con la garantía de que la verosimilitud nunca baja. PCA cierra el bloque como preprocesamiento y como aplicación directa de la SVD de la parte 06.

Las dos últimas clases antes del capstone son las que más determinan si un proyecto real funciona. La descomposición sesgo-varianza explica por qué un modelo más complejo no es mejor, y se mide aquí por simulación en vez de enunciarse. Y el leakage es el error que produce métricas excelentes y modelos inútiles: la demostración usa datos donde X e y no guardan ninguna relación y aun así se obtiene un 70 % de acierto si se evalúa mal. Ese 70 % sobre ruido puro es la advertencia más útil de la parte.

Recorrido de la parte

Ideas centrales

Por qué importa en IA

Estos algoritmos siguen siendo la línea base honesta contra la que se debe comparar cualquier modelo profundo.

Errores frecuentes

Secuencia de clases

#ClaseDemostración ejecutable
281 Geometría del aprendizaje supervisado supervised_geometry
282 Regresión lineal desde mínimos cuadrados linear_regression
283 Ridge y regularización L2 ridge
284 Lasso y regularización L1 lasso
285 Regresión logística y sigmoid logistic_regression
286 Cross-entropy en clasificación classification_loss
287 Naive Bayes naive_bayes
288 k-Nearest Neighbors y métricas knn
289 SVM y margen máximo svm_margin
290 Kernel trick kernel_trick
291 Árboles: entropía y Gini tree_impurity
292 Random Forest desde probabilidad random_forest
293 Boosting y descenso funcional boosting
294 k-means como optimización kmeans
295 Gaussian Mixture Models gmm
296 EM algorithm em_algorithm
297 PCA aplicado a ML pca_ml
298 Bias-variance tradeoff bias_variance
299 Generalización, validación y leakage generalization
300 Capstone: derivar y comparar 6 algoritmos ML capstone_six_algorithms

Ejecutar la parte completa

compmath run --part 14

Glosario de la parte (38 términos)

TérminoDefiniciónClase
Aprendizaje supervisado Aprender una función de entrada a salida a partir de pares etiquetados. 281
Frontera de decisión Superficie que separa las regiones asignadas a cada clase. 281
Dirección discriminante Dirección que mejor separa los centroides de las clases. 281
Mínimos cuadrados ordinarios Minimizar la suma de residuos al cuadrado. Tiene solución cerrada. 282
Ecuación normal w = (XᵀX)⁻¹Xᵀy. Solución cerrada de la regresión lineal. 282
Ridge Regresión con penalización L2. Encoge los coeficientes y estabiliza el mal condicionamiento. 283
Lasso Regresión con penalización L1. Produce coeficientes exactamente cero. 284
Dispersión Solución con muchos coeficientes nulos. Equivale a selección automática de variables. 284
Función sigmoide σ(z) = 1/(1+e⁻ᶻ). Convierte un número real en una probabilidad. 285
Logit Logaritmo de la razón de probabilidades. Es la inversa de la sigmoide. 285
Pérdida logarítmica Entropía cruzada aplicada a clasificación. Penaliza sin cota la confianza equivocada. 286
Calibración Grado en que las probabilidades predichas coinciden con las frecuencias observadas. 286
Naive Bayes Clasificador que supone independencia condicional de las variables dada la clase. 287
Independencia condicional P(x₁,x₂|c) = P(x₁|c)·P(x₂|c). Supuesto falso en la práctica y útil igualmente. 287
k-Nearest Neighbors Clasificar por mayoría entre los k vecinos más cercanos. Sin entrenamiento. 288
Maldición de la dimensionalidad En dimensión alta todas las distancias se parecen y el concepto de vecino pierde sentido. 288
Margen Distancia entre la frontera y los puntos más cercanos. SVM lo maximiza. 289
Vector de soporte Punto que toca el margen y determina la frontera. Los demás no influyen. 289
Kernel trick Calcular productos escalares en un espacio expandido sin construirlo explícitamente. 290
Función kernel K(a,b) que equivale a φ(a)ᵀφ(b) para alguna transformación φ. 290
Impureza Medida de mezcla de clases en un nodo. Entropía y Gini son las habituales. 291
Ganancia de información Reducción de impureza que produce un corte. Criterio de división del árbol. 291
Bagging Entrenar modelos sobre remuestras bootstrap y promediar. Reduce la varianza. 292
Decorrelación Hacer que los modelos del ensemble se equivoquen de formas distintas. Es lo que da la ganancia. 292
Boosting Añadir modelos secuencialmente, cada uno ajustando el residuo del conjunto anterior. 293
Aprendiz débil Modelo apenas mejor que el azar. Un tocón de decisión es el ejemplo típico. 293
Inercia Suma de distancias al cuadrado de cada punto a su centroide. Objetivo de k-means. 294
Algoritmo de Lloyd Alternar asignación de puntos y recálculo de centroides hasta converger. 294
Mezcla de gaussianas Modelo generativo con varias componentes normales y asignación blanda. 295
Responsabilidad Probabilidad de que una componente haya generado un punto concreto. 295
Algoritmo EM Alternar expectativa de las latentes y maximización de los parámetros. La verosimilitud nunca baja. 296
Variable latente Variable no observada que explica la estructura de los datos. 296
Varianza explicada Fracción de la varianza total que capturan las componentes retenidas. 297
Sesgo del modelo Error por suponer una forma demasiado simple. Un modelo rígido tiene sesgo alto. 298
Varianza del modelo Sensibilidad de la predicción a la muestra concreta de entrenamiento. 298
Error irreducible Ruido de los datos que ningún modelo puede eliminar. 298
Leakage Información del test que se filtra al entrenamiento. Produce métricas excelentes y modelos inútiles. 299
Validación cruzada anidada Bucle interno para elegir hiperparámetros y externo para estimar el rendimiento. 299

Bibliografía

Ver el motor en GitHub