Inicio · Parte 14
Derivación matemática de los algoritmos clásicos: regresión, regularización, clasificación, kernels, árboles, ensambles, clustering, EM y compromiso sesgo-varianza.
Los algoritmos clásicos de aprendizaje automático se suelen presentar como una colección de recetas con nombres propios. No lo son. Cada uno es una función objetivo más un método de optimización, y una vez visto así el catálogo deja de ser una lista que memorizar y pasa a ser un conjunto de decisiones de diseño comparables entre sí. Esta parte deriva esos algoritmos desde sus objetivos, usando exactamente la matemática de las partes anteriores.
Las clases 281 a 284 empiezan por la regresión y su regularización. Regresión lineal es mínimos cuadrados, que ya se resolvió en la parte 05 como proyección y en la parte 11 como problema numérico. Ridge y Lasso resuelven el mismo problema con normas distintas, y la diferencia no es cosmética: la bola L2 es redonda y encoge todos los coeficientes sin anularlos; la bola L1 tiene vértices sobre los ejes y por eso el óptimo cae en ellos, produciendo ceros exactos. Esa geometría explica por qué Lasso selecciona variables y Ridge no, y es una de las conexiones más limpias entre álgebra y estadística de todo el programa.
Las clases 285 a 290 tratan la clasificación. La regresión logística se deriva de la log-verosimilitud, y su gradiente resulta ser (p − y)·x: idéntico en forma al de la regresión lineal, que es lo que permite tratar ambos casos con el mismo código. La entropía cruzada penaliza sin cota la confianza equivocada, a diferencia del error cuadrático, y eso es exactamente lo que se quiere. Naive Bayes declara un supuesto de independencia que casi siempre es falso y funciona igual, porque la decisión solo necesita el orden de las probabilidades y no su valor. k-NN no tiene entrenamiento pero depende críticamente de la métrica y del escalado. Y SVM introduce el margen máximo y el kernel trick: calcular productos escalares en un espacio de dimensión enorme sin construirlo jamás.
Las clases 291 a 293 recorren los métodos basados en árboles, que siguen siendo el estado del arte en datos tabulares. Un árbol elige cortes minimizando impureza; el bagging promedia modelos decorrelacionados y reduce la varianza según una fórmula explícita que muestra por qué la decorrelación importa más que el número de árboles; y el boosting es descenso de gradiente en el espacio de funciones, donde cada modelo nuevo corrige el residuo del conjunto anterior.
Las clases 294 a 297 pasan al aprendizaje no supervisado. k-means es minimización de inercia con asignación dura; las mezclas de gaussianas la hacen blanda y probabilística; y EM es el algoritmo general que las entrena, alternando expectativa y maximización con la garantía de que la verosimilitud nunca baja. PCA cierra el bloque como preprocesamiento y como aplicación directa de la SVD de la parte 06.
Las dos últimas clases antes del capstone son las que más determinan si un proyecto real funciona. La descomposición sesgo-varianza explica por qué un modelo más complejo no es mejor, y se mide aquí por simulación en vez de enunciarse. Y el leakage es el error que produce métricas excelentes y modelos inútiles: la demostración usa datos donde X e y no guardan ninguna relación y aun así se obtiene un 70 % de acierto si se evalúa mal. Ese 70 % sobre ruido puro es la advertencia más útil de la parte.
| # | Clase | Demostración ejecutable |
|---|---|---|
281 |
Geometría del aprendizaje supervisado | supervised_geometry |
282 |
Regresión lineal desde mínimos cuadrados | linear_regression |
283 |
Ridge y regularización L2 | ridge |
284 |
Lasso y regularización L1 | lasso |
285 |
Regresión logística y sigmoid | logistic_regression |
286 |
Cross-entropy en clasificación | classification_loss |
287 |
Naive Bayes | naive_bayes |
288 |
k-Nearest Neighbors y métricas | knn |
289 |
SVM y margen máximo | svm_margin |
290 |
Kernel trick | kernel_trick |
291 |
Árboles: entropía y Gini | tree_impurity |
292 |
Random Forest desde probabilidad | random_forest |
293 |
Boosting y descenso funcional | boosting |
294 |
k-means como optimización | kmeans |
295 |
Gaussian Mixture Models | gmm |
296 |
EM algorithm | em_algorithm |
297 |
PCA aplicado a ML | pca_ml |
298 |
Bias-variance tradeoff | bias_variance |
299 |
Generalización, validación y leakage | generalization |
300 |
Capstone: derivar y comparar 6 algoritmos ML | capstone_six_algorithms |
compmath run --part 14
| Término | Definición | Clase |
|---|---|---|
| Aprendizaje supervisado | Aprender una función de entrada a salida a partir de pares etiquetados. | 281 |
| Frontera de decisión | Superficie que separa las regiones asignadas a cada clase. | 281 |
| Dirección discriminante | Dirección que mejor separa los centroides de las clases. | 281 |
| Mínimos cuadrados ordinarios | Minimizar la suma de residuos al cuadrado. Tiene solución cerrada. | 282 |
| Ecuación normal | w = (XᵀX)⁻¹Xᵀy. Solución cerrada de la regresión lineal. | 282 |
| Ridge | Regresión con penalización L2. Encoge los coeficientes y estabiliza el mal condicionamiento. | 283 |
| Lasso | Regresión con penalización L1. Produce coeficientes exactamente cero. | 284 |
| Dispersión | Solución con muchos coeficientes nulos. Equivale a selección automática de variables. | 284 |
| Función sigmoide | σ(z) = 1/(1+e⁻ᶻ). Convierte un número real en una probabilidad. | 285 |
| Logit | Logaritmo de la razón de probabilidades. Es la inversa de la sigmoide. | 285 |
| Pérdida logarítmica | Entropía cruzada aplicada a clasificación. Penaliza sin cota la confianza equivocada. | 286 |
| Calibración | Grado en que las probabilidades predichas coinciden con las frecuencias observadas. | 286 |
| Naive Bayes | Clasificador que supone independencia condicional de las variables dada la clase. | 287 |
| Independencia condicional | P(x₁,x₂|c) = P(x₁|c)·P(x₂|c). Supuesto falso en la práctica y útil igualmente. | 287 |
| k-Nearest Neighbors | Clasificar por mayoría entre los k vecinos más cercanos. Sin entrenamiento. | 288 |
| Maldición de la dimensionalidad | En dimensión alta todas las distancias se parecen y el concepto de vecino pierde sentido. | 288 |
| Margen | Distancia entre la frontera y los puntos más cercanos. SVM lo maximiza. | 289 |
| Vector de soporte | Punto que toca el margen y determina la frontera. Los demás no influyen. | 289 |
| Kernel trick | Calcular productos escalares en un espacio expandido sin construirlo explícitamente. | 290 |
| Función kernel | K(a,b) que equivale a φ(a)ᵀφ(b) para alguna transformación φ. | 290 |
| Impureza | Medida de mezcla de clases en un nodo. Entropía y Gini son las habituales. | 291 |
| Ganancia de información | Reducción de impureza que produce un corte. Criterio de división del árbol. | 291 |
| Bagging | Entrenar modelos sobre remuestras bootstrap y promediar. Reduce la varianza. | 292 |
| Decorrelación | Hacer que los modelos del ensemble se equivoquen de formas distintas. Es lo que da la ganancia. | 292 |
| Boosting | Añadir modelos secuencialmente, cada uno ajustando el residuo del conjunto anterior. | 293 |
| Aprendiz débil | Modelo apenas mejor que el azar. Un tocón de decisión es el ejemplo típico. | 293 |
| Inercia | Suma de distancias al cuadrado de cada punto a su centroide. Objetivo de k-means. | 294 |
| Algoritmo de Lloyd | Alternar asignación de puntos y recálculo de centroides hasta converger. | 294 |
| Mezcla de gaussianas | Modelo generativo con varias componentes normales y asignación blanda. | 295 |
| Responsabilidad | Probabilidad de que una componente haya generado un punto concreto. | 295 |
| Algoritmo EM | Alternar expectativa de las latentes y maximización de los parámetros. La verosimilitud nunca baja. | 296 |
| Variable latente | Variable no observada que explica la estructura de los datos. | 296 |
| Varianza explicada | Fracción de la varianza total que capturan las componentes retenidas. | 297 |
| Sesgo del modelo | Error por suponer una forma demasiado simple. Un modelo rígido tiene sesgo alto. | 298 |
| Varianza del modelo | Sensibilidad de la predicción a la muestra concreta de entrenamiento. | 298 |
| Error irreducible | Ruido de los datos que ningún modelo puede eliminar. | 298 |
| Leakage | Información del test que se filtra al entrenamiento. Produce métricas excelentes y modelos inútiles. | 299 |
| Validación cruzada anidada | Bucle interno para elegir hiperparámetros y externo para estimar el rendimiento. | 299 |