Inicio · Parte 13
Entropía, entropía cruzada, divergencias, información mutua, codificación, muestreo, convolución, Fourier, FFT, filtros y series temporales.
Esta parte contesta dos preguntas que parecen inconexas y resultan ser la misma. La primera: ¿cuánta información hay en un mensaje, y cuánto se puede comprimir sin perder nada? La segunda: ¿qué hay dentro de una señal, y cómo se extrae? Shannon respondió la primera en 1948 y Fourier la segunda en 1822, y ambas convergen en el aprendizaje automático moderno, donde la función de pérdida es una divergencia entre distribuciones y las capas son convoluciones.
Las clases 261 a 268 construyen la teoría de la información desde su ladrillo: la sorpresa −log p. Un evento seguro no sorprende, uno improbable sorprende mucho, y el logaritmo garantiza que la sorpresa de dos eventos independientes sea la suma de las suyas. La entropía es la sorpresa esperada, y el teorema de codificación de Shannon le da un significado operativo que no es metafórico: es el límite inferior exacto de bits por símbolo de cualquier compresión sin pérdida.
De ahí salen las medidas que usa el aprendizaje automático a diario. La entropía cruzada es el coste de codificar la distribución real con un código diseñado para otra, y minimizarla es exactamente maximizar la verosimilitud: la función de pérdida de casi todo clasificador no es una elección de diseño, es una consecuencia. La divergencia KL mide el exceso sobre el óptimo, y su asimetría no es un defecto sino información: KL(p‖q) y KL(q‖p) penalizan errores distintos, y esa diferencia decide el comportamiento de un VAE frente a una GAN. La información mutua cuantifica cuánto dice una variable sobre otra, y vale cero si y solo si son independientes, que es más de lo que la correlación puede garantizar.
Las clases 269 a 275 pasan a las señales. El teorema de Nyquist impone una frontera dura: hay que muestrear a más del doble de la frecuencia máxima presente, y por debajo de ese límite el aliasing es irreversible —no hay procesamiento posterior que recupere lo que se perdió—. La convolución aparece como el operador central, primero como filtrado y luego como el núcleo de las CNN, y Fourier revela que toda señal es una suma de sinusoides y que convolucionar en el tiempo es multiplicar en frecuencia. La FFT hace ese cambio de dominio computable: O(n log n) en vez de O(n²), lo que para un millón de muestras es la diferencia entre milisegundos y semanas.
El cierre (276 a 280) trata las series temporales: estacionariedad como supuesto que casi todo el análisis clásico necesita, autocorrelación para descubrir periodicidad oculta, ventaneo y la fuga espectral que provoca analizar un trozo finito, y densidad espectral. El capstone recorre el camino completo: de una señal cruda a un vector de características temporales y espectrales listo para alimentar un modelo.
El puente con la inteligencia artificial es explícito en cada bloque. La entropía cruzada es la pérdida de todo clasificador; el VAE optimiza un ELBO con un término KL; las GAN se analizaron originalmente en términos de divergencia de Jensen-Shannon; las CNN son convoluciones con núcleos aprendidos; la atención es una correlación normalizada; y la codificación posicional de un Transformer son senos y cosenos de frecuencias distintas.
| # | Clase | Demostración ejecutable |
|---|---|---|
261 |
Información y sorpresa | surprise |
262 |
Entropía de Shannon | shannon_entropy |
263 |
Entropía cruzada | cross_entropy |
264 |
Divergencia KL | kl_divergence |
265 |
Jensen-Shannon divergence | js_divergence |
266 |
Información mutua | mutual_information |
267 |
Principio de máxima entropía | max_entropy |
268 |
Codificación y compresión | coding_compression |
269 |
Señales discretas y continuas | signals |
270 |
Muestreo y aliasing | sampling_aliasing |
271 |
Convolución | convolution |
272 |
Correlación de señales | cross_correlation |
273 |
Series y transformada de Fourier | fourier_series |
274 |
FFT | fft |
275 |
Filtros y respuesta en frecuencia | filters |
276 |
Procesos estacionarios | stationarity |
277 |
Autocorrelación | autocorrelation |
278 |
Series temporales y ventanas | windowing |
279 |
Espectro y densidad espectral | power_spectrum |
280 |
Capstone: analizar señal y construir features | capstone_signal_features |
compmath run --part 13
| Término | Definición | Clase |
|---|---|---|
| Sorpresa | −log p(x). Información que aporta observar un evento. Cero si era seguro. | 261 |
| Bit y nat | Unidades de información según se use log₂ o logaritmo natural. 1 nat ≈ 1,4427 bits. | 261 |
| Entropía de Shannon | H(p) = −Σ p·log p. Sorpresa esperada y límite inferior de compresión sin pérdida. | 262 |
| Distribución uniforme y entropía | Entre distribuciones sobre n símbolos, la uniforme es la de máxima entropía: log n. | 262 |
| Entropía cruzada | H(p,q) = −Σ p·log q. Coste de codificar p con un código óptimo para q. | 263 |
| Epsilon de estabilidad | Constante minúscula que evita log(0) al calcular pérdidas logarítmicas. | 263 |
| Divergencia KL | KL(p‖q) = H(p,q) − H(p). No negativa, cero solo si p = q, y no simétrica. | 264 |
| Asimetría de KL | KL(p‖q) ≠ KL(q‖p). Cada dirección penaliza un tipo distinto de error. | 264 |
| Divergencia de Jensen-Shannon | Media de las KL a la mezcla. Simétrica, acotada y su raíz es una métrica. | 265 |
| Información mutua | I(X;Y) = H(X) − H(X|Y). Reducción de incertidumbre sobre X al conocer Y. | 266 |
| Independencia e información | I(X;Y) = 0 si y solo si X e Y son independientes. Detecta relaciones no lineales. | 266 |
| Principio de máxima entropía | Entre las distribuciones compatibles con lo conocido, elegir la de mayor entropía. | 267 |
| Código de Huffman | Código de longitud variable óptimo entre los de prefijo, con símbolos frecuentes más cortos. | 268 |
| Código de prefijo | Ningún código es prefijo de otro, lo que permite decodificar sin separadores. | 268 |
| Frecuencia de muestreo | Número de muestras por segundo tomadas de una señal continua. | 269 |
| Teorema de Nyquist | Hay que muestrear a más del doble de la frecuencia máxima presente en la señal. | 270 |
| Aliasing | Frecuencias altas que aparecen como bajas al muestrear demasiado lento. Es irreversible. | 270 |
| Convolución | Deslizar un núcleo invertido sobre una señal y sumar productos. Base del filtrado y de las CNN. | 271 |
| Núcleo o kernel | Vector o matriz pequeña que define la operación local de una convolución. | 271 |
| Correlación cruzada | Como la convolución pero sin invertir el núcleo. Es lo que implementan las CNN. | 272 |
| Transformada de Fourier | Descompone una señal en sus componentes de frecuencia. Cambio de base a senos y cosenos. | 273 |
| Teorema de Parseval | La energía en el dominio del tiempo es igual a la energía en el dominio de la frecuencia. | 273 |
| FFT | Algoritmo que calcula la DFT en O(n log n) en vez de O(n²). | 274 |
| Teorema de convolución | Convolucionar en el tiempo equivale a multiplicar en frecuencia. | 274 |
| Filtro paso-bajo | Atenúa las frecuencias altas y conserva las bajas. Una media móvil es el caso más simple. | 275 |
| Respuesta en frecuencia | Cuánto atenúa o amplifica un filtro cada frecuencia. | 275 |
| Estacionariedad | Media, varianza y autocovarianza que no cambian con el tiempo. | 276 |
| Diferenciación | Restar el valor anterior a cada término. Elimina tendencias polinómicas. | 276 |
| Autocorrelación | Correlación de la serie consigo misma desplazada. Revela periodicidad oculta. | 277 |
| Retardo o lag | Desplazamiento temporal aplicado a la serie al calcular la autocorrelación. | 277 |
| Ventaneo | Multiplicar por una función que decae en los bordes antes de transformar. | 278 |
| Fuga espectral | Energía que se dispersa a frecuencias vecinas al analizar un trozo finito de señal. | 278 |
| Densidad espectral de potencia | Reparto de la energía de la señal entre sus frecuencias. | 279 |
| Centroide espectral | Frecuencia media ponderada por potencia. Descriptor del brillo de una señal. | 280 |