🧮 Computational Mathematics

Inicio · Parte 13

Teoría de la información, señales y series

avanzado 20 clases 80 horas estimadas motor part13

Entropía, entropía cruzada, divergencias, información mutua, codificación, muestreo, convolución, Fourier, FFT, filtros y series temporales.

Panorama de la parte

Esta parte contesta dos preguntas que parecen inconexas y resultan ser la misma. La primera: ¿cuánta información hay en un mensaje, y cuánto se puede comprimir sin perder nada? La segunda: ¿qué hay dentro de una señal, y cómo se extrae? Shannon respondió la primera en 1948 y Fourier la segunda en 1822, y ambas convergen en el aprendizaje automático moderno, donde la función de pérdida es una divergencia entre distribuciones y las capas son convoluciones.

Las clases 261 a 268 construyen la teoría de la información desde su ladrillo: la sorpresa −log p. Un evento seguro no sorprende, uno improbable sorprende mucho, y el logaritmo garantiza que la sorpresa de dos eventos independientes sea la suma de las suyas. La entropía es la sorpresa esperada, y el teorema de codificación de Shannon le da un significado operativo que no es metafórico: es el límite inferior exacto de bits por símbolo de cualquier compresión sin pérdida.

De ahí salen las medidas que usa el aprendizaje automático a diario. La entropía cruzada es el coste de codificar la distribución real con un código diseñado para otra, y minimizarla es exactamente maximizar la verosimilitud: la función de pérdida de casi todo clasificador no es una elección de diseño, es una consecuencia. La divergencia KL mide el exceso sobre el óptimo, y su asimetría no es un defecto sino información: KL(p‖q) y KL(q‖p) penalizan errores distintos, y esa diferencia decide el comportamiento de un VAE frente a una GAN. La información mutua cuantifica cuánto dice una variable sobre otra, y vale cero si y solo si son independientes, que es más de lo que la correlación puede garantizar.

Las clases 269 a 275 pasan a las señales. El teorema de Nyquist impone una frontera dura: hay que muestrear a más del doble de la frecuencia máxima presente, y por debajo de ese límite el aliasing es irreversible —no hay procesamiento posterior que recupere lo que se perdió—. La convolución aparece como el operador central, primero como filtrado y luego como el núcleo de las CNN, y Fourier revela que toda señal es una suma de sinusoides y que convolucionar en el tiempo es multiplicar en frecuencia. La FFT hace ese cambio de dominio computable: O(n log n) en vez de O(n²), lo que para un millón de muestras es la diferencia entre milisegundos y semanas.

El cierre (276 a 280) trata las series temporales: estacionariedad como supuesto que casi todo el análisis clásico necesita, autocorrelación para descubrir periodicidad oculta, ventaneo y la fuga espectral que provoca analizar un trozo finito, y densidad espectral. El capstone recorre el camino completo: de una señal cruda a un vector de características temporales y espectrales listo para alimentar un modelo.

El puente con la inteligencia artificial es explícito en cada bloque. La entropía cruzada es la pérdida de todo clasificador; el VAE optimiza un ELBO con un término KL; las GAN se analizaron originalmente en términos de divergencia de Jensen-Shannon; las CNN son convoluciones con núcleos aprendidos; la atención es una correlación normalizada; y la codificación posicional de un Transformer son senos y cosenos de frecuencias distintas.

Recorrido de la parte

Ideas centrales

Por qué importa en IA

La función de pérdida de casi todo clasificador es entropía cruzada; el VAE optimiza un ELBO con un término KL; las CNN son convoluciones aprendidas.

Errores frecuentes

Secuencia de clases

#ClaseDemostración ejecutable
261 Información y sorpresa surprise
262 Entropía de Shannon shannon_entropy
263 Entropía cruzada cross_entropy
264 Divergencia KL kl_divergence
265 Jensen-Shannon divergence js_divergence
266 Información mutua mutual_information
267 Principio de máxima entropía max_entropy
268 Codificación y compresión coding_compression
269 Señales discretas y continuas signals
270 Muestreo y aliasing sampling_aliasing
271 Convolución convolution
272 Correlación de señales cross_correlation
273 Series y transformada de Fourier fourier_series
274 FFT fft
275 Filtros y respuesta en frecuencia filters
276 Procesos estacionarios stationarity
277 Autocorrelación autocorrelation
278 Series temporales y ventanas windowing
279 Espectro y densidad espectral power_spectrum
280 Capstone: analizar señal y construir features capstone_signal_features

Ejecutar la parte completa

compmath run --part 13

Glosario de la parte (34 términos)

TérminoDefiniciónClase
Sorpresa −log p(x). Información que aporta observar un evento. Cero si era seguro. 261
Bit y nat Unidades de información según se use log₂ o logaritmo natural. 1 nat ≈ 1,4427 bits. 261
Entropía de Shannon H(p) = −Σ p·log p. Sorpresa esperada y límite inferior de compresión sin pérdida. 262
Distribución uniforme y entropía Entre distribuciones sobre n símbolos, la uniforme es la de máxima entropía: log n. 262
Entropía cruzada H(p,q) = −Σ p·log q. Coste de codificar p con un código óptimo para q. 263
Epsilon de estabilidad Constante minúscula que evita log(0) al calcular pérdidas logarítmicas. 263
Divergencia KL KL(p‖q) = H(p,q) − H(p). No negativa, cero solo si p = q, y no simétrica. 264
Asimetría de KL KL(p‖q) ≠ KL(q‖p). Cada dirección penaliza un tipo distinto de error. 264
Divergencia de Jensen-Shannon Media de las KL a la mezcla. Simétrica, acotada y su raíz es una métrica. 265
Información mutua I(X;Y) = H(X) − H(X|Y). Reducción de incertidumbre sobre X al conocer Y. 266
Independencia e información I(X;Y) = 0 si y solo si X e Y son independientes. Detecta relaciones no lineales. 266
Principio de máxima entropía Entre las distribuciones compatibles con lo conocido, elegir la de mayor entropía. 267
Código de Huffman Código de longitud variable óptimo entre los de prefijo, con símbolos frecuentes más cortos. 268
Código de prefijo Ningún código es prefijo de otro, lo que permite decodificar sin separadores. 268
Frecuencia de muestreo Número de muestras por segundo tomadas de una señal continua. 269
Teorema de Nyquist Hay que muestrear a más del doble de la frecuencia máxima presente en la señal. 270
Aliasing Frecuencias altas que aparecen como bajas al muestrear demasiado lento. Es irreversible. 270
Convolución Deslizar un núcleo invertido sobre una señal y sumar productos. Base del filtrado y de las CNN. 271
Núcleo o kernel Vector o matriz pequeña que define la operación local de una convolución. 271
Correlación cruzada Como la convolución pero sin invertir el núcleo. Es lo que implementan las CNN. 272
Transformada de Fourier Descompone una señal en sus componentes de frecuencia. Cambio de base a senos y cosenos. 273
Teorema de Parseval La energía en el dominio del tiempo es igual a la energía en el dominio de la frecuencia. 273
FFT Algoritmo que calcula la DFT en O(n log n) en vez de O(n²). 274
Teorema de convolución Convolucionar en el tiempo equivale a multiplicar en frecuencia. 274
Filtro paso-bajo Atenúa las frecuencias altas y conserva las bajas. Una media móvil es el caso más simple. 275
Respuesta en frecuencia Cuánto atenúa o amplifica un filtro cada frecuencia. 275
Estacionariedad Media, varianza y autocovarianza que no cambian con el tiempo. 276
Diferenciación Restar el valor anterior a cada término. Elimina tendencias polinómicas. 276
Autocorrelación Correlación de la serie consigo misma desplazada. Revela periodicidad oculta. 277
Retardo o lag Desplazamiento temporal aplicado a la serie al calcular la autocorrelación. 277
Ventaneo Multiplicar por una función que decae en los bordes antes de transformar. 278
Fuga espectral Energía que se dispersa a frecuencias vecinas al analizar un trozo finito de señal. 278
Densidad espectral de potencia Reparto de la energía de la señal entre sus frecuencias. 279
Centroide espectral Frecuencia media ponderada por potencia. Descriptor del brillo de una señal. 280

Bibliografía

Ver el motor en GitHub