📇 Índice de papers fundacionales
Generado por
python scripts/generate_papers.py. No editar a mano.
Papers: 148 · Actualizado: 2026-08-18 · Cobertura: 1763–2025
📝 Nota
Los identificadores
PXXson estables: se asignan al incorporar cada paper y no se renumeran nunca, para no romper enlaces, notebooks ni evaluaciones. Por eso su orden es de incorporación y no significa nada. Para estudiar, usa el orden cronológico de esta tabla o la vista temática.
📅 Tabla maestra — todos los papers, por año
| Año | # | Paper | Bloque | Nivel | Motor | Ficha | Notebook |
|---|---|---|---|---|---|---|---|
| 1763 | P87 | Ensayo para resolver un problema en la doctrina de las probabilidades | ruta_probabilistica | L2 | bayes |
ficha | nb |
| 1901 | P53 | Sobre las líneas y planos de ajuste más próximo a sistemas de puntos en el espacio | 🧭 fundamentos | L2 | pca |
ficha | nb |
| 1943 | P54 | Un cálculo lógico de las ideas inmanentes en la actividad nerviosa | 🧭 fundamentos | L1 | mcculloch_pitts |
ficha | nb |
| 1946 | P88 | Probabilidad, frecuencia y expectativa razonable | ruta_probabilistica | L3 | cox |
ficha | nb |
| 1948 | P55 | Una teoría matemática de la comunicación | 🧭 fundamentos | L2 | shannon |
ficha | nb |
| 1950 | P56 | Maquinaria computacional e inteligencia | 🧭 fundamentos | L1 | turing |
ficha | nb |
| 1955 | P57 | Propuesta para el proyecto de investigación de verano de Dartmouth sobre inteligencia artificial | 🧭 fundamentos | L1 | dartmouth |
ficha | nb |
| 1958 | P01 | El perceptrón: un modelo probabilístico de almacenamiento y organización de información en el cerebro | 🔗 cadena | L1 | perceptron |
ficha | nb |
| 1959 | P64 | Informe sobre un programa general de resolución de problemas | ♟️ simbólica | L2 | gps |
ficha | nb |
| 1960 | P96 | Un nuevo enfoque para los problemas de filtrado y predicción lineales | ruta_encarnada | L3 | kalman |
ficha | nb |
| 1962 | P65 | Un programa de máquina para demostración de teoremas | ♟️ simbólica | L2 | dpll |
ficha | nb |
| 1965 | P66 | Una lógica orientada a máquina basada en el principio de resolución | ♟️ simbólica | L3 | resolucion |
ficha | nb |
| 1965 | P89 | Conjuntos difusos | ruta_probabilistica | L2 | fuzzy |
ficha | nb |
| 1968 | P67 | Una base formal para la determinación heurística de caminos de coste mínimo | ♟️ simbólica | L3 | a_estrella |
ficha | nb |
| 1971 | P68 | STRIPS: un nuevo enfoque para aplicar la demostración de teoremas a la resolución de problemas | ♟️ simbólica | L2 | strips |
ficha | nb |
| 1973 | P90 | Algoritmos genéticos y la asignación óptima de ensayos | ruta_probabilistica | L2 | algoritmos_geneticos |
ficha | nb |
| 1975 | P134 | La protección de la información en los sistemas informáticos | ruta_agentes_operativos | L1 | minimo_privilegio |
ficha | nb |
| 1975 | P69 | Un modelo de razonamiento inexacto en medicina | ♟️ simbólica | L2 | mycin |
ficha | nb |
| 1976 | P58 | La informática como indagación empírica: símbolos y búsqueda | 🧭 fundamentos | L2 | simbolos_y_busqueda |
ficha | nb |
| 1977 | P70 | Consistencia en redes de relaciones | ♟️ simbólica | L3 | arco_consistencia |
ficha | nb |
| 1980 | P135 | El sistema Hearsay-II: integrar conocimiento para resolver incertidumbre | ruta_agentes_operativos | L2 | pizarra |
ficha | nb |
| 1980 | P136 | El protocolo de red de contratos: comunicación y control en un resolutor distribuido | ruta_agentes_operativos | L2 | red_de_contratos |
ficha | nb |
| 1982 | P73 | Cuantización por mínimos cuadrados en PCM | 📈 clásica | L2 | kmeans |
ficha | nb |
| 1984 | P141 | El problema de las dos sigmas: buscar instrucción grupal tan eficaz como la tutoría individual | ruta_gobernanza | L1 | dos_sigma |
ficha | nb |
| 1986 | P02 | Aprender representaciones retropropagando errores | 🔗 cadena | L2 | backprop |
ficha | nb |
| 1986 | P74 | Inducción de árboles de decisión | 📈 clásica | L2 | id3 |
ficha | nb |
| 1986 | P91 | Fusión, propagación y estructuración en redes de creencia | ruta_probabilistica | L3 | redes_bayesianas |
ficha | nb |
| 1986 | P97 | Un sistema de control por capas robusto para un robot móvil | ruta_encarnada | L2 | subsuncion |
ficha | nb |
| 1989 | P142 | Interferencia catastrófica en redes conexionistas: el problema del aprendizaje secuencial | ruta_gobernanza | L2 | olvido_catastrofico |
ficha | nb |
| 1991 | P137 | Principios del metarrazonamiento | ruta_agentes_operativos | L3 | metarrazonamiento |
ficha | nb |
| 1993 | P71 | Un enfoque de traducción para especificaciones de ontologías portables | ♟️ simbólica | L1 | ontologia |
ficha | nb |
| 1994 | P138 | KQML como lenguaje de comunicación entre agentes | ruta_agentes_operativos | L2 | kqml |
ficha | nb |
| 1995 | P59 | Agentes inteligentes: teoría y práctica | 🧭 fundamentos | L2 | agente_racional |
ficha | nb |
| 1995 | P75 | Redes de vectores soporte | 📈 clásica | L3 | svm |
ficha | nb |
| 1995 | P76 | Un estudio de la validación cruzada y el bootstrap para estimar exactitud y seleccionar modelos | 📈 clásica | L3 | validacion_cruzada |
ficha | nb |
| 1995 | P92 | Optimización por enjambre de partículas | ruta_probabilistica | L2 | pso |
ficha | nb |
| 1996 | P77 | Contracción y selección en regresión mediante el lasso | 📈 clásica | L3 | lasso |
ficha | nb |
| 1996 | P93 | Sistema de hormigas: optimización mediante una colonia de agentes cooperantes | ruta_probabilistica | L2 | aco |
ficha | nb |
| 1997 | P03 | Memoria larga de corto plazo | 🔗 cadena | L2 | lstm |
ficha | nb |
| 1997 | P78 | Una generalización decisional del aprendizaje en línea y su aplicación al boosting | 📈 clásica | L3 | adaboost |
ficha | nb |
| 2000 | P139 | Un modelo de tipos y niveles de interacción humana con la automatización | ruta_agentes_operativos | L2 | niveles_de_automatizacion |
ficha | nb |
| 2000 | P98 | RRT-Connect: un enfoque eficiente para planificación de caminos de consulta única | ruta_encarnada | L3 | rrt |
ficha | nb |
| 2001 | P79 | Bosques aleatorios | 📈 clásica | L3 | random_forest |
ficha | nb |
| 2001 | P80 | Modelización estadística: las dos culturas | 📈 clásica | L1 | dos_culturas |
ficha | nb |
| 2003 | P81 | Introducción a la selección de variables y características | 📈 clásica | L3 | seleccion_de_caracteristicas |
ficha | nb |
| 2004 | P140 | MapReduce: procesamiento simplificado de datos en clústeres grandes | ruta_agentes_operativos | L1 | mapreduce |
ficha | nb |
| 2005 | P60 | Por qué la mayoría de los hallazgos publicados son falsos | 🧭 fundamentos | L3 | valor_predictivo |
ficha | nb |
| 2005 | P82 | Predecir buenas probabilidades con aprendizaje supervisado | 📈 clásica | L3 | calibracion |
ficha | nb |
| 2006 | P143 | Calibrar el ruido a la sensibilidad en el análisis privado de datos | ruta_gobernanza | L3 | privacidad_diferencial |
ficha | nb |
| 2006 | P99 | Localización y mapeo simultáneos: parte I | ruta_encarnada | L3 | slam |
ficha | nb |
| 2008 | P83 | Visualizar datos con t-SNE | 📈 clásica | L3 | tsne |
ficha | nb |
| 2008 | P84 | Bosque de aislamiento | 📈 clásica | L2 | isolation_forest |
ficha | nb |
| 2009 | P100 | Requisitos para robots seguros: mediciones, análisis y nuevas conclusiones | ruta_encarnada | L2 | seguridad_fisica |
ficha | nb |
| 2009 | P85 | Técnicas de factorización matricial para sistemas de recomendación | 📈 clásica | L3 | factorizacion_matricial |
ficha | nb |
| 2010 | P107 | Dapper, una infraestructura de trazado de sistemas distribuidos a gran escala | ruta_operacion | L2 | trazas_distribuidas |
ficha | nb |
| 2010 | P144 | Fuera del mundo cerrado: sobre el uso de aprendizaje automático para detectar intrusiones | ruta_gobernanza | L2 | ml_en_seguridad |
ficha | nb |
| 2011 | P101 | Una reducción del aprendizaje por imitación al aprendizaje en línea sin arrepentimiento | ruta_encarnada | L3 | dagger |
ficha | nb |
| 2012 | P04 | Clasificación de ImageNet con redes neuronales convolucionales profundas | 🔗 cadena | L3 | convnet |
ficha | nb |
| 2012 | P108 | CAP doce años después: cómo han cambiado las «reglas» | ruta_operacion | L2 | resiliencia |
ficha | nb |
| 2013 | P05 | Estimación eficiente de representaciones de palabras en un espacio vectorial | 🔗 cadena | L2 | word2vec |
ficha | nb |
| 2013 | P109 | La cola a escala | ruta_operacion | L2 | cola_larga |
ficha | nb |
| 2013 | P38 | Bayes variacional con autocodificación | 🏗️ arquitectura | L3 | vae |
ficha | nb |
| 2014 | P06 | Aprendizaje de secuencia a secuencia con redes neuronales | 🔗 cadena | L3 | seq2seq |
ficha | nb |
| 2014 | P07 | Traducción automática neuronal aprendiendo conjuntamente a alinear y traducir | 🔗 cadena | L3 | bahdanau |
ficha | nb |
| 2014 | P110 | Una revisión sobre adaptación a la deriva de concepto | ruta_operacion | L3 | deriva |
ficha | nb |
| 2014 | P23 | GloVe: vectores globales para representación de palabras | 🔤 representación | L2 | glove |
ficha | nb |
| 2014 | P39 | Redes generativas adversarias | 🏗️ arquitectura | L3 | gan |
ficha | nb |
| 2014 | P40 | Dropout: una forma simple de evitar el sobreajuste en redes neuronales | 🏗️ arquitectura | L2 | dropout |
ficha | nb |
| 2014 | P41 | Adam: un método de optimización estocástica | 🏗️ arquitectura | L2 | adam |
ficha | nb |
| 2014 | P42 | Explicar y aprovechar los ejemplos adversarios | 🏗️ arquitectura | L3 | adversarial |
ficha | nb |
| 2015 | P111 | Deuda técnica oculta en los sistemas de aprendizaje automático | ruta_operacion | L1 | deuda_tecnica |
ficha | nb |
| 2015 | P26 | Control a nivel humano mediante aprendizaje por refuerzo profundo | 🤖 agentes | L3 | dqn |
ficha | nb |
| 2015 | P43 | Normalización por lotes: acelerar el entrenamiento profundo | 🏗️ arquitectura | L2 | batchnorm |
ficha | nb |
| 2015 | P44 | Aprendizaje residual profundo para reconocimiento de imágenes | 🏗️ arquitectura | L3 | resnet |
ficha | nb |
| 2015 | P45 | Destilar el conocimiento de una red neuronal | 🏗️ arquitectura | L2 | distillation |
ficha | nb |
| 2016 | P118 | Traducción automática neuronal de palabras raras con unidades de subpalabra | ruta_percepcion | L2 | bpe |
ficha | nb |
| 2016 | P119 | WaveNet: un modelo generativo de audio en crudo | ruta_percepcion | L3 | wavenet |
ficha | nb |
| 2016 | P27 | Dominar el go con redes neuronales profundas y búsqueda en árbol | 🤖 agentes | L4 | alphago |
ficha | nb |
| 2017 | P08 | La atención es todo lo que necesitas | 🔗 cadena | L4 | transformer |
ficha | nb |
| 2017 | P102 | Algoritmos de optimización proximal de políticas | ruta_encarnada | L3 | ppo |
ficha | nb |
| 2017 | P103 | Aleatorización de dominio para transferir redes profundas de la simulación al mundo real | ruta_encarnada | L2 | domain_randomization |
ficha | nb |
| 2017 | P112 | La puntuación de pruebas de ML: una rúbrica de preparación para producción | ruta_operacion | L2 | ml_test_score |
ficha | nb |
| 2017 | P120 | Clasificación semisupervisada con redes convolucionales de grafo | ruta_percepcion | L2 | gcn |
ficha | nb |
| 2017 | P121 | MobileNets: redes convolucionales eficientes para visión en dispositivos móviles | ruta_percepcion | L2 | mobilenets |
ficha | nb |
| 2017 | P145 | Superar el olvido catastrófico en redes neuronales | ruta_gobernanza | L3 | ewc |
ficha | nb |
| 2017 | P146 | Aprendizaje eficiente en comunicación de redes profundas con datos descentralizados | ruta_gobernanza | L2 | federado |
ficha | nb |
| 2017 | P94 | Stan: un lenguaje de programación probabilística | ruta_probabilistica | L3 | programacion_probabilistica |
ficha | nb |
| 2018 | P09 | BERT: preentrenamiento de Transformers bidireccionales profundos para comprensión del lenguaje | 🔗 cadena | L3 | bert_mlm |
ficha | nb |
| 2018 | P113 | Aprendizaje por refuerzo profundo que importa | ruta_operacion | L3 | trazabilidad |
ficha | nb |
| 2018 | P122 | Síntesis de voz natural condicionando WaveNet con espectrogramas mel predichos | ruta_percepcion | L2 | tacotron |
ficha | nb |
| 2018 | P123 | SentencePiece: un tokenizador y detokenizador de subpalabras simple e independiente del idioma | ruta_percepcion | L2 | sentencepiece |
ficha | nb |
| 2018 | P124 | Redes de atención sobre grafos | ruta_percepcion | L3 | gat |
ficha | nb |
| 2018 | P147 | Los modelos recurrentes del mundo facilitan la evolución de políticas | ruta_gobernanza | L3 | world_models |
ficha | nb |
| 2018 | P24 | Representaciones profundas de palabras dependientes del contexto | 🔤 representación | L3 | elmo |
ficha | nb |
| 2018 | P86 | La competición M4: resultados, hallazgos, conclusiones y camino a seguir | 📈 clásica | L3 | m4 |
ficha | nb |
| 2019 | P114 | Tarjetas de modelo para el reporte de modelos | ruta_operacion | L1 | tarjetas_de_modelo |
ficha | nb |
| 2019 | P25 | Explorar los límites del aprendizaje por transferencia con un Transformer unificado texto a texto | 🔤 representación | L3 | t5 |
ficha | nb |
| 2019 | P95 | Las siete herramientas de la inferencia causal, con reflexiones sobre aprendizaje automático | ruta_probabilistica | L3 | causalidad |
ficha | nb |
| 2020 | P10 | Los modelos de lenguaje son aprendices con pocos ejemplos | 🔗 cadena | L3 | gpt3_icl |
ficha | nb |
| 2020 | P11 | Generación aumentada por recuperación para tareas de PLN intensivas en conocimiento | 🔗 cadena | L3 | rag |
ficha | nb |
| 2020 | P125 | LayoutLM: preentrenamiento de texto y disposición para comprensión de documentos | ruta_percepcion | L2 | layoutlm |
ficha | nb |
| 2020 | P127 | Jukebox: un modelo generativo de música | ruta_medios | L3 | jukebox |
ficha | nb |
| 2020 | P128 | NeRF: representar escenas como campos de radiancia neuronal | ruta_medios | L3 | nerf |
ficha | nb |
| 2020 | P148 | Cerrar la brecha de responsabilidad: un marco de auditoría algorítmica interna | ruta_gobernanza | L1 | auditoria_interna |
ficha | nb |
| 2020 | P17 | Modelos probabilísticos de difusión con eliminación de ruido | 📚 ampliada | L3 | diffusion |
ficha | nb |
| 2020 | P46 | Una imagen vale 16x16 palabras: Transformers para reconocimiento de imágenes a escala | 🏗️ arquitectura | L3 | vit |
ficha | nb |
| 2020 | P72 | IA neuro-simbólica: la tercera ola | ♟️ simbólica | L5 | neurosimbolico |
ficha | nb |
| 2021 | P115 | Hojas de datos para conjuntos de datos | ruta_operacion | L1 | hojas_de_datos |
ficha | nb |
| 2021 | P18 | Aprender modelos visuales transferibles con supervisión de lenguaje natural | 📚 ampliada | L3 | clip |
ficha | nb |
| 2021 | P34 | RoFormer: Transformer mejorado con codificación posicional rotatoria | 🧠 memoria | L3 | rope |
ficha | nb |
| 2021 | P47 | Predicción de estructura de proteínas de alta precisión con AlphaFold | 🏗️ arquitectura | L4 | alphafold |
ficha | nb |
| 2021 | P48 | LoRA: adaptación de rango bajo de modelos de lenguaje grandes | 🏗️ arquitectura | L3 | lora |
ficha | nb |
| 2021 | P61 | Sobre los peligros de los loros estocásticos: ¿pueden ser demasiado grandes los modelos de lenguaje? | 🧭 fundamentos | L1 | stochastic_parrots |
ficha | nb |
| 2021 | P62 | La IA y el benchmark del todo en el mundo entero | 🧭 fundamentos | L3 | benchmark_validez |
ficha | nb |
| 2021 | P63 | Mejorar la reproducibilidad en la investigación en aprendizaje automático | 🧭 fundamentos | L3 | reproducibilidad |
ficha | nb |
| 2022 | P12 | Entrenar modelos de lenguaje para seguir instrucciones con retroalimentación humana | 🔗 cadena | L3 | rlhf |
ficha | nb |
| 2022 | P126 | Transformer de comprensión de documentos sin OCR | ruta_percepcion | L3 | donut |
ficha | nb |
| 2022 | P13 | ReAct: sinergia entre razonar y actuar en modelos de lenguaje | 🔗 cadena | L2 | react |
ficha | nb |
| 2022 | P19 | Entrenar modelos de lenguaje grandes con cómputo óptimo | 📚 ampliada | L4 | scaling_laws |
ficha | nb |
| 2022 | P28 | El prompting de cadena de pensamiento provoca razonamiento en modelos de lenguaje grandes | 🤖 agentes | L2 | cot |
ficha | nb |
| 2022 | P35 | FlashAttention: atención exacta, rápida y eficiente en memoria, consciente de la E/S | 🧠 memoria | L4 | flashattention |
ficha | nb |
| 2022 | P50 | IA constitucional: inocuidad a partir de retroalimentación de IA | 🛡️ evaluación | L4 | constitutional_ai |
ficha | nb |
| 2023 | P104 | WebArena: un entorno web realista para construir agentes autónomos | ruta_encarnada | L3 | webarena |
ficha | nb |
| 2023 | P116 | Por qué Johnny no sabe hacer prompts: cómo los no expertos intentan (y fallan) diseñar prompts | ruta_operacion | L2 | gestion_de_prompts |
ficha | nb |
| 2023 | P117 | AgentBench: evaluar modelos de lenguaje como agentes | ruta_operacion | L3 | agentops |
ficha | nb |
| 2023 | P129 | MusicLM: generar música a partir de texto | ruta_medios | L3 | musiclm |
ficha | nb |
| 2023 | P130 | Los modelos de lenguaje sobre códecs neuronales sintetizan voz sin ejemplos previos | ruta_medios | L3 | vall_e |
ficha | nb |
| 2023 | P131 | Una marca de agua para modelos de lenguaje grandes | ruta_medios | L2 | marcas_de_agua |
ficha | nb |
| 2023 | P132 | Splatting de gaussianas 3D para renderizado de campos de radiancia en tiempo real | ruta_medios | L3 | gaussian_splatting |
ficha | nb |
| 2023 | P14 | Toolformer: los modelos de lenguaje pueden enseñarse a sí mismos a usar herramientas | 🔗 cadena | L3 | toolformer |
ficha | nb |
| 2023 | P15 | Optimización directa de preferencias: tu modelo de lenguaje ya es un modelo de recompensa | 🔗 cadena | L4 | dpo |
ficha | nb |
| 2023 | P16 | Sistemas agentic contemporáneos: memoria, reflexión, multiagente e interoperabilidad | 🔗 cadena | L5 | agentic |
ficha | nb |
| 2023 | P20 | Mamba: modelado de secuencias en tiempo lineal con espacios de estados selectivos | 📚 ampliada | L4 | ssm |
ficha | nb |
| 2023 | P29 | Árbol de pensamientos: resolución deliberada de problemas con modelos de lenguaje grandes | 🤖 agentes | L3 | tot |
ficha | nb |
| 2023 | P30 | Reflexion: agentes de lenguaje con refuerzo verbal | 🤖 agentes | L2 | reflexion |
ficha | nb |
| 2023 | P31 | Agentes generativos: simulacros interactivos de comportamiento humano | 🤖 agentes | L3 | generative_agents |
ficha | nb |
| 2023 | P32 | Voyager: un agente encarnado de final abierto con modelos de lenguaje grandes | 🤖 agentes | L3 | voyager |
ficha | nb |
| 2023 | P33 | AutoGen: aplicaciones de nueva generación mediante conversación multiagente | 🤖 agentes | L4 | autogen |
ficha | nb |
| 2023 | P36 | Perdidos en el medio: cómo usan los modelos de lenguaje los contextos largos | 🧠 memoria | L3 | lost_in_middle |
ficha | nb |
| 2023 | P37 | MemGPT: modelos de lenguaje como sistemas operativos | 🧠 memoria | L3 | memgpt |
ficha | nb |
| 2023 | P49 | QLoRA: ajuste fino eficiente de modelos cuantizados | 🏗️ arquitectura | L3 | quantization |
ficha | nb |
| 2023 | P51 | SWE-bench: ¿pueden los modelos resolver incidencias reales de GitHub? | 🛡️ evaluación | L3 | swebench |
ficha | nb |
| 2023 | P52 | Hacia la monosemanticidad: descomponer modelos de lenguaje con aprendizaje de diccionario | 🛡️ evaluación | L5 | superposition |
ficha | nb |
| 2024 | P105 | SeeClick: aprovechar el anclaje visual para agentes avanzados de interfaz gráfica | ruta_encarnada | L2 | seeclick |
ficha | nb |
| 2024 | P106 | OSWorld: evaluación de agentes multimodales en tareas abiertas sobre entornos informáticos reales | ruta_encarnada | L3 | osworld |
ficha | nb |
| 2024 | P133 | Los modelos de IA colapsan al entrenarse con datos generados recursivamente | ruta_medios | L2 | colapso_de_modelo |
ficha | nb |
| 2024 | P21 | Mixtral: mezcla dispersa de expertos | 📚 ampliada | L3 | moe |
ficha | nb |
| 2025 | P22 | DeepSeek-R1: incentivar la capacidad de razonamiento mediante aprendizaje por refuerzo | 📚 ampliada | L5 | rl_reasoning |
ficha | nb |
🧭 Vista temática — por bloque
🔗 cadena
P01–P16: la cadena canónica donde cada paper resuelve lo que el anterior dejó abierto. Se estudia en orden.
- 1958 · P01 · El perceptrón: un modelo probabilístico de almacenamiento y organización de información en el cerebro — Primera máquina que aprende sus propios pesos a partir de ejemplos en lugar de ejecutar reglas escritas por una persona.
- 1986 · P02 · Aprender representaciones retropropagando errores — Un procedimiento práctico para entrenar capas ocultas: la red descubre representaciones intermedias que nadie diseñó.
- 1997 · P03 · Memoria larga de corto plazo — Primera arquitectura recurrente capaz de mantener información a través de cientos de pasos sin que el gradiente se desvanezca.
- 2012 · P04 · Clasificación de ImageNet con redes neuronales convolucionales profundas — El resultado que convirtió el deep learning en la corriente principal: margen amplio sobre los métodos de visión hechos a mano.
- 2013 · P05 · Estimación eficiente de representaciones de palabras en un espacio vectorial — El significado distribucional se vuelve barato: vectores densos entrenables sobre miles de millones de palabras.
- 2014 · P06 · Aprendizaje de secuencia a secuencia con redes neuronales — Una única red aprende a mapear secuencias de longitud variable a secuencias de longitud variable, de extremo a extremo.
- 2014 · P07 · Traducción automática neuronal aprendiendo conjuntamente a alinear y traducir — Nace la atención: el decodificador deja de depender de un único vector y consulta toda la entrada en cada paso.
- 2017 · P08 · La atención es todo lo que necesitas — Elimina la recurrencia y la convolución del modelado de secuencias: todo el cómputo de una capa se paraleliza.
- 2018 · P09 · BERT: preentrenamiento de Transformers bidireccionales profundos para comprensión del lenguaje — Consolida el patrón preentrenar-y-ajustar: un mismo modelo base sirve para muchas tareas con un ajuste pequeño.
- 2020 · P10 · Los modelos de lenguaje son aprendices con pocos ejemplos — El aprendizaje en contexto: la tarea se especifica en el prompt y el modelo se adapta sin actualizar ningún peso.
- 2020 · P11 · Generación aumentada por recuperación para tareas de PLN intensivas en conocimiento — Separa el conocimiento (índice consultable y actualizable) del razonamiento (parámetros del modelo).
- 2022 · P12 · Entrenar modelos de lenguaje para seguir instrucciones con retroalimentación humana — El salto de «modelo que completa texto» a «asistente que sigue instrucciones»: alineación con preferencias humanas.
- 2022 · P13 · ReAct: sinergia entre razonar y actuar en modelos de lenguaje — El modelo deja de ser solo un generador de texto y pasa a ser el controlador de un bucle que observa y actúa.
- 2023 · P14 · Toolformer: los modelos de lenguaje pueden enseñarse a sí mismos a usar herramientas — El uso de herramientas se aprende de forma autosupervisada: el criterio de utilidad es la propia pérdida del modelo.
- 2023 · P15 · Optimización directa de preferencias: tu modelo de lenguaje ya es un modelo de recompensa — Alinear un modelo con preferencias humanas sin modelo de recompensa explícito ni bucle de aprendizaje por refuerzo.
- 2023 · P16 · Sistemas agentic contemporáneos: memoria, reflexión, multiagente e interoperabilidad — El agente deja de ser un bucle y pasa a ser un sistema: memoria, reflexión, planificación, presupuesto, múltiples agentes y protocolos de interoperabilidad.
📚 ampliada
P17–P22: cobertura que la cadena mínima no da (generativa, multimodal, escalado) y continuación hasta 2025. Ordenada por año.
- 2020 · P17 · Modelos probabilísticos de difusión con eliminación de ruido — La generación deja de ser un salto en la oscuridad: se aprende a deshacer, paso a paso, un proceso de ruido conocido.
- 2021 · P18 · Aprender modelos visuales transferibles con supervisión de lenguaje natural — El texto se convierte en la etiqueta: un solo modelo clasifica categorías que nadie anotó, describiéndolas con palabras.
- 2022 · P19 · Entrenar modelos de lenguaje grandes con cómputo óptimo — Corrige la carrera por el tamaño: a cómputo fijo, los modelos de la época estaban infraentrenados en datos.
- 2023 · P20 · Mamba: modelado de secuencias en tiempo lineal con espacios de estados selectivos — El primer competidor serio del Transformer en lenguaje: tiempo lineal y estado de tamaño fijo, sin atención.
- 2024 · P21 · Mixtral: mezcla dispersa de expertos — Desacopla capacidad de cómputo: 47 000 millones de parámetros totales, 13 000 millones activos por token.
- 2025 · P22 · DeepSeek-R1: incentivar la capacidad de razonamiento mediante aprendizaje por refuerzo — El razonamiento se incentiva con refuerzo puro, sin trazas humanas anotadas; y es el primer LLM de pesos abiertos publicado tras revisión por pares.
🔤 representación
P23–P25: cómo el lenguaje pasó de vectores estáticos a representaciones contextuales y de ahí a un formato único texto → texto. Ordenada por año.
- 2014 · P23 · GloVe: vectores globales para representación de palabras — Unifica las dos familias de embeddings: factorizar estadísticas globales de co-ocurrencia con la ventaja de los métodos predictivos.
- 2018 · P24 · Representaciones profundas de palabras dependientes del contexto — Un vector por APARICIÓN y no por palabra: la polisemia deja de colapsar en un único punto del espacio.
- 2019 · P25 · Explorar los límites del aprendizaje por transferencia con un Transformer unificado texto a texto — Todo problema de texto se reescribe como texto → texto: un solo modelo, una sola pérdida, cero cabezas específicas.
🤖 agentes
P26–P33: decisión secuencial y agentes. Empieza en el refuerzo profundo y la búsqueda guiada —de donde viene la idea de agente— y llega al razonamiento deliberado, la memoria, las habilidades reutilizables y el multiagente. Ordenada por año.
- 2015 · P26 · Control a nivel humano mediante aprendizaje por refuerzo profundo — El primer agente que aprende a actuar directamente desde píxeles, con la misma arquitectura y los mismos hiperparámetros en decenas de juegos.
- 2016 · P27 · Dominar el go con redes neuronales profundas y búsqueda en árbol — Une las dos tradiciones de la IA: la búsqueda simbólica de la parte 01 y el aprendizaje profundo de la parte 04, en un solo sistema.
- 2022 · P28 · El prompting de cadena de pensamiento provoca razonamiento en modelos de lenguaje grandes — Descomponer en pasos intermedios desbloquea tareas que el mismo modelo fallaba respondiendo de una vez.
- 2023 · P29 · Árbol de pensamientos: resolución deliberada de problemas con modelos de lenguaje grandes — Devuelve la búsqueda clásica al razonamiento: explorar varias ramas, evaluarlas y poder retroceder.
- 2023 · P30 · Reflexion: agentes de lenguaje con refuerzo verbal — El agente aprende entre intentos sin tocar un solo peso: el refuerzo ocurre en el contexto, en lenguaje natural.
- 2023 · P31 · Agentes generativos: simulacros interactivos de comportamiento humano — Resuelve la memoria de un agente que vive mucho tiempo: qué recordar, cuándo y por qué, cuando el contexto no da para todo.
- 2023 · P32 · Voyager: un agente encarnado de final abierto con modelos de lenguaje grandes — El agente acumula habilidades reutilizables en vez de contexto: memoria procedimental que no se borra al terminar la tarea.
- 2023 · P33 · AutoGen: aplicaciones de nueva generación mediante conversación multiagente — El multiagente deja de ser una metáfora y pasa a ser un patrón de programación: agentes con rol que conversan hasta converger.
🧠 memoria
P34–P37: cómo se codifica la posición, por qué el contexto largo es viable, por qué tenerlo no basta y cómo se gestiona como memoria jerárquica.
- 2021 · P34 · RoFormer: Transformer mejorado con codificación posicional rotatoria — La posición se codifica rotando, y la atención pasa a depender solo de la distancia relativa. Es la base de casi todo modelo actual.
- 2022 · P35 · FlashAttention: atención exacta, rápida y eficiente en memoria, consciente de la E/S — El cuello de botella de la atención no eran los FLOPs sino las lecturas y escrituras a memoria. Y la solución es EXACTA, no aproximada.
- 2023 · P36 · Perdidos en el medio: cómo usan los modelos de lenguaje los contextos largos — Tener contexto largo no es usarlo: el rendimiento cae en forma de U cuando el dato relevante está en el medio.
- 2023 · P37 · MemGPT: modelos de lenguaje como sistemas operativos — Aplica al contexto la idea de memoria virtual: una jerarquía que da la ilusión de memoria grande sobre una pequeña y rápida.
🏗️ arquitectura
P38–P49: el andamiaje que hace entrenable todo lo demás — generativa clásica, regularización, optimización, robustez, normalización, profundidad, compresión, visión con Transformer, ciencia aplicada y adaptación eficiente.
- 2013 · P38 · Bayes variacional con autocodificación — Hace entrenable un modelo generativo latente: el truco de reparametrización deja pasar el gradiente a través del muestreo.
- 2014 · P39 · Redes generativas adversarias — Convierte la generación en un juego: dos redes compiten y ninguna necesita una verosimilitud explícita.
- 2014 · P40 · Dropout: una forma simple de evitar el sobreajuste en redes neuronales — Apagar unidades al azar durante el entrenamiento equivale a entrenar un ensamblado exponencial de subredes que comparten pesos.
- 2014 · P41 · Adam: un método de optimización estocástica — Un paso de aprendizaje por dimensión, adaptado a la escala de su propio gradiente. Es el optimizador por defecto de casi todo lo que vino después.
- 2014 · P42 · Explicar y aprovechar los ejemplos adversarios — Una perturbación imperceptible cambia la predicción. Y la causa no es la profundidad: es la linealidad en dimensión alta.
- 2015 · P43 · Normalización por lotes: acelerar el entrenamiento profundo — Normalizar las activaciones dentro de la red permite tasas de aprendizaje mucho mayores y hace el entrenamiento profundo mucho menos frágil.
- 2015 · P44 · Aprendizaje residual profundo para reconocimiento de imágenes — El atajo identidad hace apilables cientos de capas. Es la misma idea aditiva de la LSTM, aplicada a la profundidad.
- 2015 · P45 · Destilar el conocimiento de una red neuronal — Las probabilidades del maestro contienen más información que la etiqueta correcta: el modelo pequeño aprende de esa estructura.
- 2020 · P46 · Una imagen vale 16x16 palabras: Transformers para reconocimiento de imágenes a escala — Trata la imagen como una secuencia de parches y aplica un Transformer puro: la convolución deja de ser imprescindible en visión.
- 2021 · P47 · Predicción de estructura de proteínas de alta precisión con AlphaFold — Resuelve en la práctica un problema abierto de cincuenta años en biología, y demuestra que la IA puede producir conocimiento científico, no solo productos.
- 2021 · P48 · LoRA: adaptación de rango bajo de modelos de lenguaje grandes — Ajustar un modelo enorme entrenando una fracción diminuta de parámetros, sin coste añadido en inferencia.
- 2023 · P49 · QLoRA: ajuste fino eficiente de modelos cuantizados — Pone el ajuste fino de un modelo muy grande al alcance de una sola GPU de consumo.
🛡️ evaluación
P50–P52: cómo se decide que un modelo es aceptable — principios explícitos, criterios de evaluación verificables e interpretabilidad de lo que hay dentro.
- 2022 · P50 · IA constitucional: inocuidad a partir de retroalimentación de IA — Sustituye parte del juicio humano por un conjunto de principios explícitos y auditables, y por la autocrítica del modelo.
- 2023 · P51 · SWE-bench: ¿pueden los modelos resolver incidencias reales de GitHub? — Cambia el criterio de evaluación: no si el código parece bien, sino si los tests del repositorio real pasan.
- 2023 · P52 · Hacia la monosemanticidad: descomponer modelos de lenguaje con aprendizaje de diccionario — Explica por qué una neurona no significa una cosa, y propone una forma de descomponer las activaciones en características interpretables.
🧭 fundamentos
P53–P63: de dónde sale el campo y con qué método se juzga. No es la cadena técnica: es el suelo —geometría, información, computabilidad, agencia— y el criterio con el que se lee todo lo demás (valor predictivo, validez de benchmark, reproducibilidad). Ordenada por año.
- 1901 · P53 · Sobre las líneas y planos de ajuste más próximo a sistemas de puntos en el espacio — La primera respuesta al problema de resumir una nube de puntos con menos dimensiones sin privilegiar ninguna variable.
- 1943 · P54 · Un cálculo lógico de las ideas inmanentes en la actividad nerviosa — Establece que una red de neuronas de umbral puede calcular cualquier función lógica: el puente entre biología y computación.
- 1948 · P55 · Una teoría matemática de la comunicación — Define la información como reducción de incertidumbre y le pone unidad, cota y límite: el bit, la entropía y la capacidad del canal.
- 1950 · P56 · Maquinaria computacional e inteligencia — Cambia una pregunta metafísica —¿pueden pensar las máquinas?— por un procedimiento que se puede ejecutar y discutir.
- 1955 · P57 · Propuesta para el proyecto de investigación de verano de Dartmouth sobre inteligencia artificial — Bautiza el campo y fija su agenda: siete temas que aún organizan buena parte de la investigación.
- 1976 · P58 · La informática como indagación empírica: símbolos y búsqueda — Enuncia las dos hipótesis que resumen veinte años de IA simbólica: el sistema de símbolos físicos y la búsqueda heurística.
- 1995 · P59 · Agentes inteligentes: teoría y práctica — Fija qué es un agente y qué propiedades lo definen, y separa la teoría de las arquitecturas y de los lenguajes que la implementan.
- 2005 · P60 · Por qué la mayoría de los hallazgos publicados son falsos — Muestra con un modelo explícito que la probabilidad de que un hallazgo publicado sea cierto depende del diseño y de los incentivos, no del valor p.
- 2021 · P61 · Sobre los peligros de los loros estocásticos: ¿pueden ser demasiado grandes los modelos de lenguaje? — Pone por escrito el coste de la carrera por el tamaño: quién paga, quién queda representado y qué se afirma de más sobre la comprensión.
- 2021 · P62 · La IA y el benchmark del todo en el mundo entero — Traslada al campo el concepto de validez de constructo: un número alto no prueba la capacidad que el benchmark dice medir.
- 2021 · P63 · Mejorar la reproducibilidad en la investigación en aprendizaje automático — Convierte la reproducibilidad en un requisito operativo del proceso de publicación, con checklist, código y revisión.
♟️ simbólica
P64–P72: la tradición que dominó el campo durante treinta años. Del análisis medios-fines a la planificación, pasando por la búsqueda con garantía, las dos lógicas, las restricciones y las ontologías; cierra con el intento de reconciliarla con el aprendizaje. Ordenada por año.
- 1959 · P64 · Informe sobre un programa general de resolución de problemas — Separa por primera vez el método de resolución del dominio concreto: el análisis medios-fines elige el operador por la diferencia que reduce.
- 1962 · P65 · Un programa de máquina para demostración de teoremas — El algoritmo que sigue siendo el esqueleto de todo solucionador SAT moderno: propagar primero, ramificar solo cuando no queda deducción por hacer.
- 1965 · P66 · Una lógica orientada a máquina basada en el principio de resolución — Reduce toda la inferencia de primer orden a una sola regla, y hace la unificación computable con el unificador más general.
- 1968 · P67 · Una base formal para la determinación heurística de caminos de coste mínimo — Convierte la heurística de recurso práctico en garantía demostrable: si nunca sobrestima, el camino encontrado es óptimo.
- 1971 · P68 · STRIPS: un nuevo enfoque para aplicar la demostración de teoremas a la resolución de problemas — Da a la planificación su representación duradera —precondición, añadir, borrar— y con ella una respuesta práctica al problema del marco.
- 1975 · P69 · Un modelo de razonamiento inexacto en medicina — El motor de MYCIN: razonar con grados de creencia y explicar cada conclusión por las reglas que la sostienen.
- 1977 · P70 · Consistencia en redes de relaciones — Convierte la propagación de restricciones en un preproceso con nombre y algoritmo: podar dominios antes de buscar, no mientras se busca.
- 1993 · P71 · Un enfoque de traducción para especificaciones de ontologías portables — Da la definición que se sigue citando —una ontología es una especificación explícita de una conceptualización— y cinco criterios para juzgarla.
- 2020 · P72 · IA neuro-simbólica: la tercera ola — Ordena la agenda de integrar aprendizaje y razonamiento en vez de elegir uno de los dos.
📈 clásica
P73–P86: aprender la regla de los datos en vez de escribirla. Agrupar, dividir, separar con margen, regularizar, combinar modelos débiles y —tan importante como todo lo anterior— medir bien: estimadores, calibración, selección de variables y evaluación fuera de muestra. Ordenada por año.
- 1982 · P73 · Cuantización por mínimos cuadrados en PCM — El algoritmo de agrupamiento más usado del mundo, con la demostración de que converge —y de que converge a un óptimo local, no al global.
- 1986 · P74 · Inducción de árboles de decisión — Aprende un modelo que una persona puede leer, eligiendo cada pregunta por cuánta incertidumbre elimina.
- 1995 · P75 · Redes de vectores soporte — Convierte la elección entre clasificadores que aciertan igual en un criterio con justificación teórica: el margen.
- 1995 · P76 · Un estudio de la validación cruzada y el bootstrap para estimar exactitud y seleccionar modelos — Fija la práctica estándar de evaluación —diez pliegues estratificados— con evidencia empírica en lugar de costumbre.
- 1996 · P77 · Contracción y selección en regresión mediante el lasso — Una penalización que estima y selecciona a la vez: pone coeficientes exactamente en cero.
- 1997 · P78 · Una generalización decisional del aprendizaje en línea y su aplicación al boosting — Demuestra que muchos clasificadores apenas mejores que el azar se combinan en uno arbitrariamente bueno, y da el algoritmo que lo hace.
- 2001 · P79 · Bosques aleatorios — Demuestra que el error de un conjunto depende de la fuerza de sus miembros Y de su correlación, y que empeorarlos a propósito puede mejorarlo.
- 2001 · P80 · Modelización estadística: las dos culturas — Nombra la división que organiza el campo: suponer un mecanismo generador frente a medir la capacidad de predecir.
- 2003 · P81 · Introducción a la selección de variables y características — Ordena el problema de elegir variables y demuestra por qué el ranking de una en una falla en las dos direcciones.
- 2005 · P82 · Predecir buenas probabilidades con aprendizaje supervisado — Separa dos cosas que se confundían: ordenar bien los ejemplos y estimar bien la probabilidad de cada uno.
- 2008 · P83 · Visualizar datos con t-SNE — Hace visibles las estructuras locales de datos de alta dimensión, y con ello se convierte en la figura por defecto de media década de artículos.
- 2008 · P84 · Bosque de aislamiento — Invierte el planteamiento de la detección de anomalías: en vez de modelar lo normal, mide lo fácil que es aislar cada punto.
- 2009 · P85 · Técnicas de factorización matricial para sistemas de recomendación — El método que ganó el Netflix Prize, explicado con lo que de verdad importa: los sesgos antes que los gustos.
- 2018 · P86 · La competición M4: resultados, hallazgos, conclusiones y camino a seguir — Cien mil series y sesenta y un métodos para responder empíricamente qué funciona al predecir series temporales — y la respuesta incomoda a todo el mundo.
ruta_probabilistica
P87–P95: decidir sin certeza. Por qué la probabilidad es la única extensión coherente de la lógica, cómo se actualiza una creencia, qué hace tratable la conjunta, y las dos familias que buscan sin gradiente. Cierra con la distinción que el aprendizaje automático no resuelve: asociar no es intervenir. Ordenada por año.
- 1763 · P87 · Ensayo para resolver un problema en la doctrina de las probabilidades — La regla que invierte el condicional: pasar de «qué esperaría ver si la hipótesis fuese cierta» a «cuán probable es la hipótesis dado lo que he visto».
- 1946 · P88 · Probabilidad, frecuencia y expectativa razonable — Demuestra que la probabilidad no es una convención entre varias: es la única forma consistente de extender la lógica a grados de creencia.
- 1965 · P89 · Conjuntos difusos — Permite que un elemento pertenezca parcialmente a un conjunto, y con eso da tratamiento formal a la vaguedad de los predicados del lenguaje.
- 1973 · P90 · Algoritmos genéticos y la asignación óptima de ensayos — Conecta la evolución artificial con un problema de decisión clásico: cómo repartir ensayos entre alternativas cuando explorar cuesta.
- 1986 · P91 · Fusión, propagación y estructuración en redes de creencia — Hace tratable la probabilidad en IA: la estructura del grafo dice qué hay que almacenar y qué se puede propagar localmente.
- 1995 · P92 · Optimización por enjambre de partículas — Optimiza sin gradiente con dos únicas memorias: lo mejor que ha encontrado cada individuo y lo mejor que ha encontrado el grupo.
- 1996 · P93 · Sistema de hormigas: optimización mediante una colonia de agentes cooperantes — La solución no está en ningún agente: está en el rastro que dejan en el entorno y que se refuerza y se evapora.
- 2017 · P94 · Stan: un lenguaje de programación probabilística — Separa declarar el modelo de calcular la inferencia: se escribe qué se supone del mundo y el motor devuelve la posterior.
- 2019 · P95 · Las siete herramientas de la inferencia causal, con reflexiones sobre aprendizaje automático — Ordena en tres peldaños lo que un sistema puede responder —asociación, intervención y contrafáctico— y muestra que subir de peldaño exige supuestos que los datos no contienen.
ruta_encarnada
P96–P106: cuando el sistema sale de la pantalla y equivocarse tiene consecuencias que no se deshacen. Estimar dónde se está, moverse sin chocar, aprender a controlar, cruzar el hueco entre simulación y realidad, y no hacer daño. Cierra con la vuelta a la pantalla ajena: agentes que operan navegadores y escritorios. Ordenada por año.
- 1960 · P96 · Un nuevo enfoque para los problemas de filtrado y predicción lineales — Fusiona un modelo del movimiento con un sensor ruidoso ponderando cada fuente por su propia incertidumbre, y lo hace de forma recursiva.
- 1986 · P97 · Un sistema de control por capas robusto para un robot móvil — Demuestra que un robot puede comportarse de forma competente sin modelo del mundo, sin planificador y sin representación central.
- 2000 · P98 · RRT-Connect: un enfoque eficiente para planificación de caminos de consulta única — Planifica en espacios continuos de muchas dimensiones sin discretizarlos, creciendo un árbol hacia muestras aleatorias.
- 2006 · P99 · Localización y mapeo simultáneos: parte I — Formaliza el problema circular de la robótica móvil: no se puede localizar sin mapa ni mapear sin localización, y hay que resolver ambos a la vez.
- 2009 · P100 · Requisitos para robots seguros: mediciones, análisis y nuevas conclusiones — Sustituye la intuición sobre seguridad robótica por mediciones de impacto con maniquíes y criterios de lesión validados.
- 2011 · P101 · Una reducción del aprendizaje por imitación al aprendizaje en línea sin arrepentimiento — Explica por qué la clonación de comportamiento se degrada con el horizonte, y da un algoritmo que reduce el error de orden T² a orden T.
- 2017 · P102 · Algoritmos de optimización proximal de políticas — Consigue la estabilidad de TRPO con una función objetivo que se implementa en unas líneas y se optimiza con descenso de gradiente corriente.
- 2017 · P103 · Aleatorización de dominio para transferir redes profundas de la simulación al mundo real — Invierte el objetivo del simulador: en vez de buscar fidelidad, busca que la realidad sea una variación más dentro del rango de entrenamiento.
- 2023 · P104 · WebArena: un entorno web realista para construir agentes autónomos — Evalúa agentes de navegador comprobando el ESTADO del sitio al terminar, no lo que el agente dice haber hecho.
- 2024 · P105 · SeeClick: aprovechar el anclaje visual para agentes avanzados de interfaz gráfica — Aísla el anclaje —de una instrucción a unas coordenadas— como la capacidad que separa describir una pantalla de poder operarla.
- 2024 · P106 · OSWorld: evaluación de agentes multimodales en tareas abiertas sobre entornos informáticos reales — Lleva la evaluación de agentes al escritorio completo, con tareas que cruzan aplicaciones y un verificador por tarea que inspecciona el sistema real.
ruta_operacion
P107–P117: lo que sostiene un sistema en producción y no aparece en ningún artículo de modelos. Ver qué pasa dentro, decidir qué se sacrifica cuando la red se parte, sobrevivir a la cola de latencia, detectar que el mundo cambió, y documentar datos y modelos para que alguien más pueda auditarlos. Cierra con la evaluación de agentes por trayectoria. Ordenada por año.
- 2010 · P107 · Dapper, una infraestructura de trazado de sistemas distribuidos a gran escala — Hace observable una petición que atraviesa decenas de servicios, con un identificador que viaja con ella y un muestreo que la hace asequible.
- 2012 · P108 · CAP doce años después: cómo han cambiado las «reglas» — Corrige la lectura simplista de su propio teorema: no se eligen dos de tres, se elige por operación y solo mientras dura la partición.
- 2013 · P109 · La cola a escala — Muestra que con abanico grande la latencia de cola de cada componente se convierte en la latencia típica del sistema completo.
- 2014 · P110 · Una revisión sobre adaptación a la deriva de concepto — Ordena el problema de que el mundo cambie después de entrenar, y separa detectar de adaptarse.
- 2015 · P111 · Deuda técnica oculta en los sistemas de aprendizaje automático — Nombra el hecho incómodo del área: el código del modelo es una fracción diminuta del sistema, y el resto acumula una deuda que ninguna herramienta detecta.
- 2017 · P112 · La puntuación de pruebas de ML: una rúbrica de preparación para producción — Convierte «¿está listo para producción?» en una rúbrica de 28 pruebas concretas, puntuada por su categoría más débil.
- 2018 · P113 · Aprendizaje por refuerzo profundo que importa — Demuestra empíricamente que con pocas semillas el ranking entre algoritmos es una moneda al aire, y que muchas mejoras publicadas no sobreviven a la comprobación.
- 2019 · P114 · Tarjetas de modelo para el reporte de modelos — Propone un documento corto y estandarizado que acompaña a cada modelo, con evaluación desagregada por subgrupo y usos fuera de alcance declarados.
- 2021 · P115 · Hojas de datos para conjuntos de datos — Traslada a los conjuntos de datos la hoja de características que acompaña a cualquier componente electrónico: qué es, cómo se hizo y para qué no sirve.
- 2023 · P116 · Por qué Johnny no sabe hacer prompts: cómo los no expertos intentan (y fallan) diseñar prompts — Documenta con usuarios reales que iterar prompts sin conjunto de evaluación produce mejoras imaginarias, y por qué la intuición falla sistemáticamente.
- 2023 · P117 · AgentBench: evaluar modelos de lenguaje como agentes — Evalúa agentes en ocho entornos distintos y hace visible que la tasa agregada esconde dónde y cómo fallan.
ruta_percepcion
P118–P126: cómo entra el mundo en el modelo cuando no es texto limpio. Partir la palabra en unidades que siempre existen, modelar la forma de onda, aprender sobre grafos, caber en un dispositivo pequeño y leer un documento donde la posición es parte del significado. Ordenada por año.
- 2016 · P118 · Traducción automática neuronal de palabras raras con unidades de subpalabra — Elimina el problema de la palabra desconocida haciendo que la unidad de vocabulario sea más pequeña que la palabra, con un algoritmo que la frecuencia decide sola.
- 2016 · P119 · WaveNet: un modelo generativo de audio en crudo — Genera la forma de onda muestra a muestra con convoluciones causales dilatadas, y cierra la brecha de naturalidad que arrastraba la síntesis de voz.
- 2017 · P120 · Clasificación semisupervisada con redes convolucionales de grafo — Reduce la convolución sobre grafos a una regla de propagación de una línea, y con ella clasifica con una fracción mínima de nodos etiquetados.
- 2017 · P121 · MobileNets: redes convolucionales eficientes para visión en dispositivos móviles — Descompone la convolución en dos pasos y convierte el compromiso entre precisión y coste en dos perillas explícitas que el ingeniero elige.
- 2018 · P122 · Síntesis de voz natural condicionando WaveNet con espectrogramas mel predichos — Parte la síntesis en dos etapas con el espectrograma mel como interfaz, y alcanza naturalidad indistinguible de una grabación en la escala de opinión media.
- 2018 · P123 · SentencePiece: un tokenizador y detokenizador de subpalabras simple e independiente del idioma — Elimina la pretokenización por espacios y hace la detokenización exacta, lo que convierte al tokenizador en una pieza reproducible e independiente del idioma.
- 2018 · P124 · Redes de atención sobre grafos — Sustituye el promedio uniforme sobre los vecinos por pesos aprendidos por pareja, sin necesitar conocer la estructura global del grafo.
- 2020 · P125 · LayoutLM: preentrenamiento de texto y disposición para comprensión de documentos — Añade la posición en la página como una incrustación más, y con eso convierte un modelo de lenguaje en un lector de formularios y facturas.
- 2022 · P126 · Transformer de comprensión de documentos sin OCR — Va de la imagen del documento a la salida estructurada sin pasar por OCR, y con ello elimina una fuente de error que la etapa siguiente no podía corregir.
ruta_medios
P127–P133: generar medios y el problema que eso crea. Música con estructura, escenas 3D que no se modelan a mano, voces que se copian con tres segundos. Cierra con las dos consecuencias inevitables: cómo saber qué se generó y qué le pasa a un corpus que se alimenta de sí mismo. Ordenada por año.
- 2020 · P127 · Jukebox: un modelo generativo de música — Genera canciones con voz cantada reconocible modelando códigos discretos en tres escalas temporales, en vez de la forma de onda directamente.
- 2020 · P128 · NeRF: representar escenas como campos de radiancia neuronal — Sustituye la escena explícita por una función continua que un perceptrón representa, y sintetiza vistas nuevas con una fidelidad que no se había visto.
- 2023 · P129 · MusicLM: generar música a partir de texto — Genera música coherente de varios minutos desde una descripción en lenguaje natural, y publica MusicCaps para que la tarea se pueda evaluar.
- 2023 · P130 · Los modelos de lenguaje sobre códecs neuronales sintetizan voz sin ejemplos previos — Convierte la síntesis de voz en modelado de lenguaje sobre códigos de audio, y clona una voz con tres segundos de muestra sin entrenar nada.
- 2023 · P131 · Una marca de agua para modelos de lenguaje grandes — Deja una firma estadística verificable en el texto generado sesgando qué tokens se eligen, sin degradar apreciablemente la calidad ni necesitar el modelo para detectarla.
- 2023 · P132 · Splatting de gaussianas 3D para renderizado de campos de radiancia en tiempo real — Alcanza calidad de campo de radiancia a velocidad de tiempo real cambiando la función continua por millones de primitivas explícitas que se rasterizan.
- 2024 · P133 · Los modelos de IA colapsan al entrenarse con datos generados recursivamente — Demuestra que entrenar generación tras generación con datos sintéticos estrecha la distribución de forma irreversible, sin que ningún modelo cometa error alguno.
ruta_agentes_operativos
P134–P140: lo que hace falta para que un agente opere de verdad, y que se resolvió décadas antes de que hubiera agentes. Qué permisos darle, cómo coordinar varios sin un jefe que lo sepa todo, cuánto dejarle pensar, en qué idioma hablan entre ellos, cuánto dejar decidir a la máquina y cómo repartir el trabajo. Ordenada por año.
- 1975 · P134 · La protección de la información en los sistemas informáticos — Enuncia los ocho principios de diseño de protección que siguen siendo la base de cualquier discusión sobre permisos, cincuenta años después.
- 1980 · P135 · El sistema Hearsay-II: integrar conocimiento para resolver incertidumbre — Introduce la arquitectura de pizarra: fuentes de conocimiento independientes que publican hipótesis en una estructura compartida, sin llamarse entre sí.
- 1980 · P136 · El protocolo de red de contratos: comunicación y control en un resolutor distribuido — Reparte tareas por anuncio, oferta y adjudicación, sin que nadie mantenga una lista de quién sabe hacer qué.
- 1991 · P137 · Principios del metarrazonamiento — Convierte «cuánto pensar» en una decisión que se toma con el mismo criterio que cualquier otra: comparando el valor esperado de deliberar con lo que deliberar cuesta.
- 1994 · P138 · KQML como lenguaje de comunicación entre agentes — Separa qué se dice de qué se pretende al decirlo, y con esa capa común convierte N×M integraciones punto a punto en N+M.
- 2000 · P139 · Un modelo de tipos y niveles de interacción humana con la automatización — Descompone la automatización en cuatro etapas con diez niveles cada una, y documenta que subir de nivel deja al humano fuera del bucle justo cuando más falta hace.
- 2004 · P140 · MapReduce: procesamiento simplificado de datos en clústeres grandes — Reduce el procesamiento distribuido a dos funciones puras y esconde el reparto, la tolerancia a fallos y la recogida de resultados detrás de ellas.
ruta_gobernanza
P141–P148: lo que hay que poder responder cuando alguien pregunta por qué el sistema hizo lo que hizo, y qué límites tiene aprender de datos que son de personas. Enseñar, olvidar y recordar, proteger, defender, aprender sin centralizar, imaginar el mundo y rendir cuentas. Cierra el eje con la pregunta de quién responde. Ordenada por año.
- 1984 · P141 · El problema de las dos sigmas: buscar instrucción grupal tan eficaz como la tutoría individual — Cuantifica en desviaciones típicas cuánto mejora la tutoría individual sobre la clase convencional, y convierte esa cifra en un problema de ingeniería educativa.
- 1989 · P142 · Interferencia catastrófica en redes conexionistas: el problema del aprendizaje secuencial — Documenta que aprender una tarea nueva borra la anterior de golpe, y que no es una degradación gradual sino un colapso.
- 2006 · P143 · Calibrar el ruido a la sensibilidad en el análisis privado de datos — Da una definición formal de privacidad que no depende de qué sepa el atacante, y un mecanismo concreto para cumplirla.
- 2010 · P144 · Fuera del mundo cerrado: sobre el uso de aprendizaje automático para detectar intrusiones — Explica por qué el aprendizaje automático funciona peor en seguridad que en cualquier otro dominio, y por qué la culpa no es del modelo.
- 2017 · P145 · Superar el olvido catastrófico en redes neuronales — Frena selectivamente los pesos que importaban para las tareas anteriores y deja libres los demás, con una penalización derivada de la información de Fisher.
- 2017 · P146 · Aprendizaje eficiente en comunicación de redes profundas con datos descentralizados — Entrena un modelo compartido sin que los datos salgan del dispositivo, promediando modelos en vez de recoger registros.
- 2018 · P147 · Los modelos recurrentes del mundo facilitan la evolución de políticas — Entrena la política dentro de un modelo del entorno aprendido, y demuestra que la política resultante funciona en el entorno real.
- 2020 · P148 · Cerrar la brecha de responsabilidad: un marco de auditoría algorítmica interna — Convierte la auditoría de un examen final en un proceso con cinco etapas y artefactos obligatorios que se producen mientras el sistema se construye.
📖 Qué resolvió cada uno
P87 · An Essay towards solving a Problem in the Doctrine of Chances (1763)
- Autoría: Thomas Bayes, Richard Price (editor)
- Problema anterior: La probabilidad sabía calcular qué datos esperar dada una causa conocida. La pregunta inversa —qué causa es probable dados los datos observados— no tenía tratamiento, y es la que hace falta para aprender de la experiencia.
- Propuesta: Tratar la causa desconocida como una cantidad con distribución previa, y actualizarla con la verosimilitud de lo observado. En forma de odds, la actualización es una multiplicación por la razón de verosimilitud.
- Hito: La regla que invierte el condicional: pasar de «qué esperaría ver si la hipótesis fuese cierta» a «cuán probable es la hipótesis dado lo que he visto».
- Conceptos: inferencia bayesiana, probabilidad condicional, previa, posterior, razón de verosimilitud
- Clases del programa: 026
- Fuentes primarias: doi:10.1098/rstl.1763.0053
P53 · On Lines and Planes of Closest Fit to Systems of Points in Space (1901)
- Autoría: Karl Pearson
- Problema anterior: Los mínimos cuadrados miden el error en vertical, y por tanto tratan una variable como causa y la otra como efecto. Cuando ninguna de las dos lo es, hay dos rectas distintas y ningún criterio para elegir.
- Propuesta: Buscar la recta —o el plano— que minimiza la distancia perpendicular a los puntos. Esa dirección es simétrica en todas las variables y da los ejes principales.
- Hito: La primera respuesta al problema de resumir una nube de puntos con menos dimensiones sin privilegiar ninguna variable.
- Conceptos: componentes principales, reducción de dimensionalidad, geometría, varianza, mínimos cuadrados ortogonales
- Clases del programa: 005, 043
- Fuentes primarias: DOI (Philosophical Magazine)
P54 · A Logical Calculus of the Ideas Immanent in Nervous Activity (1943)
- Autoría: Warren S. McCulloch, Walter Pitts
- Problema anterior: La actividad nerviosa se describía en términos fisiológicos. No existía un modelo formal que permitiera preguntarse qué puede y qué no puede computar un cerebro.
- Propuesta: Modelar la neurona como una unidad de umbral con entradas excitatorias e inhibitorias, y demostrar que las redes de esas unidades realizan proposiciones lógicas.
- Hito: Establece que una red de neuronas de umbral puede calcular cualquier función lógica: el puente entre biología y computación.
- Conceptos: neurona de umbral, lógica proposicional, computabilidad, inhibición, conexionismo
- Clases del programa: 001, 007
- Fuentes primarias: DOI (Bulletin of Mathematical Biophysics)
P88 · Probability, Frequency and Reasonable Expectation (1946)
- Autoría: Richard T. Cox
- Problema anterior: Había —y hay— muchas propuestas para razonar con incertidumbre: frecuencias, grados de creencia, factores de certeza, posibilidades. Ninguna razón de principio decía por qué elegir una, y la discusión se resolvía por gusto o por escuela.
- Propuesta: Enunciar tres desiderata mínimos —representar grados con números reales, ser consistente con la lógica en los casos extremos y dar el mismo resultado por cualquier camino de razonamiento— y demostrar que cualquier medida que los cumpla es isomorfa a la probabilidad.
- Hito: Demuestra que la probabilidad no es una convención entre varias: es la única forma consistente de extender la lógica a grados de creencia.
- Conceptos: desiderata, consistencia, grados de creencia, regla de la suma, regla del producto
- Clases del programa: 025
- Fuentes primarias: doi:10.1119/1.1990764
P55 · A Mathematical Theory of Communication (1948)
- Autoría: Claude E. Shannon
- Problema anterior: Se sabía transmitir señales, pero no había forma de medir cuánta información llevaban ni de saber cuánto se podía comprimir o transmitir sin error.
- Propuesta: Separar la información del significado y medirla por la sorpresa de cada símbolo. De ahí salen la entropía como cota inferior de compresión y la capacidad como cota de canal.
- Hito: Define la información como reducción de incertidumbre y le pone unidad, cota y límite: el bit, la entropía y la capacidad del canal.
- Conceptos: entropía, bit, compresión, capacidad de canal, redundancia
- Clases del programa: 006
- Fuentes primarias: DOI (Bell System Technical Journal)
P56 · Computing Machinery and Intelligence (1950)
- Autoría: Alan M. Turing
- Problema anterior: «¿Pueden pensar las máquinas?» exige definir «máquina» y «pensar». Ninguna de las dos definiciones estaba disponible, y discutirlas no llevaba a ningún experimento.
- Propuesta: Sustituir la pregunta por el juego de imitación: si un interrogador no distingue las respuestas de una máquina de las de una persona, la pregunta original pierde interés.
- Hito: Cambia una pregunta metafísica —¿pueden pensar las máquinas?— por un procedimiento que se puede ejecutar y discutir.
- Conceptos: juego de imitación, test de Turing, objeciones, aprendizaje de máquina, máquina niño
- Clases del programa: 001, 002
- Fuentes primarias: DOI (Mind)
P57 · A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence (1955)
- Autoría: John McCarthy, Marvin L. Minsky, Nathaniel Rochester, Claude E. Shannon
- Problema anterior: Los trabajos sobre autómatas, redes nerviosas, teoría de la información y resolución de problemas avanzaban por separado y sin un nombre común ni una agenda compartida.
- Propuesta: Reunir a diez investigadores durante dos meses sobre la conjetura de que todo aspecto del aprendizaje puede describirse con precisión suficiente para simularlo.
- Hito: Bautiza el campo y fija su agenda: siete temas que aún organizan buena parte de la investigación.
- Conceptos: inteligencia artificial, agenda de investigación, automejora, abstracción, historia del campo
- Clases del programa: 002, 003
- Fuentes primarias: Texto original (archivo de John McCarthy, Stanford) · DOI de la reimpresión en AI Magazine (2006)
P01 · The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain (1958)
- Autoría: Frank Rosenblatt
- Problema anterior: La IA de los años 50 programaba reglas a mano; no existía un procedimiento para que un sistema ajustara su comportamiento observando datos.
- Propuesta: Una unidad de decisión lineal con umbral y una regla de corrección de error que solo actúa cuando la predicción falla.
- Hito: Primera máquina que aprende sus propios pesos a partir de ejemplos en lugar de ejecutar reglas escritas por una persona.
- Conceptos: perceptrón, clasificador lineal, regla de aprendizaje, separabilidad, conexionismo
- Clases del programa: 039, 049
- Fuentes primarias: DOI (Psychological Review)
P64 · Report on a General Problem-Solving Program (1959)
- Autoría: Allen Newell, J. C. Shaw, Herbert A. Simon
- Problema anterior: Cada programa de los años cincuenta resolvía un problema y solo uno. No existía un método general que pudiera aplicarse a dominios distintos sin reescribirlo entero.
- Propuesta: Representar el problema como diferencias entre el estado actual y la meta, y asociar cada tipo de diferencia con los operadores que la reducen. Si el operador no es aplicable, se crea un subobjetivo para hacerlo aplicable.
- Hito: Separa por primera vez el método de resolución del dominio concreto: el análisis medios-fines elige el operador por la diferencia que reduce.
- Conceptos: análisis medios-fines, subobjetivos, espacio de estados, generalidad, resolución de problemas
- Clases del programa: 013
- Fuentes primarias: Registro archivístico (Carnegie Mellon University Archives) · Actas del IFIP Congress 1959 (DBLP)
P96 · A New Approach to Linear Filtering and Prediction Problems (1960)
- Autoría: Rudolf E. Kálmán
- Problema anterior: Un sensor da medidas ruidosas y un modelo del movimiento acumula error. Promediarlos trata igual a los dos, e ignora que la confianza en cada uno cambia con el tiempo. Los métodos anteriores exigían guardar todo el historial.
- Propuesta: Mantener una estimación y su varianza, predecir con el modelo, y corregir con la medida usando una ganancia que sale del cociente entre las dos incertidumbres. Recursivo: solo hace falta el estado anterior.
- Hito: Fusiona un modelo del movimiento con un sensor ruidoso ponderando cada fuente por su propia incertidumbre, y lo hace de forma recursiva.
- Conceptos: filtro de Kalman, fusión de sensores, estimación de estado, ganancia, recursivo
- Clases del programa: 137
- Fuentes primarias: doi:10.1115/1.3662552
P65 · A Machine Program for Theorem-Proving (1962)
- Autoría: Martin Davis, George Logemann, Donald Loveland
- Problema anterior: El procedimiento de Davis y Putnam (1960) era correcto pero consumía memoria de forma impracticable al eliminar variables por resolución.
- Propuesta: Sustituir la eliminación por una búsqueda en profundidad con retroceso, apoyada en dos reglas que no requieren elegir: propagación de cláusulas unitarias y literales puros.
- Hito: El algoritmo que sigue siendo el esqueleto de todo solucionador SAT moderno: propagar primero, ramificar solo cuando no queda deducción por hacer.
- Conceptos: SAT, propagación unitaria, literal puro, retroceso, forma normal conjuntiva
- Clases del programa: 019
- Fuentes primarias: doi:10.1145/368273.368557
P66 · A Machine-Oriented Logic Based on the Resolution Principle (1965)
- Autoría: J. A. Robinson
- Problema anterior: Los cálculos lógicos existentes tenían muchas reglas pensadas para el razonamiento humano. Aplicarlas a máquina generaba una explosión de caminos sin criterio.
- Propuesta: Una única regla —la resolución— sobre cláusulas, junto con el algoritmo de unificación que calcula el unificador más general: la sustitución mínima que iguala dos términos sin comprometer nada de más.
- Hito: Reduce toda la inferencia de primer orden a una sola regla, y hace la unificación computable con el unificador más general.
- Conceptos: resolución, unificación, unificador más general, refutación, cláusulas
- Clases del programa: 020
- Fuentes primarias: doi:10.1145/321250.321253
P89 · Fuzzy Sets (1965)
- Autoría: Lotfi A. Zadeh
- Problema anterior: La teoría de conjuntos es binaria: algo pertenece o no pertenece. Pero «alto», «caliente» o «cerca» no tienen frontera nítida, y forzarlos a un umbral produce sistemas que cambian de decisión ante una diferencia irrelevante.
- Propuesta: Sustituir la función característica {0,1} por una función de pertenencia a [0,1], y definir sobre ella unión, intersección y complemento con máximo, mínimo y complemento a uno.
- Hito: Permite que un elemento pertenezca parcialmente a un conjunto, y con eso da tratamiento formal a la vaguedad de los predicados del lenguaje.
- Conceptos: conjunto difuso, función de pertenencia, vaguedad, control difuso, t-normas
- Clases del programa: 032
- Fuentes primarias: doi:10.1016/S0019-9958(65)90241-X
P67 · A Formal Basis for the Heuristic Determination of Minimum Cost Paths (1968)
- Autoría: Peter E. Hart, Nils J. Nilsson, Bertram Raphael
- Problema anterior: La búsqueda guiada por heurística era rápida pero no garantizaba nada. La búsqueda exhaustiva garantizaba optimalidad y no escalaba. No había teoría que uniera las dos.
- Propuesta: Evaluar cada nodo por
f(n) = g(n) + h(n)—coste acumulado más estimación restante— y demostrar que sihes admisible (nunca sobrestima), el algoritmo devuelve el camino de coste mínimo, y que es óptimamente eficiente entre los que usan la misma información. - Hito: Convierte la heurística de recurso práctico en garantía demostrable: si nunca sobrestima, el camino encontrado es óptimo.
- Conceptos: A*, admisibilidad, optimalidad, heurística, caminos de coste mínimo
- Clases del programa: 015
- Fuentes primarias: doi:10.1109/TSSC.1968.300136
P68 · STRIPS: A New Approach to the Application of Theorem Proving to Problem Solving (1971)
- Autoría: Richard E. Fikes, Nils J. Nilsson
- Problema anterior: Describir en lógica qué cambia y qué no al ejecutar una acción exigía escribir un axioma por cada literal que permanece igual. Es el problema del marco, y hacía inviable planificar con un demostrador de teoremas.
- Propuesta: Describir cada operador con tres listas —precondiciones, literales que añade y literales que borra— y adoptar el supuesto de que todo lo no mencionado persiste.
- Hito: Da a la planificación su representación duradera —precondición, añadir, borrar— y con ella una respuesta práctica al problema del marco.
- Conceptos: planificación, problema del marco, operadores, mundo de bloques, anomalía de Sussman
- Clases del programa: 023
- Fuentes primarias: doi:10.1016/0004-3702(71)90010-5
P90 · Genetic Algorithms and the Optimal Allocation of Trials (1973)
- Autoría: John H. Holland
- Problema anterior: Buscar en un espacio enorme sin gradiente exige decidir constantemente entre explorar lo desconocido y explotar lo que ya funciona. No había un argumento formal de por qué una población con selección y recombinación resuelve bien ese reparto.
- Propuesta: Analizar la población como un proceso que evalúa implícitamente muchos esquemas —patrones con comodines— a la vez, y mostrar que la reproducción proporcional a la aptitud asigna ensayos de forma cercana a la óptima del problema del bandido.
- Hito: Conecta la evolución artificial con un problema de decisión clásico: cómo repartir ensayos entre alternativas cuando explorar cuesta.
- Conceptos: algoritmo genético, esquemas, paralelismo implícito, cruce, exploración y explotación
- Clases del programa: 033
- Fuentes primarias: doi:10.1137/0202009
P134 · The Protection of Information in Computer Systems (1975)
- Autoría: Jerome H. Saltzer, Michael D. Schroeder
- Problema anterior: Los sistemas compartidos daban acceso amplio por comodidad, y cada mecanismo de protección se diseñaba ad hoc. No había criterios explícitos para decidir qué permisos conceder ni para juzgar si un diseño era defendible.
- Propuesta: Ocho principios, de los cuales dos gobiernan el resto: valores por defecto a prueba de fallos —denegar salvo permiso explícito— y mínimo privilegio —lo justo para la tarea—. Más mediación completa: comprobar cada acceso, no solo el primero.
- Hito: Enuncia los ocho principios de diseño de protección que siguen siendo la base de cualquier discusión sobre permisos, cincuenta años después.
- Conceptos: mínimo privilegio, valores por defecto, mediación completa, permisos, radio de daño
- Clases del programa: 119
- Fuentes primarias: doi:10.1109/PROC.1975.9939
P69 · A Model of Inexact Reasoning in Medicine (1975)
- Autoría: Edward H. Shortliffe, Bruce G. Buchanan
- Problema anterior: El conocimiento médico está lleno de indicios que no son ni ciertos ni falsos. Aplicar probabilidad bayesiana exigía distribuciones conjuntas que nadie podía estimar ni declarar.
- Propuesta: Los factores de certeza: un número en [−1, 1] por regla, con un álgebra de combinación que satura y admite evidencia en contra, más una traza que hace explicable cada conclusión.
- Hito: El motor de MYCIN: razonar con grados de creencia y explicar cada conclusión por las reglas que la sostienen.
- Conceptos: sistemas expertos, factores de certeza, encadenamiento, explicabilidad, motor de reglas
- Clases del programa: 022
- Fuentes primarias: doi:10.1016/0025-5564(75)90047-4
P58 · Computer Science as Empirical Inquiry: Symbols and Search (1976)
- Autoría: Allen Newell, Herbert A. Simon
- Problema anterior: Había programas que jugaban, demostraban teoremas y resolvían problemas, pero no una tesis explícita sobre qué tenían en común ni sobre qué se estaba afirmando del pensamiento.
- Propuesta: Dos hipótesis empíricas y falsables: un sistema de símbolos físicos basta para la acción inteligente general, y la resolución de problemas procede por búsqueda heurística en un espacio de estados.
- Hito: Enuncia las dos hipótesis que resumen veinte años de IA simbólica: el sistema de símbolos físicos y la búsqueda heurística.
- Conceptos: sistema de símbolos físicos, búsqueda heurística, espacio de estados, explosión combinatoria, IA simbólica
- Clases del programa: 007, 013
- Fuentes primarias: DOI (Communications of the ACM)
P70 · Consistency in Networks of Relations (1977)
- Autoría: Alan K. Mackworth
- Problema anterior: El retroceso cronológico repetía una y otra vez el mismo descubrimiento: que cierto valor era incompatible con sus vecinos. La información se hallaba y se tiraba en cada rama.
- Propuesta: Hacer la red consistente de arco antes de asignar nada: eliminar de cada dominio los valores sin compañero legal en algún vecino, y repropagar en cascada. Los algoritmos AC-1, AC-2 y AC-3 formalizan el procedimiento.
- Hito: Convierte la propagación de restricciones en un preproceso con nombre y algoritmo: podar dominios antes de buscar, no mientras se busca.
- Conceptos: CSP, consistencia de arco, AC-3, propagación, retroceso
- Clases del programa: 018
- Fuentes primarias: doi:10.1016/0004-3702(77)90007-8
P135 · The Hearsay-II Speech-Understanding System: Integrating Knowledge to Resolve Uncertainty (1980)
- Autoría: Lee D. Erman, Frederick Hayes-Roth, Victor R. Lesser, D. Raj Reddy
- Problema anterior: Entender habla exige combinar conocimiento acústico, léxico, sintáctico y semántico. Ninguna fuente decide sola, y encadenarlas en una tubería fija obliga a comprometerse pronto: un error temprano llega intacto al final.
- Propuesta: Una estructura compartida —la pizarra— donde cada fuente escribe hipótesis parciales con su credibilidad, y un control oportunista que decide a quién invocar según lo que ya hay escrito. Nadie se compromete hasta que hay evidencia.
- Hito: Introduce la arquitectura de pizarra: fuentes de conocimiento independientes que publican hipótesis en una estructura compartida, sin llamarse entre sí.
- Conceptos: pizarra, memoria compartida, control oportunista, hipótesis parciales, arquitectura multiagente
- Clases del programa: 130
- Fuentes primarias: doi:10.1145/356810.356816
P136 · The Contract Net Protocol: High-Level Communication and Control in a Distributed Problem Solver (1980)
- Autoría: Reid G. Smith
- Problema anterior: Asignar tareas a nodos exige saber qué puede hacer cada uno y cuánto tiene encima. Mantener ese registro centralizado se desactualiza, no escala y falla justo cuando los nodos aparecen y desaparecen.
- Propuesta: Invertir el flujo: el coordinador anuncia la tarea, los nodos capaces ofertan con su coste estimado, y el coordinador adjudica a la mejor oferta. Quien conoce su capacidad es quien la declara, en el momento de usarla.
- Hito: Reparte tareas por anuncio, oferta y adjudicación, sin que nadie mantenga una lista de quién sabe hacer qué.
- Conceptos: asignación de tareas, negociación, delegación, coordinación distribuida, handoff
- Clases del programa: 126
- Fuentes primarias: doi:10.1109/TC.1980.1675516
P73 · Least Squares Quantization in PCM (1982)
- Autoría: Stuart P. Lloyd
- Problema anterior: Resumir un conjunto de puntos con k representantes exige elegirlos minimizando el error cuadrático. El problema es combinatorio y su solución exacta, inabordable.
- Propuesta: Alternar dos pasos que cada uno reduce el error: asignar cada punto a su representante más cercano, y recolocar cada representante en el centro de los puntos que le tocaron.
- Hito: El algoritmo de agrupamiento más usado del mundo, con la demostración de que converge —y de que converge a un óptimo local, no al global.
- Conceptos: k-medias, cuantización, inercia, óptimo local, agrupamiento
- Clases del programa: 043
- Fuentes primarias: doi:10.1109/TIT.1982.1056489
P141 · The 2 Sigma Problem: The Search for Methods of Group Instruction as Effective as One-to-One Tutoring (1984)
- Autoría: Benjamin S. Bloom
- Problema anterior: La tutoría uno a uno funciona muchísimo mejor que la clase convencional, y es imposible de desplegar: exige un docente por alumno. Sin una medida comparable entre asignaturas y exámenes, no se podía ni discutir cuánto se pierde por no poder pagarla.
- Propuesta: Medir el efecto en desviaciones típicas —el tamaño del efecto— y plantear explícitamente el problema: encontrar métodos de instrucción grupal que consigan el efecto de la tutoría. El aprendizaje para el dominio consigue la mitad con coste de clase convencional.
- Hito: Cuantifica en desviaciones típicas cuánto mejora la tutoría individual sobre la clase convencional, y convierte esa cifra en un problema de ingeniería educativa.
- Conceptos: tamaño del efecto, tutoría, aprendizaje para el dominio, educación, instrucción adaptativa
- Clases del programa: 180
- Fuentes primarias: JSTOR 1175554 · doi:10.2307/1175554
P02 · Learning representations by back-propagating errors (1986)
- Autoría: David E. Rumelhart, Geoffrey E. Hinton, Ronald J. Williams
- Problema anterior: Sin capas ocultas el perceptrón no resuelve XOR; con capas ocultas no se sabía cómo asignar el error a cada peso interno.
- Propuesta: Aplicar la regla de la cadena hacia atrás por el grafo de cómputo para obtener el gradiente de la pérdida respecto de cada peso.
- Hito: Un procedimiento práctico para entrenar capas ocultas: la red descubre representaciones intermedias que nadie diseñó.
- Conceptos: retropropagación, regla de la cadena, capas ocultas, gradiente, representaciones internas
- Clases del programa: 050, 051
- Fuentes primarias: DOI (Nature)
P74 · Induction of Decision Trees (1986)
- Autoría: J. Ross Quinlan
- Problema anterior: Los clasificadores de la época eran cajas de números. En dominios donde alguien tiene que justificar la decisión, un modelo que no se puede leer no se puede usar.
- Propuesta: Construir el árbol de arriba abajo eligiendo en cada nodo el atributo con mayor ganancia de información, y documentar el sesgo del criterio hacia los atributos con muchos valores.
- Hito: Aprende un modelo que una persona puede leer, eligiendo cada pregunta por cuánta incertidumbre elimina.
- Conceptos: árbol de decisión, ganancia de información, entropía, razón de ganancia, interpretabilidad
- Clases del programa: 040
- Fuentes primarias: doi:10.1007/BF00116251
P91 · Fusion, Propagation, and Structuring in Belief Networks (1986)
- Autoría: Judea Pearl
- Problema anterior: Aplicar probabilidad a un dominio con decenas de variables exige una tabla conjunta con 2ⁿ entradas: imposible de almacenar, de estimar y de actualizar. Esa fue la razón técnica por la que la IA de los setenta la abandonó en favor de los factores de certeza.
- Propuesta: Representar las dependencias con un grafo dirigido acíclico. Las independencias condicionales que el grafo codifica reducen la conjunta a un producto de condicionales locales, y permiten propagar creencias por paso de mensajes entre nodos vecinos.
- Hito: Hace tratable la probabilidad en IA: la estructura del grafo dice qué hay que almacenar y qué se puede propagar localmente.
- Conceptos: red bayesiana, independencia condicional, propagación de creencias, explicar y descartar, grafo dirigido acíclico
- Clases del programa: 027
- Fuentes primarias: doi:10.1016/0004-3702(86)90072-X
P97 · A Robust Layered Control System for a Mobile Robot (1986)
- Autoría: Rodney A. Brooks
- Problema anterior: La arquitectura percibir-planificar-actuar construye un modelo del mundo, planifica sobre él y ejecuta el plan. Mantener ese modelo es caro, y cuando el mundo cambia a mitad de la ejecución, el plan se vuelve peligroso en vez de inútil.
- Propuesta: Descomponer por comportamientos y no por funciones. Cada capa conecta percepción con acción de forma directa, y las capas inferiores —evitar obstáculos— pueden subsumir a las superiores. No hay representación compartida.
- Hito: Demuestra que un robot puede comportarse de forma competente sin modelo del mundo, sin planificador y sin representación central.
- Conceptos: subsunción, robótica situada, control por capas, sin representación, reactivo
- Clases del programa: 136
- Fuentes primarias: doi:10.1109/JRA.1986.1087032
P142 · Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem (1989)
- Autoría: Michael McCloskey, Neal J. Cohen
- Problema anterior: Las redes conexionistas se presentaban como modelos de la memoria humana. Nadie había comprobado qué ocurre cuando se les enseña algo nuevo después de haber aprendido algo: se suponía interferencia gradual, como en las personas.
- Propuesta: Medirlo. Entrenar una red en una tarea, entrenarla después en otra y volver a evaluar la primera. El resultado es un colapso casi inmediato, y eso pone en cuestión el modelo como teoría de la memoria y como sistema práctico.
- Hito: Documenta que aprender una tarea nueva borra la anterior de golpe, y que no es una degradación gradual sino un colapso.
- Conceptos: olvido catastrófico, aprendizaje secuencial, interferencia, memoria, aprendizaje continuo
- Clases del programa: 176
- Fuentes primarias: doi:10.1016/S0079-7421(08)60536-8
P137 · Principles of Metareasoning (1991)
- Autoría: Stuart Russell, Eric Wefald
- Problema anterior: Un agente con recursos limitados no puede deliberar indefinidamente, y los sistemas fijaban el presupuesto de cómputo a mano. Un número fijo piensa de más en las instancias fáciles y de menos en las difíciles, y siempre en la proporción equivocada.
- Propuesta: Tratar cada paso de deliberación como una acción con coste y con beneficio esperado —el valor de la computación— y seguir deliberando solo mientras la mejora esperada supere el coste. La parada se deduce, no se elige.
- Hito: Convierte «cuánto pensar» en una decisión que se toma con el mismo criterio que cualquier otra: comparando el valor esperado de deliberar con lo que deliberar cuesta.
- Conceptos: racionalidad acotada, valor de la computación, presupuesto, anytime, metanivel
- Clases del programa: 121
- Fuentes primarias: doi:10.1016/0004-3702(91)90015-C
P71 · A Translation Approach to Portable Ontology Specifications (1993)
- Autoría: Thomas R. Gruber
- Problema anterior: Dos sistemas podían usar el mismo término y significar cosas distintas. Sin un acuerdo explícito sobre qué designa cada símbolo, compartir conocimiento entre sistemas era imposible.
- Propuesta: Tratar la ontología como un compromiso: no una descripción del mundo, sino un acuerdo sobre qué se dirá de él. Y cinco criterios de diseño —claridad, coherencia, extensibilidad, sesgo de codificación mínimo y compromiso ontológico mínimo—.
- Hito: Da la definición que se sigue citando —una ontología es una especificación explícita de una conceptualización— y cinco criterios para juzgarla.
- Conceptos: ontología, conceptualización, compromiso ontológico, subsunción, interoperabilidad
- Clases del programa: 021
- Fuentes primarias: doi:10.1006/knac.1993.1008
P138 · KQML as an agent communication language (1994)
- Autoría: Tim Finin, Richard Fritzson, Don McKay, Robin McEntire
- Problema anterior: Dos agentes que intercambian «puerta(abierta)» no pueden saber si eso es una afirmación, una pregunta, una orden o una negación. Y sin una capa común, conectar N agentes con M lenguajes de contenido exige un adaptador por pareja.
- Propuesta: Un lenguaje de mensajes en tres capas —contenido, mensaje y comunicación— donde una performativa declara el acto de habla: tell, ask-if, achieve, subscribe. El contenido va dentro y puede estar en cualquier lenguaje.
- Hito: Separa qué se dice de qué se pretende al decirlo, y con esa capa común convierte N×M integraciones punto a punto en N+M.
- Conceptos: interoperabilidad, performativa, acto de habla, protocolo de agentes, descubrimiento
- Clases del programa: 134
- Fuentes primarias: doi:10.1145/191246.191322
P59 · Intelligent Agents: Theory and Practice (1995)
- Autoría: Michael Wooldridge, Nicholas R. Jennings
- Problema anterior: «Agente» se usaba para cosas incompatibles entre sí. Sin una definición operativa no se podía comparar arquitecturas ni evaluar si una era mejor que otra.
- Propuesta: Un agente es un sistema situado en un entorno, autónomo, reactivo, proactivo y social. Su racionalidad se juzga siempre respecto de una medida de desempeño y de un entorno.
- Hito: Fija qué es un agente y qué propiedades lo definen, y separa la teoría de las arquitecturas y de los lenguajes que la implementan.
- Conceptos: agente, autonomía, reactividad, medida de desempeño, arquitecturas de agentes
- Clases del programa: 004
- Fuentes primarias: DOI (The Knowledge Engineering Review)
P75 · Support-Vector Networks (1995)
- Autoría: Corinna Cortes, Vladimir Vapnik
- Problema anterior: Cuando varios clasificadores separan perfectamente los datos de entrenamiento, la exactitud no distingue entre ellos, y sin embargo generalizan de forma muy distinta.
- Propuesta: Elegir el hiperplano de margen máximo —el que más lejos queda de los puntos de ambas clases— y extender la idea a fronteras no lineales con el truco del núcleo y a datos no separables con el margen blando.
- Hito: Convierte la elección entre clasificadores que aciertan igual en un criterio con justificación teórica: el margen.
- Conceptos: margen máximo, vectores soporte, núcleo, riesgo estructural, margen blando
- Clases del programa: 039
- Fuentes primarias: doi:10.1007/BF00994018
P76 · A Study of Cross-Validation and Bootstrap for Accuracy Estimation and Model Selection (1995)
- Autoría: Ron Kohavi
- Problema anterior: Se reportaban exactitudes sin decir cómo se habían estimado. Holdout, validación cruzada y bootstrap dan números distintos sobre los mismos datos, y nadie había medido cuál era preferible ni por qué.
- Propuesta: Comparar empíricamente los estimadores en sesgo y varianza sobre conjuntos reales, y recomendar validación cruzada estratificada de diez pliegues como compromiso entre ambos.
- Hito: Fija la práctica estándar de evaluación —diez pliegues estratificados— con evidencia empírica en lugar de costumbre.
- Conceptos: validación cruzada, bootstrap, sesgo y varianza, estratificación, selección de modelo
- Clases del programa: 037
- Fuentes primarias: Actas IJCAI'95 (PDF)
P92 · Particle Swarm Optimization (1995)
- Autoría: James Kennedy, Russell Eberhart
- Problema anterior: Muchas funciones objetivo no se pueden derivar —son simulaciones, cajas negras o tienen ruido— y los métodos de gradiente no se pueden aplicar. Las alternativas poblacionales existentes eran caras y difíciles de ajustar.
- Propuesta: Un enjambre de partículas que se mueven por el espacio con una velocidad que combina inercia, atracción hacia su propio mejor histórico y atracción hacia el mejor del grupo. Sin cruce, sin mutación y sin selección.
- Hito: Optimiza sin gradiente con dos únicas memorias: lo mejor que ha encontrado cada individuo y lo mejor que ha encontrado el grupo.
- Conceptos: enjambre, inteligencia colectiva, sin gradiente, metaheurística, exploración y explotación
- Clases del programa: 034
- Fuentes primarias: doi:10.1109/ICNN.1995.488968
P77 · Regression Shrinkage and Selection via the Lasso (1996)
- Autoría: Robert Tibshirani
- Problema anterior: La regresión por mínimos cuadrados con muchas variables sobreajusta y produce modelos imposibles de interpretar. La selección por subconjuntos es inestable y la penalización de cresta encoge todos los coeficientes pero no elimina ninguno.
- Propuesta: Penalizar la suma de los valores absolutos de los coeficientes. La geometría de esa restricción tiene esquinas sobre los ejes, y el óptimo tiende a caer en ellas: los coeficientes irrelevantes quedan exactamente en cero.
- Hito: Una penalización que estima y selecciona a la vez: pone coeficientes exactamente en cero.
- Conceptos: lasso, L1, regularización, esparsidad, selección de variables
- Clases del programa: 038
- Fuentes primarias: doi:10.1111/j.2517-6161.1996.tb02080.x
P93 · Ant System: Optimization by a Colony of Cooperating Agents (1996)
- Autoría: Marco Dorigo, Vittorio Maniezzo, Alberto Colorni
- Problema anterior: En problemas combinatorios como el del viajante, las heurísticas golosas se quedan atrapadas en decisiones tempranas y no tienen forma de aprender de los intentos anteriores sin una memoria global costosa.
- Propuesta: Agentes simples que construyen soluciones eligiendo el siguiente paso según una combinación de feromona acumulada y heurística local, y que depositan feromona proporcional a la calidad de la solución construida. La evaporación evita el estancamiento.
- Hito: La solución no está en ningún agente: está en el rastro que dejan en el entorno y que se refuerza y se evapora.
- Conceptos: estigmergia, feromona, optimización combinatoria, viajante de comercio, evaporación
- Clases del programa: 034
- Fuentes primarias: doi:10.1109/3477.484436
P03 · Long Short-Term Memory (1997)
- Autoría: Sepp Hochreiter, Jürgen Schmidhuber
- Problema anterior: En un RNN el gradiente se multiplica en cada paso temporal: se desvanece o explota, y la red no aprende dependencias largas.
- Propuesta: Una celda con estado aditivo (carrusel de error constante) y puertas multiplicativas que deciden qué entra y qué sale.
- Hito: Primera arquitectura recurrente capaz de mantener información a través de cientos de pasos sin que el gradiente se desvanezca.
- Conceptos: LSTM, gradiente desvaneciente, puertas, estado de celda, dependencias largas
- Clases del programa: 028, 054
- Fuentes primarias: DOI (Neural Computation)
P78 · A Decision-Theoretic Generalization of On-Line Learning and an Application to Boosting (1997)
- Autoría: Yoav Freund, Robert E. Schapire
- Problema anterior: Kearns y Valiant habían preguntado si un aprendiz «débil» —apenas mejor que el azar— puede convertirse en uno «fuerte». La respuesta afirmativa existía pero era impracticable: exigía conocer de antemano la ventaja del aprendiz débil.
- Propuesta: AdaBoost: entrenar clasificadores en serie, subiendo el peso de los ejemplos que el anterior falló, y ponderar el voto de cada uno por su error. Se adapta solo a la calidad de cada aprendiz, sin conocerla de antemano.
- Hito: Demuestra que muchos clasificadores apenas mejores que el azar se combinan en uno arbitrariamente bueno, y da el algoritmo que lo hace.
- Conceptos: boosting, aprendiz débil, reponderación, conjunto, error exponencial
- Clases del programa: 041
- Fuentes primarias: doi:10.1006/jcss.1997.1504
P139 · A model for types and levels of human interaction with automation (2000)
- Autoría: Raja Parasuraman, Thomas B. Sheridan, Christopher D. Wickens
- Problema anterior: «Automatizar» se trataba como una decisión de todo o nada sobre un sistema entero. Y subir el nivel tiene un coste que nadie contabilizaba: quien deja de revisar pierde la práctica que le permitía detectar el fallo cuando ocurre.
- Propuesta: Separar cuatro etapas —adquirir información, analizarla, decidir la acción y ejecutarla— y elegir el nivel de automatización de cada una por separado, evaluando el efecto sobre la carga mental, la conciencia de la situación y la confianza del operador.
- Hito: Descompone la automatización en cuatro etapas con diez niveles cada una, y documenta que subir de nivel deja al humano fuera del bucle justo cuando más falta hace.
- Conceptos: human-in-the-loop, niveles de automatización, fuera del bucle, aprobación, factores humanos
- Clases del programa: 120
- Fuentes primarias: doi:10.1109/3468.844354
P98 · RRT-Connect: An Efficient Approach to Single-Query Path Planning (2000)
- Autoría: James J. Kuffner, Steven M. LaValle
- Problema anterior: Un brazo de siete articulaciones tiene un espacio de configuración de siete dimensiones. Discretizarlo para aplicar búsqueda en grafo produce un número de celdas astronómico, y los métodos de campos potenciales se quedan atrapados en mínimos locales.
- Propuesta: Muestrear configuraciones al azar y extender el árbol desde el nodo más cercano hacia cada muestra. El árbol se sesga solo hacia las regiones no exploradas, y con dos árboles que crecen uno hacia el otro la convergencia es mucho más rápida.
- Hito: Planifica en espacios continuos de muchas dimensiones sin discretizarlos, creciendo un árbol hacia muestras aleatorias.
- Conceptos: RRT, planificación de movimiento, espacio de configuración, muestreo, completitud probabilística
- Clases del programa: 139
- Fuentes primarias: doi:10.1109/ROBOT.2000.844730
P79 · Random Forests (2001)
- Autoría: Leo Breiman
- Problema anterior: El bagging reducía la varianza promediando árboles entrenados sobre remuestreos, pero los árboles seguían pareciéndose demasiado: ante los mismos datos elegían casi siempre las mismas variables.
- Propuesta: Añadir una segunda fuente de azar: en cada nodo, considerar solo un subconjunto aleatorio de variables. Los árboles empeoran individualmente y se descorrelacionan, y la cota del error del bosque mejora.
- Hito: Demuestra que el error de un conjunto depende de la fuerza de sus miembros Y de su correlación, y que empeorarlos a propósito puede mejorarlo.
- Conceptos: bagging, subespacio aleatorio, correlación, out-of-bag, importancia de variables
- Clases del programa: 041
- Fuentes primarias: doi:10.1023/A:1010933404324
P80 · Statistical Modeling: The Two Cultures (2001)
- Autoría: Leo Breiman
- Problema anterior: La estadística académica suponía que los datos venían de un modelo con forma conocida y juzgaba los métodos por el ajuste a ese supuesto. Si el supuesto es falso —y casi siempre lo es— las conclusiones sobre el mecanismo no valen nada.
- Propuesta: Distinguir dos culturas y sus criterios: la del modelo de datos, que valida supuestos, y la algorítmica, que trata el mecanismo como desconocido y se juzga por exactitud predictiva medida fuera de muestra.
- Hito: Nombra la división que organiza el campo: suponer un mecanismo generador frente a medir la capacidad de predecir.
- Conceptos: modelo de datos, cultura algorítmica, efecto Rashomon, exactitud predictiva, interpretabilidad
- Clases del programa: 037, 047
- Fuentes primarias: doi:10.1214/ss/1009213726
P81 · An Introduction to Variable and Feature Selection (2003)
- Autoría: Isabelle Guyon, André Elisseeff
- Problema anterior: Con miles de variables y pocas muestras hay que reducir. El método habitual —ordenar las variables por su correlación con la etiqueta y quedarse con las primeras— tiene modos de fallo que casi nadie enunciaba.
- Propuesta: Un marco con tres familias —filtros, envolturas y métodos embebidos— y dos advertencias con contraejemplo: una variable inútil por separado puede ser imprescindible en compañía, y dos variables redundantes pueden ser mejores juntas que cualquiera sola.
- Hito: Ordena el problema de elegir variables y demuestra por qué el ranking de una en una falla en las dos direcciones.
- Conceptos: selección de variables, filtros, envolturas, redundancia, complementariedad
- Clases del programa: 042
- Fuentes primarias: JMLR 3:1157–1182
P140 · MapReduce: simplified data processing on large clusters (2004)
- Autoría: Jeffrey Dean, Sanjay Ghemawat
- Problema anterior: Procesar terabytes en miles de máquinas exigía escribir a mano el particionado, la comunicación, la recuperación de fallos y la agregación. Cada trabajo reimplementaba lo mismo, y la lógica del problema quedaba enterrada bajo la fontanería.
- Propuesta: Dos funciones: map, que transforma cada registro en parejas clave-valor, y reduce, que agrega todos los valores de una clave. El sistema se encarga del reparto, del movimiento de datos y de reejecutar lo que falle.
- Hito: Reduce el procesamiento distribuido a dos funciones puras y esconde el reparto, la tolerancia a fallos y la recogida de resultados detrás de ellas.
- Conceptos: fan-out, particionado, sesgo de datos, combinador, procesamiento por lotes
- Clases del programa: 128
- Fuentes primarias: doi:10.1145/1327452.1327492
P60 · Why Most Published Research Findings Are False (2005)
- Autoría: John P. A. Ioannidis
- Problema anterior: La significancia estadística se leía como sinónimo de verdad. Nadie ponía número a la pregunta que de verdad importa: dado que se publicó, ¿qué probabilidad hay de que sea cierto?
- Propuesta: Modelar el valor predictivo positivo en función de las odds previas, el poder estadístico, el nivel de significancia, el sesgo y el número de equipos que compiten.
- Hito: Muestra con un modelo explícito que la probabilidad de que un hallazgo publicado sea cierto depende del diseño y de los incentivos, no del valor p.
- Conceptos: valor predictivo positivo, poder estadístico, sesgo, reproducibilidad, valor p
- Clases del programa: 008
- Fuentes primarias: DOI (PLoS Medicine)
P82 · Predicting Good Probabilities with Supervised Learning (2005)
- Autoría: Alexandru Niculescu-Mizil, Rich Caruana
- Problema anterior: Las salidas de un clasificador se usan como probabilidades para decidir con umbrales de coste o para combinarlas con otras. Pero un modelo puede tener un AUC excelente y probabilidades sistemáticamente sesgadas, y nadie lo estaba midiendo.
- Propuesta: Medir la calibración con diagramas de fiabilidad y puntuaciones propias, caracterizar cómo se descalibra cada familia de modelos, y corregirla con escalado de Platt o regresión isotónica sin alterar el orden.
- Hito: Separa dos cosas que se confundían: ordenar bien los ejemplos y estimar bien la probabilidad de cada uno.
- Conceptos: calibración, diagrama de fiabilidad, Brier, escalado de Platt, regresión isotónica
- Clases del programa: 047
- Fuentes primarias: doi:10.1145/1102351.1102430
P143 · Calibrating Noise to Sensitivity in Private Data Analysis (2006)
- Autoría: Cynthia Dwork, Frank McSherry, Kobbi Nissim, Adam Smith
- Problema anterior: La anonimización fallaba una y otra vez: cruzando datos supuestamente anónimos con otras fuentes se reidentificaba a personas. El problema de fondo es que cualquier definición basada en «quitar los identificadores» depende de qué más sepa quien ataca, y eso no se puede acotar.
- Propuesta: Definir la privacidad como una propiedad del mecanismo: que la salida cambie poco —acotado por ε— cuando se añade o quita una persona. Y dar un mecanismo que la cumple: añadir ruido de Laplace calibrado a la sensibilidad de la consulta.
- Hito: Da una definición formal de privacidad que no depende de qué sepa el atacante, y un mecanismo concreto para cumplirla.
- Conceptos: privacidad diferencial, sensibilidad, ruido de Laplace, epsilon, reidentificación
- Clases del programa: 165, 177
- Fuentes primarias: doi:10.1007/11681878_14
P99 · Simultaneous Localization and Mapping: Part I (2006)
- Autoría: Hugh Durrant-Whyte, Tim Bailey
- Problema anterior: Un robot que se mueve acumula error de odometría sin límite. Corregirlo exige referencias externas; pero si el mapa no existe de antemano, hay que construirlo con la misma pose incierta que se quiere corregir.
- Propuesta: Estimar el estado conjunto —pose y mapa— reconociendo que sus errores están correlacionados. El artículo formaliza la estructura de la covarianza, explica por qué converge y por qué el cierre de bucle corrige la trayectoria entera.
- Hito: Formaliza el problema circular de la robótica móvil: no se puede localizar sin mapa ni mapear sin localización, y hay que resolver ambos a la vez.
- Conceptos: SLAM, covarianza cruzada, cierre de bucle, asociación de datos, odometría
- Clases del programa: 138
- Fuentes primarias: doi:10.1109/MRA.2006.1638022
P83 · Visualizing Data using t-SNE (2008)
- Autoría: Laurens van der Maaten, Geoffrey Hinton
- Problema anterior: Al proyectar de muchas dimensiones a dos, los puntos moderadamente distantes se apiñan en el centro: en dimensión alta hay mucho más «sitio lejos» que cerca, y una gaussiana en el mapa no puede acomodarlo. Es el problema del apiñamiento.
- Propuesta: Convertir distancias en probabilidades de vecindad, y usar en el mapa una distribución t de Student de un grado de libertad. Su cola pesada deja sitio a los puntos lejanos sin comprimir los cercanos.
- Hito: Hace visibles las estructuras locales de datos de alta dimensión, y con ello se convierte en la figura por defecto de media década de artículos.
- Conceptos: t-SNE, visualización, apiñamiento, vecindad, divergencia KL
- Clases del programa: 043
- Fuentes primarias: JMLR 9:2579–2605
P84 · Isolation Forest (2008)
- Autoría: Fei Tony Liu, Kai Ming Ting, Zhi-Hua Zhou
- Problema anterior: Los métodos de detección de anomalías construían un modelo de la normalidad y medían la distancia a él. Eso cuesta caro, supone una forma para la distribución normal y dedica casi todo el esfuerzo a los puntos que no interesan.
- Propuesta: Cortar el espacio al azar y contar cuántos cortes hacen falta para dejar cada punto solo. Lo raro vive en zonas poco pobladas y se aísla antes; la longitud media del camino, normalizada, es la puntuación de anomalía.
- Hito: Invierte el planteamiento de la detección de anomalías: en vez de modelar lo normal, mide lo fácil que es aislar cada punto.
- Conceptos: detección de anomalías, aislamiento, longitud de camino, submuestreo, no supervisado
- Clases del programa: 044
- Fuentes primarias: doi:10.1109/ICDM.2008.17
P100 · Requirements for Safe Robots: Measurements, Analysis and New Insights (2009)
- Autoría: Sami Haddadin, Alin Albu-Schäffer, Gerd Hirzinger
- Problema anterior: La seguridad de los robots industriales se resolvía con vallas: separación física total. Para trabajar junto a personas hacía falta saber qué daño produce realmente un impacto, y ese dato no existía — se legislaba y se diseñaba a ojo.
- Propuesta: Medir. Impactos instrumentados con maniquíes y voluntarios, análisis de los criterios de lesión de la industria del automóvil aplicados a la robótica, y la conclusión incómoda: la masa importa menos de lo que se creía y la velocidad, mucho más.
- Hito: Sustituye la intuición sobre seguridad robótica por mediciones de impacto con maniquíes y criterios de lesión validados.
- Conceptos: seguridad física, cobot, criterios de lesión, impacto, ISO/TS 15066
- Clases del programa: 143
- Fuentes primarias: doi:10.1177/0278364909343970
P85 · Matrix Factorization Techniques for Recommender Systems (2009)
- Autoría: Yehuda Koren, Robert Bell, Chris Volinsky
- Problema anterior: Recomendar exige predecir puntuaciones en una matriz usuario×artículo donde falta el 99 % de las celdas. Los métodos por vecindad escalaban mal y no capturaban estructura latente.
- Propuesta: Aprender un vector de factores latentes por usuario y por artículo, ajustados solo sobre las celdas observadas por descenso de gradiente, con regularización y con términos de sesgo explícitos para usuario y artículo.
- Hito: El método que ganó el Netflix Prize, explicado con lo que de verdad importa: los sesgos antes que los gustos.
- Conceptos: factores latentes, sesgos, descenso estocástico, regularización, recomendación
- Clases del programa: 046
- Fuentes primarias: doi:10.1109/MC.2009.263
P107 · Dapper, a Large-Scale Distributed Systems Tracing Infrastructure (2010)
- Autoría: Benjamin H. Sigelman, Luiz André Barroso, Michael Burrows, Pat Stephenson, Manoj Plakal, Donald Beaver, Saul Jaspan, Chandan Shanbhag
- Problema anterior: En una arquitectura distribuida, cada servicio tiene sus métricas y sus registros. Cuando una petición va lenta, nadie puede reconstruir por dónde pasó ni dónde se gastó el tiempo: se ve el total y nada más.
- Propuesta: Propagar un identificador de traza con la petición por todos los servicios, registrar un span por operación con su relación padre-hijo, y muestrear una fracción de las trazas para que el coste sea asumible sin perder los agregados.
- Hito: Hace observable una petición que atraviesa decenas de servicios, con un identificador que viaja con ella y un muestreo que la hace asequible.
- Conceptos: trazado distribuido, span, observabilidad, muestreo, latencia
- Clases del programa: 153
- Fuentes primarias: Informe técnico de Google
P144 · Outside the Closed World: On Using Machine Learning for Network Intrusion Detection (2010)
- Autoría: Robin Sommer, Vern Paxson
- Problema anterior: Cientos de artículos aplicaban aprendizaje automático a la detección de intrusiones con métricas excelentes, y casi ninguno de esos sistemas llegaba a producción. La brecha entre el resultado publicado y el sistema operable no se estaba explicando.
- Propuesta: Cinco razones estructurales: la clase base extremadamente desequilibrada hace que una precisión excelente produzca miles de falsas alarmas; el coste de los errores es asimétrico; no hay datos representativos de ataques nuevos; el adversario se adapta al detector; y la alerta hay que poder explicársela a quien actúa.
- Hito: Explica por qué el aprendizaje automático funciona peor en seguridad que en cualquier otro dominio, y por qué la culpa no es del modelo.
- Conceptos: detección de intrusiones, clase base, falsos positivos, adversario, evaluación
- Clases del programa: 179
- Fuentes primarias: doi:10.1109/SP.2010.25
P101 · A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (2011)
- Autoría: Stéphane Ross, Geoffrey J. Gordon, J. Andrew Bagnell
- Problema anterior: Al clonar el comportamiento de un experto, el modelo se entrena con los estados que visita el EXPERTO y se ejecuta sobre los estados que visita ÉL MISMO. Un error lo saca de la distribución de entrenamiento, donde comete más errores, y la desviación se realimenta.
- Propuesta: DAgger: ejecutar la política actual, recoger los estados que visita de verdad, pedir al experto la acción correcta en esos estados, y reentrenar sobre el conjunto acumulado. La distribución de entrenamiento converge a la de ejecución.
- Hito: Explica por qué la clonación de comportamiento se degrada con el horizonte, y da un algoritmo que reduce el error de orden T² a orden T.
- Conceptos: aprendizaje por imitación, clonación de comportamiento, cambio de distribución, aprendizaje en línea, arrepentimiento
- Clases del programa: 141
- Fuentes primarias: arXiv:1011.0686
P04 · ImageNet Classification with Deep Convolutional Neural Networks (2012)
- Autoría: Alex Krizhevsky, Ilya Sutskever, Geoffrey E. Hinton
- Problema anterior: La visión por computador dependía de descriptores diseñados manualmente; escalar el aprendizaje de features a millones de imágenes era inviable.
- Propuesta: Una CNN profunda entrenada en GPU con ReLU, dropout, aumento de datos y solapamiento de pooling sobre ILSVRC-2012.
- Hito: El resultado que convirtió el deep learning en la corriente principal: margen amplio sobre los métodos de visión hechos a mano.
- Conceptos: CNN, ImageNet, ReLU, dropout, GPU, aumento de datos
- Clases del programa: 053, 061, 062
- Fuentes primarias: NeurIPS 2012 (proceedings) · DOI (versión Communications of the ACM, 2017)
P108 · CAP Twelve Years Later: How the «Rules» Have Changed (2012)
- Autoría: Eric Brewer
- Problema anterior: El teorema CAP se citaba como «elige dos de consistencia, disponibilidad y tolerancia a particiones», y eso llevó a decisiones de arquitectura globales y rígidas: sistemas enteros declarados AP o CP.
- Propuesta: Reformularlo con precisión: la tolerancia a particiones no es opcional, y la elección entre consistencia y disponibilidad solo aplica durante una partición. Se decide por operación, y hay que diseñar explícitamente la detección de la partición, el modo degradado y la reconciliación posterior.
- Hito: Corrige la lectura simplista de su propio teorema: no se eligen dos de tres, se elige por operación y solo mientras dura la partición.
- Conceptos: CAP, partición, consistencia, disponibilidad, reconciliación
- Clases del programa: 158
- Fuentes primarias: doi:10.1109/MC.2012.37
P05 · Efficient Estimation of Word Representations in Vector Space (2013)
- Autoría: Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean
- Problema anterior: Representar palabras como identificadores dispersos (one-hot) impide medir similitud; los modelos neuronales de lenguaje previos eran demasiado costosos.
- Propuesta: Dos arquitecturas log-lineales sin capa oculta —CBOW y skip-gram— que predicen contexto y producen vectores con estructura lineal.
- Hito: El significado distribucional se vuelve barato: vectores densos entrenables sobre miles de millones de palabras.
- Conceptos: embeddings, skip-gram, CBOW, muestreo negativo, hipótesis distribucional, analogías
- Clases del programa: 064, 066, 100, 166
- Fuentes primarias: arXiv:1301.3781 · arXiv:1310.4546 (muestreo negativo y frases)
P109 · The Tail at Scale (2013)
- Autoría: Jeffrey Dean, Luiz André Barroso
- Problema anterior: Un servicio con un p99 excelente puede producir un sistema lento si la petición del usuario necesita respuesta de cientos de servidores: basta que uno vaya lento para que toda la petición lo vaya, y con cien servidores eso pasa casi siempre.
- Propuesta: Tratar la variabilidad de latencia como propiedad de diseño y no como ruido. Técnicas de tolerancia a la cola —peticiones de cobertura, cancelación cruzada, micro-particionado, réplicas selectivas— que reducen la cola sin eliminar sus causas.
- Hito: Muestra que con abanico grande la latencia de cola de cada componente se convierte en la latencia típica del sistema completo.
- Conceptos: latencia de cola, p99, abanico, peticiones de cobertura, sistemas a escala
- Clases del programa: 152
- Fuentes primarias: doi:10.1145/2408776.2408794
P38 · Auto-Encoding Variational Bayes (2013)
- Autoría: Diederik P. Kingma, Max Welling
- Problema anterior: Un modelo generativo con variables latentes exige muestrear, y muestrear es un nodo estocástico que bloquea el gradiente: no se podía entrenar por retropropagación.
- Propuesta: Escribir la muestra como z = μ + σ·ε con ε de una normal fija: el azar queda fuera del camino del gradiente, y se optimiza una cota inferior de la verosimilitud (ELBO).
- Hito: Hace entrenable un modelo generativo latente: el truco de reparametrización deja pasar el gradiente a través del muestreo.
- Conceptos: VAE, reparametrización, ELBO, espacio latente, inferencia variacional
- Clases del programa: 058, 088
- Fuentes primarias: arXiv:1312.6114
P06 · Sequence to Sequence Learning with Neural Networks (2014)
- Autoría: Ilya Sutskever, Oriol Vinyals, Quoc V. Le
- Problema anterior: Las redes profundas requerían entradas y salidas de dimensión fija; la traducción automática dependía de sistemas estadísticos con muchas piezas separadas.
- Propuesta: Un LSTM codifica la entrada en un vector de tamaño fijo y otro LSTM lo decodifica token a token; invertir la secuencia fuente mejora el resultado.
- Hito: Una única red aprende a mapear secuencias de longitud variable a secuencias de longitud variable, de extremo a extremo.
- Conceptos: encoder-decoder, vector de contexto, traducción automática neuronal, cuello de botella, BLEU
- Clases del programa: 054, 055, 067
- Fuentes primarias: arXiv:1409.3215
P07 · Neural Machine Translation by Jointly Learning to Align and Translate (2014)
- Autoría: Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio
- Problema anterior: Comprimir una frase entera en un vector fijo degrada la traducción de frases largas: es un cuello de botella de información.
- Propuesta: Un vector de contexto distinto por paso de salida, calculado como suma ponderada de los estados del codificador con pesos aprendidos (atención aditiva).
- Hito: Nace la atención: el decodificador deja de depender de un único vector y consulta toda la entrada en cada paso.
- Conceptos: atención, alineación, vector de contexto dinámico, softmax, atención aditiva
- Clases del programa: 054, 055
- Fuentes primarias: arXiv:1409.0473
P110 · A Survey on Concept Drift Adaptation (2014)
- Autoría: João Gama, Indrė Žliobaitė, Albert Bifet, Mykola Pechenizkiy, Abdelhamid Bouchachia
- Problema anterior: Un modelo se entrena con datos de un momento y se despliega sobre un flujo que cambia. La relación entre entradas y etiquetas puede cambiar sin que cambien las entradas, así que vigilar la distribución de entrada no basta y el modelo se degrada en silencio.
- Propuesta: Una taxonomía de tipos de deriva —abrupta, gradual, incremental, recurrente— y de estrategias: detectores estadísticos sobre la tasa de error, ventanas adaptativas, conjuntos con reemplazo de miembros y reentrenamiento programado.
- Hito: Ordena el problema de que el mundo cambie después de entrenar, y separa detectar de adaptarse.
- Conceptos: deriva de concepto, flujo de datos, detección de cambio, reentrenamiento, evaluación continua
- Clases del programa: 154
- Fuentes primarias: doi:10.1145/2523813
P23 · GloVe: Global Vectors for Word Representation (2014)
- Autoría: Jeffrey Pennington, Richard Socher, Christopher D. Manning
- Problema anterior: Word2Vec aprendía de ventanas locales y desaprovechaba las estadísticas globales del corpus; los métodos de factorización usaban esas estadísticas pero producían peores analogías.
- Propuesta: Ajustar por mínimos cuadrados ponderados el producto de vectores al logaritmo de la co-ocurrencia, con el argumento de que lo informativo es la RAZÓN de co-ocurrencias, no su valor bruto.
- Hito: Unifica las dos familias de embeddings: factorizar estadísticas globales de co-ocurrencia con la ventaja de los métodos predictivos.
- Conceptos: GloVe, co-ocurrencia, factorización, mínimos cuadrados ponderados, razón de probabilidades
- Clases del programa: 064, 066
- Fuentes primarias: ACL Anthology (EMNLP 2014) · DOI
P39 · Generative Adversarial Networks (2014)
- Autoría: Ian J. Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, y otros
- Problema anterior: Los modelos generativos exigían definir y optimizar una verosimilitud, lo que obligaba a aproximaciones costosas o producía muestras borrosas.
- Propuesta: Entrenar un generador contra un discriminador en un juego minimax: el generador gana cuando el discriminador ya no distingue lo real de lo sintético.
- Hito: Convierte la generación en un juego: dos redes compiten y ninguna necesita una verosimilitud explícita.
- Conceptos: GAN, minimax, discriminador, colapso de modos, entrenamiento adversario
- Clases del programa: 058, 089
- Fuentes primarias: arXiv:1406.2661
P40 · Dropout: A Simple Way to Prevent Neural Networks from Overfitting (2014)
- Autoría: Nitish Srivastava, Geoffrey Hinton, Alex Krizhevsky, Ilya Sutskever, Ruslan Salakhutdinov
- Problema anterior: Las redes grandes memorizaban el conjunto de entrenamiento, y las unidades desarrollaban co-adaptaciones frágiles: una función solo servía si su 'socia' estaba presente.
- Propuesta: En cada paso, poner a cero cada unidad con probabilidad p. Ninguna función puede depender de una unidad concreta, así que la red aprende representaciones redundantes.
- Hito: Apagar unidades al azar durante el entrenamiento equivale a entrenar un ensamblado exponencial de subredes que comparten pesos.
- Conceptos: dropout, regularización, co-adaptación, ensamblado, sobreajuste
- Clases del programa: 051, 052
- Fuentes primarias: JMLR 15(56)
P41 · Adam: A Method for Stochastic Optimization (2014)
- Autoría: Diederik P. Kingma, Jimmy Ba
- Problema anterior: SGD usa la misma tasa de aprendizaje en todas las direcciones. En un problema mal condicionado, o oscila en las direcciones de mucha curvatura o se arrastra en las de poca.
- Propuesta: Mantener medias móviles del gradiente (primer momento) y de su cuadrado (segundo momento), con corrección de sesgo, y normalizar el paso de cada coordenada por su magnitud típica.
- Hito: Un paso de aprendizaje por dimensión, adaptado a la escala de su propio gradiente. Es el optimizador por defecto de casi todo lo que vino después.
- Conceptos: Adam, optimización adaptativa, momentos, corrección de sesgo, tasa de aprendizaje
- Clases del programa: 050, 052
- Fuentes primarias: arXiv:1412.6980
P42 · Explaining and Harnessing Adversarial Examples (2014)
- Autoría: Ian J. Goodfellow, Jonathon Shlens, Christian Szegedy
- Problema anterior: Szegedy et al. (2013) habían descubierto que perturbaciones minúsculas engañaban a las redes, y se atribuía a la extrema no linealidad de los modelos profundos.
- Propuesta: Mostrar que la explicación es la contraria —el comportamiento demasiado LINEAL en alta dimensión— y derivar de ahí un ataque de un solo paso (FGSM) y una defensa por entrenamiento adversario.
- Hito: Una perturbación imperceptible cambia la predicción. Y la causa no es la profundidad: es la linealidad en dimensión alta.
- Conceptos: ejemplos adversarios, FGSM, robustez, linealidad, entrenamiento adversario
- Clases del programa: 053, 162, 163
- Fuentes primarias: arXiv:1412.6572
P111 · Hidden Technical Debt in Machine Learning Systems (2015)
- Autoría: D. Sculley, Gary Holt, Daniel Golovin, Eugene Davydov, Todd Phillips, Dietmar Ebner, Vinay Chaudhary, Michael Young, Jean-François Crespo, Dan Dennison
- Problema anterior: Los equipos medían su trabajo por la calidad del modelo mientras el sistema alrededor —ingestión, características, servicio, monitorización, configuración— crecía sin control. Y esa parte acumula formas de deuda que no tienen equivalente en software convencional: dependencias de datos que ningún compilador comprueba.
- Propuesta: Un catálogo de antipatrones específicos del aprendizaje automático: dependencias de datos no declaradas, características huérfanas, bucles de realimentación ocultos, código de pegamento, deuda de configuración, y el principio CACE — cambiar cualquier cosa lo cambia todo.
- Hito: Nombra el hecho incómodo del área: el código del modelo es una fracción diminuta del sistema, y el resto acumula una deuda que ninguna herramienta detecta.
- Conceptos: deuda técnica, MLOps, dependencias de datos, CACE, bucles de realimentación
- Clases del programa: 148
- Fuentes primarias: NeurIPS 2015
P26 · Human-level control through deep reinforcement learning (2015)
- Autoría: Volodymyr Mnih, Koray Kavukcuoglu, David Silver, y otros (DeepMind)
- Problema anterior: Combinar aprendizaje por refuerzo con aproximación de función no lineal era notoriamente inestable: las muestras consecutivas están correlacionadas y el objetivo se mueve mientras se aprende.
- Propuesta: Q-learning con una red convolucional, estabilizado con repetición de experiencia (rompe la correlación) y una red objetivo congelada (fija el blanco).
- Hito: El primer agente que aprende a actuar directamente desde píxeles, con la misma arquitectura y los mismos hiperparámetros en decenas de juegos.
- Conceptos: DQN, Q-learning, repetición de experiencia, red objetivo, Atari, refuerzo profundo
- Clases del programa: 029, 030, 057
- Fuentes primarias: DOI (Nature 518, 529–533)
P43 · Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift (2015)
- Autoría: Sergey Ioffe, Christian Szegedy
- Problema anterior: Entrenar redes profundas exigía inicializaciones cuidadosas y tasas de aprendizaje pequeñas: la distribución de las activaciones de cada capa se desplazaba durante el entrenamiento.
- Propuesta: Normalizar cada activación usando la media y la varianza del minilote, y añadir dos parámetros aprendidos (γ, β) para que la red pueda deshacer la normalización si le conviene.
- Hito: Normalizar las activaciones dentro de la red permite tasas de aprendizaje mucho mayores y hace el entrenamiento profundo mucho menos frágil.
- Conceptos: normalización por lotes, activaciones, tasa de aprendizaje, γ y β, estabilidad
- Clases del programa: 051, 052
- Fuentes primarias: arXiv:1502.03167
P44 · Deep Residual Learning for Image Recognition (2015)
- Autoría: Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun
- Problema anterior: Al pasar de 20 a 56 capas, el error de ENTRENAMIENTO subía. No era sobreajuste: era que las redes muy profundas se habían vuelto imposibles de optimizar.
- Propuesta: Que cada bloque aprenda un residuo F(x) y la salida sea F(x) + x. Si la capa no aporta, aprender F ≈ 0 es fácil, y el gradiente siempre tiene una ruta directa.
- Hito: El atajo identidad hace apilables cientos de capas. Es la misma idea aditiva de la LSTM, aplicada a la profundidad.
- Conceptos: ResNet, conexión residual, atajo identidad, degradación, profundidad
- Clases del programa: 051, 053, 061, 062
- Fuentes primarias: arXiv:1512.03385
P45 · Distilling the Knowledge in a Neural Network (2015)
- Autoría: Geoffrey Hinton, Oriol Vinyals, Jeff Dean
- Problema anterior: Los modelos grandes o los conjuntos de modelos daban los mejores resultados pero eran caros de servir, y entrenar el modelo pequeño con las etiquetas duras daba mucho peor resultado.
- Propuesta: Entrenar el modelo pequeño para reproducir la distribución completa del maestro, suavizada con una temperatura que revela la estructura de similitud entre clases.
- Hito: Las probabilidades del maestro contienen más información que la etiqueta correcta: el modelo pequeño aprende de esa estructura.
- Conceptos: destilación, objetivos suaves, temperatura, conocimiento oscuro, compresión de modelos
- Clases del programa: 059, 086, 157
- Fuentes primarias: arXiv:1503.02531
P118 · Neural Machine Translation of Rare Words with Subword Units (2016)
- Autoría: Rico Sennrich, Barry Haddow, Alexandra Birch
- Problema anterior: Un vocabulario de palabras completas siempre se queda corto: llega una palabra que no estaba y el modelo solo puede emitir un símbolo de desconocido, aunque sus raíces y sufijos sí estuvieran en el entrenamiento.
- Propuesta: Adaptar la compresión por pares de bytes: partir de caracteres y fusionar repetidamente el par de símbolos más frecuente, un número fijo de veces. El vocabulario resultante cubre cualquier cadena porque el peor caso es deletrear.
- Hito: Elimina el problema de la palabra desconocida haciendo que la unidad de vocabulario sea más pequeña que la palabra, con un algoritmo que la frecuencia decide sola.
- Conceptos: tokenización, subpalabras, BPE, vocabulario abierto, traducción
- Clases del programa: 073
- Fuentes primarias: doi:10.18653/v1/P16-1162
P119 · WaveNet: A Generative Model for Raw Audio (2016)
- Autoría: Aäron van den Oord, Sander Dieleman, Heiga Zen, Karen Simonyan, Oriol Vinyals, Alex Graves, Nal Kalchbrenner, Andrew Senior, Koray Kavukcuoglu
- Problema anterior: Modelar audio directamente exige un contexto de miles de muestras: a 16 kHz, un segundo son 16 000 valores. Una convolución normal necesitaría miles de capas para verlo, y una recurrente no puede entrenarse en paralelo sobre esa longitud.
- Propuesta: Convoluciones causales con dilatación que se duplica por capa: el campo receptivo crece de forma exponencial con la profundidad. Más cuantización μ-law para que 256 niveles basten sin que la voz suene rota.
- Hito: Genera la forma de onda muestra a muestra con convoluciones causales dilatadas, y cierra la brecha de naturalidad que arrastraba la síntesis de voz.
- Conceptos: audio, convolución dilatada, causalidad, μ-law, síntesis de voz
- Clases del programa: 068
- Fuentes primarias: arXiv:1609.03499
P27 · Mastering the game of Go with deep neural networks and tree search (2016)
- Autoría: David Silver, Aja Huang, Chris J. Maddison, y otros (DeepMind)
- Problema anterior: El go tiene un espacio de estados y un factor de ramificación que hacen inviable la búsqueda exhaustiva, y no existía una función de evaluación de posiciones suficientemente buena.
- Propuesta: Una red de políticas que propone jugadas plausibles y una red de valor que evalúa posiciones, usadas para guiar y truncar una búsqueda de Monte Carlo en árbol.
- Hito: Une las dos tradiciones de la IA: la búsqueda simbólica de la parte 01 y el aprendizaje profundo de la parte 04, en un solo sistema.
- Conceptos: AlphaGo, MCTS, red de políticas, red de valor, autojuego, búsqueda guiada
- Clases del programa: 017, 031, 057, 172
- Fuentes primarias: DOI (Nature 529, 484–489)
P08 · Attention Is All You Need (2017)
- Autoría: Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin
- Problema anterior: La recurrencia impone un cómputo secuencial en la longitud de la secuencia y camina O(n) pasos entre posiciones distantes; eso limita el entrenamiento a gran escala.
- Propuesta: Un encoder–decoder compuesto solo de self-attention multi-cabeza, redes feed-forward por posición, conexiones residuales, layer normalization y codificación posicional.
- Hito: Elimina la recurrencia y la convolución del modelado de secuencias: todo el cómputo de una capa se paraleliza.
- Conceptos: Transformer, self-attention, multi-head, scaled dot-product, codificación posicional, máscara causal, paralelización
- Clases del programa: 055, 074
- Fuentes primarias: arXiv:1706.03762 · NeurIPS 2017 (proceedings)
P102 · Proximal Policy Optimization Algorithms (2017)
- Autoría: John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, Oleg Klimov
- Problema anterior: En gradiente de políticas, un paso demasiado grande destruye la política: se vuelve casi determinista, deja de explorar y no puede recuperarse. TRPO lo resolvía con una restricción de divergencia KL, a costa de una optimización de segundo orden compleja.
- Propuesta: Sustituir la restricción por un recorte del cociente de probabilidades entre la política nueva y la vieja. Pasado el umbral, mejorar más no aporta al objetivo, así que el gradiente deja de empujar. Sin restricciones, sin segundo orden.
- Hito: Consigue la estabilidad de TRPO con una función objetivo que se implementa en unas líneas y se optimiza con descenso de gradiente corriente.
- Conceptos: gradiente de políticas, recorte, región de confianza, aprendizaje por refuerzo, estabilidad
- Clases del programa: 140
- Fuentes primarias: arXiv:1707.06347
P103 · Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World (2017)
- Autoría: Josh Tobin, Rachel Fong, Alex Ray, Jonas Schneider, Wojciech Zaremba, Pieter Abbeel
- Problema anterior: Entrenar en simulación es barato y seguro; desplegar en el mundo real falla. El hueco entre simulación y realidad se atacaba mejorando el simulador, una carrera cara y sin final: siempre queda algo que no se modeló.
- Propuesta: Aleatorizar agresivamente los parámetros del simulador —texturas, iluminación, posiciones de cámara, ruido— durante el entrenamiento. Si la variabilidad es suficiente, al modelo la realidad le parece una configuración más de las que ya vio.
- Hito: Invierte el objetivo del simulador: en vez de buscar fidelidad, busca que la realidad sea una variación más dentro del rango de entrenamiento.
- Conceptos: sim-to-real, aleatorización de dominio, transferencia, robustez, gemelo digital
- Clases del programa: 142
- Fuentes primarias: arXiv:1703.06907
P112 · The ML Test Score: A Rubric for ML Production Readiness and Technical Debt Reduction (2017)
- Autoría: Eric Breck, Shanqing Cai, Eric Nielsen, Michael Salib, D. Sculley
- Problema anterior: La decisión de promocionar un modelo a producción se tomaba mirando su métrica de calidad. Nada garantizaba que existieran pruebas de los datos, de la infraestructura, de la capacidad de revertir ni de la monitorización.
- Propuesta: Una rúbrica con cuatro categorías —datos, modelo, infraestructura y monitorización— y siete pruebas en cada una, con una puntuación global que es el mínimo entre categorías: un sistema es tan robusto como su parte más débil.
- Hito: Convierte «¿está listo para producción?» en una rúbrica de 28 pruebas concretas, puntuada por su categoría más débil.
- Conceptos: preparación para producción, pruebas, rúbrica, MLOps, promoción
- Clases del programa: 151
- Fuentes primarias: doi:10.1109/BigData.2017.8258038
P120 · Semi-Supervised Classification with Graph Convolutional Networks (2017)
- Autoría: Thomas N. Kipf, Max Welling
- Problema anterior: Muchos datos son grafos —citas, redes sociales, moléculas— donde etiquetar es caro y solo se tiene una fracción diminuta. Los métodos previos o eran costosos en el dominio espectral, o ignoraban la estructura y solo usaban los rasgos.
- Propuesta: Una aproximación de primer orden de la convolución espectral que se reduce a promediar los rasgos de cada nodo con los de sus vecinos, normalizado por el grado, y apilar dos o tres de esas capas. Nada más.
- Hito: Reduce la convolución sobre grafos a una regla de propagación de una línea, y con ella clasifica con una fracción mínima de nodos etiquetados.
- Conceptos: grafos, semisupervisado, propagación, sobre-suavizado, homofilia
- Clases del programa: 056
- Fuentes primarias: arXiv:1609.02907
P121 · MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications (2017)
- Autoría: Andrew G. Howard, Menglong Zhu, Bo Chen, Dmitry Kalenichenko, Weijun Wang, Tobias Weyand, Marco Andreetto, Hartwig Adam
- Problema anterior: Las redes de visión que funcionaban exigían un centro de datos. En un teléfono, un sensor o un vehículo, el presupuesto es de milivatios y milisegundos, y no había forma sistemática de elegir dónde recortar.
- Propuesta: Convolución separable en profundidad —filtrar cada canal por separado y luego combinarlos con núcleos de 1×1—, más un multiplicador de anchura y otro de resolución que parametrizan la familia entera.
- Hito: Descompone la convolución en dos pasos y convierte el compromiso entre precisión y coste en dos perillas explícitas que el ingeniero elige.
- Conceptos: eficiencia, convolución separable, borde, presupuesto de cómputo, cuantización
- Clases del programa: 071
- Fuentes primarias: arXiv:1704.04861
P145 · Overcoming catastrophic forgetting in neural networks (2017)
- Autoría: James Kirkpatrick, Razvan Pascanu, Neil Rabinowitz, Joel Veness, Guillaume Desjardins, Andrei A. Rusu, y otros
- Problema anterior: El olvido catastrófico llevaba treinta años documentado y sin remedio práctico. Reentrenar con todos los datos anteriores resuelve el problema y exige conservarlos, que es justo lo que no siempre se puede.
- Propuesta: Estimar cuánto importa cada peso para lo ya aprendido —aproximando la información de Fisher— y añadir a la pérdida una penalización elástica que tira de esos pesos hacia su valor anterior, con fuerza proporcional a su importancia.
- Hito: Frena selectivamente los pesos que importaban para las tareas anteriores y deja libres los demás, con una penalización derivada de la información de Fisher.
- Conceptos: aprendizaje continuo, información de Fisher, penalización elástica, plasticidad, olvido
- Clases del programa: 176
- Fuentes primarias: doi:10.1073/pnas.1611835114
P146 · Communication-Efficient Learning of Deep Networks from Decentralized Data (2017)
- Autoría: H. Brendan McMahan, Eider Moore, Daniel Ramage, Seth Hampson, Blaise Agüera y Arcas
- Problema anterior: Los datos más útiles para entrenar —lo que se escribe en el teclado, lo que se fotografía— son los más sensibles y viven en millones de dispositivos con conexión lenta e intermitente. Centralizarlos es caro en comunicación y problemático en privacidad.
- Propuesta: Promediado federado: cada cliente entrena varias épocas en local sobre sus propios datos y envía solo los pesos resultantes; el servidor los promedia y devuelve el modelo. Más cómputo local a cambio de menos rondas de comunicación.
- Hito: Entrena un modelo compartido sin que los datos salgan del dispositivo, promediando modelos en vez de recoger registros.
- Conceptos: aprendizaje federado, promediado, comunicación, datos descentralizados, heterogeneidad
- Clases del programa: 177
- Fuentes primarias: arXiv:1602.05629
P94 · Stan: A Probabilistic Programming Language (2017)
- Autoría: Bob Carpenter, Andrew Gelman, Matthew D. Hoffman, Daniel Lee, Ben Goodrich, Michael Betancourt, Marcus Brubaker, Jiqiang Guo, Peter Li, Allen Riddell
- Problema anterior: Cada modelo bayesiano nuevo exigía escribir a mano su propio muestreador, con la matemática y los errores que eso trae. El coste de probar una variante del modelo era el de reimplementar el algoritmo.
- Propuesta: Un lenguaje declarativo para especificar el modelo —previas y verosimilitud— y un motor de inferencia general basado en Monte Carlo hamiltoniano con NUTS, más diagnósticos de convergencia integrados.
- Hito: Separa declarar el modelo de calcular la inferencia: se escribe qué se supone del mundo y el motor devuelve la posterior.
- Conceptos: programación probabilística, inferencia bayesiana, Monte Carlo hamiltoniano, posterior, diagnóstico de convergencia
- Clases del programa: 035
- Fuentes primarias: doi:10.18637/jss.v076.i01
P09 · BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (2018)
- Autoría: Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova
- Problema anterior: Los modelos de lenguaje eran unidireccionales; para comprender una palabra hace falta el contexto de ambos lados, y entrenar bidireccionalmente con predicción del siguiente token es trivialmente degenerado.
- Propuesta: Modelado de lenguaje enmascarado (MLM) más predicción de la siguiente oración (NSP), y ajuste fino de todo el modelo por tarea.
- Hito: Consolida el patrón preentrenar-y-ajustar: un mismo modelo base sirve para muchas tareas con un ajuste pequeño.
- Conceptos: BERT, MLM, bidireccional, preentrenamiento, fine-tuning, GLUE
- Clases del programa: 065, 074
- Fuentes primarias: arXiv:1810.04805 · ACL Anthology (NAACL 2019)
P113 · Deep Reinforcement Learning That Matters (2018)
- Autoría: Peter Henderson, Riashat Islam, Philip Bachman, Joelle Pineau, Doina Precup, David Meger
- Problema anterior: Los resultados en aprendizaje por refuerzo se comparaban con tres o cinco corridas, sin declarar semillas, implementación ni hiperparámetros. Con la varianza real entre semillas, ese protocolo no distingue algoritmos: produce rankings que se invierten al repetir el experimento.
- Propuesta: Medirlo. Ejecutar los mismos algoritmos con muchas semillas, con distintas implementaciones y en distintos entornos, y cuantificar cuánto de la diferencia publicada es señal y cuánto es elección de semilla, de código o de entorno.
- Hito: Demuestra empíricamente que con pocas semillas el ranking entre algoritmos es una moneda al aire, y que muchas mejoras publicadas no sobreviven a la comprobación.
- Conceptos: reproducibilidad, semillas, varianza, trazabilidad, aprendizaje por refuerzo
- Clases del programa: 149
- Fuentes primarias: doi:10.1609/aaai.v32i1.11694
P122 · Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions (2018)
- Autoría: Jonathan Shen, Ruoming Pang, Ron J. Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, RJ Skerry-Ryan, Rif A. Saurous, Yannis Agiomyrgiannakis, Yonghui Wu
- Problema anterior: Predecir la forma de onda directamente desde el texto es intratable: tres segundos de audio son decenas de miles de pasos autorregresivos, y ningún modelo con atención puede alinear texto contra una secuencia de esa longitud.
- Propuesta: Dos modelos con una interfaz explícita: uno predice el espectrograma mel desde el texto con atención, y un vocoder neuronal convierte ese espectrograma en forma de onda. Cada etapa se entrena y se sustituye por separado.
- Hito: Parte la síntesis en dos etapas con el espectrograma mel como interfaz, y alcanza naturalidad indistinguible de una grabación en la escala de opinión media.
- Conceptos: síntesis de voz, espectrograma mel, atención monótona, vocoder, arquitectura en dos etapas
- Clases del programa: 068
- Fuentes primarias: doi:10.1109/ICASSP.2018.8461368
P123 · SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing (2018)
- Autoría: Taku Kudo, John Richardson
- Problema anterior: BPE suponía texto ya partido por espacios, y eso no es universal: el japonés y el chino no los usan. Además cada implementación normalizaba a su manera, así que reconstruir el texto original era imposible y los resultados no eran comparables.
- Propuesta: Tratar la entrada como un flujo de caracteres crudo, codificar el espacio como un símbolo más del vocabulario, y ofrecer también un modelo unigrama donde la segmentación es inferencia probabilística y se puede muestrear para regularizar.
- Hito: Elimina la pretokenización por espacios y hace la detokenización exacta, lo que convierte al tokenizador en una pieza reproducible e independiente del idioma.
- Conceptos: tokenización, reversibilidad, modelo unigrama, multilingüe, regularización de subpalabra
- Clases del programa: 073
- Fuentes primarias: doi:10.18653/v1/D18-2012
P124 · Graph Attention Networks (2018)
- Autoría: Petar Veličković, Guillem Cucurull, Arantxa Casanova, Adriana Romero, Pietro Liò, Yoshua Bengio
- Problema anterior: La convolución de grafo promedia a todos los vecinos por igual y normaliza por el grado. Eso supone que todos los vecinos importan lo mismo y exige conocer el grafo completo, lo que impide aplicar el modelo a nodos que no se vieron al entrenar.
- Propuesta: Calcular un coeficiente de atención para cada pareja de nodos vecinos, normalizarlo con softmax sobre el vecindario y agregar con esos pesos. Varias cabezas en paralelo, como en el Transformer.
- Hito: Sustituye el promedio uniforme sobre los vecinos por pesos aprendidos por pareja, sin necesitar conocer la estructura global del grafo.
- Conceptos: grafos, atención, agregación ponderada, inductivo, vecindario
- Clases del programa: 056
- Fuentes primarias: arXiv:1710.10903
P147 · Recurrent World Models Facilitate Policy Evolution (2018)
- Autoría: David Ha, Jürgen Schmidhuber
- Problema anterior: Aprender por refuerzo exige millones de interacciones con el entorno. En simulación es caro; en un robot, inviable. Y el agente pasa la mayor parte de esas interacciones reaprendiendo cómo funciona el mundo, no cómo actuar en él.
- Propuesta: Separar el problema en tres piezas: un codificador que comprime la observación, un modelo recurrente que predice el futuro en ese espacio comprimido, y una política diminuta entrenada dentro del modelo, sin tocar el entorno.
- Hito: Entrena la política dentro de un modelo del entorno aprendido, y demuestra que la política resultante funciona en el entorno real.
- Conceptos: modelo del mundo, aprendizaje con modelo, sueño, eficiencia de muestras, explotación del modelo
- Clases del programa: 174
- Fuentes primarias: arXiv:1803.10122
P24 · Deep Contextualized Word Representations (2018)
- Autoría: Matthew E. Peters, Mark Neumann, Mohit Iyyer, Matt Gardner, Christopher Clark, Kenton Lee, Luke Zettlemoyer
- Problema anterior: Un embedding estático da el mismo vector a «banco del parque» y «banco central»: el sentido se pierde antes de que el modelo empiece a trabajar.
- Propuesta: Usar los estados internos de un modelo de lenguaje bidireccional profundo y combinar sus capas con pesos aprendidos por tarea.
- Hito: Un vector por APARICIÓN y no por palabra: la polisemia deja de colapsar en un único punto del espacio.
- Conceptos: ELMo, embeddings contextuales, polisemia, modelo de lenguaje bidireccional, combinación de capas
- Clases del programa: 065, 066
- Fuentes primarias: ACL Anthology (NAACL 2018)
P86 · The M4 Competition: Results, findings, conclusion and way forward (2018)
- Autoría: Spyros Makridakis, Evangelos Spiliotis, Vassilios Assimakopoulos
- Problema anterior: Cada artículo de predicción reportaba mejoras sobre sus propias series y sus propias líneas base. Sin una evaluación común y a ciegas, el campo no podía saber qué funcionaba de verdad.
- Propuesta: Una competición abierta con 100 000 series reales de dominios distintos, horizontes fijos, métricas declaradas de antemano y evaluación fuera de muestra sobre datos que los participantes no ven.
- Hito: Cien mil series y sesenta y un métodos para responder empíricamente qué funciona al predecir series temporales — y la respuesta incomoda a todo el mundo.
- Conceptos: series temporales, backtesting, combinación de métodos, líneas base, evaluación fuera de muestra
- Clases del programa: 045
- Fuentes primarias: doi:10.1016/j.ijforecast.2018.06.001
P114 · Model Cards for Model Reporting (2019)
- Autoría: Margaret Mitchell, Simone Wu, Andrew Zaldivar, Parker Barnes, Lucy Vasserman, Ben Hutchinson, Elena Spitzer, Inioluwa Deborah Raji, Timnit Gebru
- Problema anterior: Un modelo se publica con una cifra agregada de exactitud y sin decir para qué sirve, para qué no, con qué datos se evaluó ni a quién le funciona peor. Quien lo integra no tiene forma de saber si es adecuado para su caso.
- Propuesta: Una tarjeta de una o dos páginas con secciones fijas: detalles del modelo, uso previsto, usos fuera de alcance, factores relevantes, métricas, datos de evaluación y entrenamiento, análisis cuantitativo desagregado, consideraciones éticas y advertencias.
- Hito: Propone un documento corto y estandarizado que acompaña a cada modelo, con evaluación desagregada por subgrupo y usos fuera de alcance declarados.
- Conceptos: tarjeta de modelo, evaluación desagregada, transparencia, documentación, subgrupos
- Clases del programa: 150
- Fuentes primarias: doi:10.1145/3287560.3287596
P25 · Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (2019)
- Autoría: Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, Peter J. Liu
- Problema anterior: Cada tarea exigía su propia cabeza —clasificación, regresión, extracción, generación— lo que impedía comparar objetivos, arquitecturas y datos en igualdad de condiciones.
- Propuesta: Un marco unificado texto a texto, un estudio sistemático de todas las decisiones de diseño del preentrenamiento, y el corpus C4 (Colossal Clean Crawled Corpus).
- Hito: Todo problema de texto se reescribe como texto → texto: un solo modelo, una sola pérdida, cero cabezas específicas.
- Conceptos: T5, texto a texto, transferencia, C4, encoder-decoder, estudio sistemático
- Clases del programa: 065, 074
- Fuentes primarias: arXiv:1910.10683 · JMLR 21(140)
P95 · The Seven Tools of Causal Inference, with Reflections on Machine Learning (2019)
- Autoría: Judea Pearl
- Problema anterior: El aprendizaje automático ajusta funciones sobre distribuciones observadas, y con eso responde preguntas de asociación. Pero las decisiones que importan son de intervención —«¿qué pasa si hago X?»— y esa pregunta no se puede responder solo con datos observacionales, por muchos que sean.
- Propuesta: La escalera de la causalidad y siete herramientas asociadas: modelos gráficos, el operador do, el criterio de puerta trasera, la fórmula de ajuste, mediación, transportabilidad y datos faltantes. La estructura causal se declara; no se estima de la tabla.
- Hito: Ordena en tres peldaños lo que un sistema puede responder —asociación, intervención y contrafáctico— y muestra que subir de peldaño exige supuestos que los datos no contienen.
- Conceptos: escalera de la causalidad, operador do, confusor, contrafáctico, paradoja de Simpson
- Clases del programa: 035, 036
- Fuentes primarias: doi:10.1145/3241036
P10 · Language Models are Few-Shot Learners (2020)
- Autoría: Tom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, y otros (OpenAI)
- Problema anterior: El patrón de BERT exigía un conjunto etiquetado y un ajuste fino por cada tarea nueva; eso no escala a la variedad de tareas reales.
- Propuesta: Escalar un Transformer autorregresivo hasta 175 000 millones de parámetros y evaluar en modo zero-shot, one-shot y few-shot mediante condicionamiento en el prompt.
- Hito: El aprendizaje en contexto: la tarea se especifica en el prompt y el modelo se adapta sin actualizar ningún peso.
- Conceptos: GPT-3, aprendizaje en contexto, few-shot, escalado, modelo autorregresivo, prompt
- Clases del programa: 074, 076, 086
- Fuentes primarias: arXiv:2005.14165
P11 · Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (2020)
- Autoría: Patrick Lewis, Ethan Perez, Aleksandra Piktus, Fabio Petroni, y otros
- Problema anterior: Todo lo que un modelo sabe está congelado en sus pesos: no se puede actualizar sin reentrenar, ni auditar de dónde salió una afirmación.
- Propuesta: Combinar un recuperador denso (DPR) sobre un índice de Wikipedia con un generador seq2seq (BART), entrenados de forma conjunta.
- Hito: Separa el conocimiento (índice consultable y actualizable) del razonamiento (parámetros del modelo).
- Conceptos: RAG, recuperación densa, memoria no paramétrica, citas, atribución, conocimiento actualizable
- Clases del programa: 102, 103, 104, 105, 106, 110, 111, 168
- Fuentes primarias: arXiv:2005.11401
P125 · LayoutLM: Pre-training of Text and Layout for Document Image Understanding (2020)
- Autoría: Yiheng Xu, Minghao Li, Lei Cui, Shaohan Huang, Furu Wei, Ming Zhou
- Problema anterior: Un documento no es una secuencia de texto: es texto colocado. Al linealizar una factura de dos columnas, el OCR intercala campos que no se relacionan, y un modelo que solo ve la cadena no puede emparejar cada etiqueta con su valor.
- Propuesta: Preentrenar sobre millones de documentos escaneados un modelo que recibe, para cada token, su texto y las coordenadas de su caja delimitadora, con objetivos de enmascarado que obligan a usar las dos señales.
- Hito: Añade la posición en la página como una incrustación más, y con eso convierte un modelo de lenguaje en un lector de formularios y facturas.
- Conceptos: documentos, disposición, OCR, extracción de campos, multimodal
- Clases del programa: 063
- Fuentes primarias: doi:10.1145/3394486.3403172
P127 · Jukebox: A Generative Model for Music (2020)
- Autoría: Prafulla Dhariwal, Heewoo Jun, Christine Payne, Jong Wook Kim, Alec Radford, Ilya Sutskever
- Problema anterior: Cuatro minutos de audio a 44,1 kHz son más de diez millones de muestras. Ningún modelo autorregresivo opera sobre esa longitud, y comprimir a una sola escala obliga a elegir entre estructura larga y detalle tímbrico.
- Propuesta: Un cuantizador vectorial jerárquico que codifica el audio en tres niveles de compresión distintos, y un modelo autorregresivo por nivel: el grueso decide la estructura y los finos reconstruyen el timbre condicionados por él.
- Hito: Genera canciones con voz cantada reconocible modelando códigos discretos en tres escalas temporales, en vez de la forma de onda directamente.
- Conceptos: música, cuantización vectorial, jerarquía temporal, audio generativo, estructura larga
- Clases del programa: 093
- Fuentes primarias: arXiv:2005.00341
P128 · NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis (2020)
- Autoría: Ben Mildenhall, Pratul P. Srinivasan, Matthew Tancik, Jonathan T. Barron, Ravi Ramamoorthi, Ren Ng
- Problema anterior: Representar una escena 3D como rejilla de vóxeles cuesta O(n³) en memoria: la resolución se paga al cubo y las rejillas finas no caben. Y las mallas exigen reconstruir geometría explícita, que falla con pelo, humo o vidrio.
- Propuesta: Codificar la escena como una función continua que va de posición y dirección de vista a color y densidad, representada por un perceptrón multicapa, y renderizar integrando esa función a lo largo de cada rayo con la ecuación de volumen.
- Hito: Sustituye la escena explícita por una función continua que un perceptrón representa, y sintetiza vistas nuevas con una fidelidad que no se había visto.
- Conceptos: síntesis de vistas, representación implícita, renderizado volumétrico, codificación posicional, 3D
- Clases del programa: 096
- Fuentes primarias: doi:10.1007/978-3-030-58452-8_24
P148 · Closing the AI Accountability Gap: Defining an End-to-End Framework for Internal Algorithmic Auditing (2020)
- Autoría: Inioluwa Deborah Raji, Andrew Smart, Rebecca N. White, Margaret Mitchell, Timnit Gebru, Ben Hutchinson, Jamila Smith-Loud, Daniel Theron, Parker Barnes
- Problema anterior: La auditoría algorítmica se hacía —cuando se hacía— al final, sobre un sistema ya construido. En ese punto los hallazgos importantes son incorregibles: si faltan las etiquetas de subgrupo, no se puede desagregar la evaluación, y recogerlas exigiría rehacer el conjunto de datos.
- Propuesta: Cinco etapas —alcance, correspondencia, recogida de artefactos, pruebas y reflexión— cada una con entregables concretos: declaración de caso de uso, mapa de interesados, hojas de datos, tarjetas de modelo, resultados desagregados y plan de mitigación. La auditoría produce una traza, no un veredicto.
- Hito: Convierte la auditoría de un examen final en un proceso con cinco etapas y artefactos obligatorios que se producen mientras el sistema se construye.
- Conceptos: auditoría interna, responsabilidad, artefactos, gobernanza, gestión de riesgo
- Clases del programa: 169, 170
- Fuentes primarias: doi:10.1145/3351095.3372873
P17 · Denoising Diffusion Probabilistic Models (2020)
- Autoría: Jonathan Ho, Ajay Jain, Pieter Abbeel
- Problema anterior: Las GAN generaban imágenes de calidad pero eran inestables de entrenar y colapsaban la diversidad; los VAE eran estables y producían muestras borrosas.
- Propuesta: Un proceso directo que añade ruido gaussiano en T pasos con forma cerrada, y una red que aprende a predecir ese ruido para invertirlo.
- Hito: La generación deja de ser un salto en la oscuridad: se aprende a deshacer, paso a paso, un proceso de ruido conocido.
- Conceptos: difusión, DDPM, proceso directo, predicción de ruido, cota variacional, score matching
- Clases del programa: 090, 091, 092, 095
- Fuentes primarias: arXiv:2006.11239
P46 · An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (2020)
- Autoría: Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, y otros
- Problema anterior: La convolución traía de fábrica localidad y equivarianza a la traslación, y se asumía que sin esos sesgos inductivos la visión no funcionaría.
- Propuesta: Partir la imagen en parches, proyectarlos como si fueran tokens, añadir codificación posicional y aplicar el encoder del Transformer sin más.
- Hito: Trata la imagen como una secuencia de parches y aplica un Transformer puro: la convolución deja de ser imprescindible en visión.
- Conceptos: ViT, parches, sesgo inductivo, preentrenamiento a escala, visión
- Clases del programa: 053, 061, 069
- Fuentes primarias: arXiv:2010.11929
P72 · Neurosymbolic AI: The 3rd Wave (2020)
- Autoría: Artur d'Avila Garcez, Luis C. Lamb
- Problema anterior: Las redes profundas aprenden de datos pero no razonan con reglas ni explican; los sistemas simbólicos razonan y explican pero no aprenden de datos ruidosos. Cada tradición tiene exactamente el punto ciego de la otra.
- Propuesta: Una hoja de ruta para sistemas donde la percepción estima y los símbolos restringen, con requisitos explícitos: representación, aprendizaje, razonamiento y explicación en un mismo sistema.
- Hito: Ordena la agenda de integrar aprendizaje y razonamiento en vez de elegir uno de los dos.
- Conceptos: neuro-simbólico, razonamiento, explicabilidad, restricciones, integración de paradigmas
- Clases del programa: 024
- Fuentes primarias: arXiv:2012.05876
P115 · Datasheets for Datasets (2021)
- Autoría: Timnit Gebru, Jamie Morgenstern, Briana Vecchione, Jennifer Wortman Vaughan, Hanna Wallach, Hal Daumé III, Kate Crawford
- Problema anterior: Los conjuntos de datos se comparten sin documentación sobre su origen, su composición, los filtros aplicados o los usos desaconsejados. Quien los reutiliza hereda supuestos que nadie escribió, y muchas de esas preguntas ya no se pueden responder a posteriori.
- Propuesta: Un cuestionario que sigue el ciclo de vida del conjunto —motivación, composición, recogida, preprocesado, usos, distribución y mantenimiento— y que hay que responder mientras se crea, no después.
- Hito: Traslada a los conjuntos de datos la hoja de características que acompaña a cualquier componente electrónico: qué es, cómo se hizo y para qué no sirve.
- Conceptos: hoja de datos, documentación de datos, procedencia, consentimiento, gobernanza
- Clases del programa: 148
- Fuentes primarias: doi:10.1145/3458723
P18 · Learning Transferable Visual Models From Natural Language Supervision (2021)
- Autoría: Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, y otros (OpenAI)
- Problema anterior: La visión dependía de conjuntos etiquetados con categorías fijas; cambiar de tarea exigía volver a anotar y volver a entrenar.
- Propuesta: Entrenar de forma contrastiva sobre 400 millones de pares (imagen, texto) de internet, alineando ambos espacios, y clasificar comparando la imagen con el texto de cada clase.
- Hito: El texto se convierte en la etiqueta: un solo modelo clasifica categorías que nadie anotó, describiéndolas con palabras.
- Conceptos: CLIP, contrastivo, InfoNCE, zero-shot, multimodal, supervisión débil
- Clases del programa: 062, 069, 070
- Fuentes primarias: arXiv:2103.00020
P34 · RoFormer: Enhanced Transformer with Rotary Position Embedding (2021)
- Autoría: Jianlin Su, Yu Lu, Shengfeng Pan, Ahmed Murtadha, Bo Wen, Yunfeng Liu
- Problema anterior: La codificación sinusoidal del Transformer se SUMA al embedding y codifica posición absoluta; la atención no ve directamente la distancia entre dos tokens, que es lo que importa en lenguaje.
- Propuesta: Rotar los vectores de consulta y clave en función de su posición, de modo que el producto escalar entre dos posiciones dependa únicamente de su diferencia.
- Hito: La posición se codifica rotando, y la atención pasa a depender solo de la distancia relativa. Es la base de casi todo modelo actual.
- Conceptos: RoPE, posición relativa, rotación, contexto largo, decaimiento con la distancia
- Clases del programa: 055, 079
- Fuentes primarias: arXiv:2104.09864
P47 · Highly accurate protein structure prediction with AlphaFold (2021)
- Autoría: John Jumper, Richard Evans, Alexander Pritzel, y otros (DeepMind)
- Problema anterior: Predecir la estructura tridimensional de una proteína a partir de su secuencia de aminoácidos llevaba décadas sin resolverse, y determinarla experimentalmente cuesta meses o años por proteína.
- Propuesta: Una arquitectura que razona conjuntamente sobre alineamientos múltiples de secuencias y sobre representaciones de pares de residuos, con un módulo que produce coordenadas 3D directamente.
- Hito: Resuelve en la práctica un problema abierto de cincuenta años en biología, y demuestra que la IA puede producir conocimiento científico, no solo productos.
- Conceptos: AlphaFold, plegamiento de proteínas, estructura, atención sobre pares, IA para ciencia
- Clases del programa: 173, 181
- Fuentes primarias: DOI (Nature 596, 583–589)
P48 · LoRA: Low-Rank Adaptation of Large Language Models (2021)
- Autoría: Edward J. Hu, Yelong Shen, Phillip Wallis, y otros
- Problema anterior: El ajuste fino completo exige una copia entera del modelo por tarea: inviable en almacenamiento y en memoria de entrenamiento cuando el modelo tiene miles de millones de parámetros.
- Propuesta: Congelar los pesos originales y aprender una actualización factorizada de rango bajo, W' = W + BA, que al desplegar se puede fusionar con W.
- Hito: Ajustar un modelo enorme entrenando una fracción diminuta de parámetros, sin coste añadido en inferencia.
- Conceptos: LoRA, rango bajo, adaptación eficiente, PEFT, adaptadores
- Clases del programa: 059, 077
- Fuentes primarias: arXiv:2106.09685
P61 · On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? (2021)
- Autoría: Emily M. Bender, Timnit Gebru, Angelina McMillan-Major, Shmargaret Shmitchell
- Problema anterior: El crecimiento de los modelos de lenguaje se justificaba solo por la mejora en benchmarks. Los costes ambientales, la composición del corpus y las afirmaciones sobre comprensión no se auditaban.
- Propuesta: Un análisis de riesgos previo al entrenamiento: documentar el corpus, contabilizar el coste, y no confundir fluidez estadística con acceso al significado.
- Hito: Pone por escrito el coste de la carrera por el tamaño: quién paga, quién queda representado y qué se afirma de más sobre la comprensión.
- Conceptos: corpus, sesgo de representación, coste ambiental, documentación de datos, significado
- Clases del programa: 011
- Fuentes primarias: DOI (ACM FAccT 2021)
P62 · AI and the Everything in the Whole Wide World Benchmark (2021)
- Autoría: Inioluwa Deborah Raji, Emily M. Bender, Amandalynne Paullada, Emily Denton, Alex Hanna
- Problema anterior: Los benchmarks se presentaban como pruebas de capacidades generales —«comprensión», «razonamiento»— cuando sus ítems cubren una porción estrecha y a menudo admiten atajos.
- Propuesta: Evaluar los benchmarks como instrumentos de medida: preguntar qué constructo dicen medir, qué cubren realmente sus ítems y qué estrategias los superan sin la capacidad.
- Hito: Traslada al campo el concepto de validez de constructo: un número alto no prueba la capacidad que el benchmark dice medir.
- Conceptos: validez de constructo, benchmark, atajos, generalidad, evaluación
- Clases del programa: 010
- Fuentes primarias: arXiv:2111.15366
P63 · Improving Reproducibility in Machine Learning Research (A Report from the NeurIPS 2019 Reproducibility Program) (2021)
- Autoría: Joelle Pineau, Philippe Vincent-Lamarre, Koustuv Sinha, Vincent Larivière, Alina Beygelzimer, Florence d'Alché-Buc, Emily Fox, Hugo Larochelle
- Problema anterior: Los resultados se comparaban sin declarar semillas, entorno, búsqueda de hiperparámetros ni número de corridas. Muchas mejoras publicadas no sobrevivían a un intento de repetirlas.
- Propuesta: Un checklist obligatorio en el envío, un desafío de reproducibilidad y política de código, con evidencia empírica de su efecto sobre lo que se publica.
- Hito: Convierte la reproducibilidad en un requisito operativo del proceso de publicación, con checklist, código y revisión.
- Conceptos: reproducibilidad, checklist, semillas, varianza, revisión por pares
- Clases del programa: 009
- Fuentes primarias: JMLR 22(164) · arXiv:2003.12206
P12 · Training language models to follow instructions with human feedback (2022)
- Autoría: Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, y otros (OpenAI)
- Problema anterior: Maximizar la verosimilitud del texto de internet no es lo mismo que ser útil, honesto e inocuo; el objetivo de entrenamiento está desalineado con la intención del usuario.
- Propuesta: Tres etapas: ajuste supervisado con demostraciones, modelo de recompensa entrenado con comparaciones humanas y optimización por PPO con penalización KL.
- Hito: El salto de «modelo que completa texto» a «asistente que sigue instrucciones»: alineación con preferencias humanas.
- Conceptos: RLHF, alineación, modelo de recompensa, PPO, preferencias, instrucciones
- Clases del programa: 076, 078
- Fuentes primarias: arXiv:2203.02155
P126 · OCR-free Document Understanding Transformer (2022)
- Autoría: Geewook Kim, Teakgyu Hong, Moonbin Yim, JeongYeon Nam, Jinyoung Park, Jinyeong Yim, Wonseok Hwang, Sangdoo Yun, Dongyoon Han, Seunghyun Park
- Problema anterior: La tubería OCR más analizador arrastra dos costes: los errores del OCR llegan intactos al final y se componen carácter a carácter, y el OCR hay que licenciarlo y mantenerlo por idioma.
- Propuesta: Un codificador de imagen y un decodificador que emite directamente la estructura —JSON, pares clave-valor—, preentrenado con la tarea de leer el documento completo. Sin etapa intermedia, no hay error que heredar.
- Hito: Va de la imagen del documento a la salida estructurada sin pasar por OCR, y con ello elimina una fuente de error que la etapa siguiente no podía corregir.
- Conceptos: sin OCR, extremo a extremo, propagación de errores, documentos, salida estructurada
- Clases del programa: 063
- Fuentes primarias: doi:10.1007/978-3-031-19815-1_29
P13 · ReAct: Synergizing Reasoning and Acting in Language Models (2022)
- Autoría: Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao
- Problema anterior: El razonamiento en cadena (CoT) no consulta el mundo y alucina hechos; actuar sin razonar no descompone problemas de varios pasos.
- Propuesta: Intercalar trazas de pensamiento y acciones sobre un entorno, de modo que cada observación real condicione el siguiente razonamiento.
- Hito: El modelo deja de ser solo un generador de texto y pasa a ser el controlador de un bucle que observa y actúa.
- Conceptos: ReAct, agente, bucle pensamiento-acción-observación, herramientas, traza auditable
- Clases del programa: 112, 114, 115, 116
- Fuentes primarias: arXiv:2210.03629
P19 · Training Compute-Optimal Large Language Models (2022)
- Autoría: Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch, y otros (DeepMind)
- Problema anterior: Tras GPT-3 la industria escalaba parámetros asumiendo que era la variable dominante, sin medir el reparto óptimo entre parámetros y tokens a cómputo constante.
- Propuesta: Ajustar empíricamente L(N, D) y resolver el reparto que minimiza la pérdida bajo la restricción C = 6ND.
- Hito: Corrige la carrera por el tamaño: a cómputo fijo, los modelos de la época estaban infraentrenados en datos.
- Conceptos: leyes de escalado, cómputo óptimo, tokens por parámetro, FLOPs, infraentrenamiento
- Clases del programa: 074, 075, 082, 086
- Fuentes primarias: arXiv:2203.15556
P28 · Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (2022)
- Autoría: Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc Le, Denny Zhou
- Problema anterior: Los modelos grandes fallaban en aritmética y razonamiento de varios pasos aunque acertaran tareas aparentemente más difíciles: se les pedía el resultado sin dejarles espacio para llegar a él.
- Propuesta: Incluir en el prompt unos pocos ejemplos que muestren el razonamiento paso a paso, sin ajuste fino ni datos adicionales.
- Hito: Descomponer en pasos intermedios desbloquea tareas que el mismo modelo fallaba respondiendo de una vez.
- Conceptos: cadena de pensamiento, razonamiento, prompting, emergencia, pasos intermedios
- Clases del programa: 114, 115, 175
- Fuentes primarias: arXiv:2201.11903
P35 · FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness (2022)
- Autoría: Tri Dao, Daniel Y. Fu, Stefano Ermon, Atri Rudra, Christopher Ré
- Problema anterior: Durante años se atacó el coste O(n²) de la atención con aproximaciones (dispersa, lineal), que perdían calidad y a menudo ni siquiera eran más rápidas en la práctica.
- Propuesta: Reorganizar el cálculo por bloques que caben en la memoria rápida del chip, evitando materializar la matriz de atención completa en la memoria lenta.
- Hito: El cuello de botella de la atención no eran los FLOPs sino las lecturas y escrituras a memoria. Y la solución es EXACTA, no aproximada.
- Conceptos: FlashAttention, consciencia de E/S, tiling, atención exacta, jerarquía de memoria, contexto largo
- Clases del programa: 081, 085
- Fuentes primarias: arXiv:2205.14135
P50 · Constitutional AI: Harmlessness from AI Feedback (2022)
- Autoría: Yuntao Bai, Saurav Kadavath, Sandipan Kundu, y otros (Anthropic)
- Problema anterior: RLHF depende de miles de comparaciones humanas: es caro, expone a los anotadores a contenido dañino, y los criterios quedan implícitos en los datos, sin poder inspeccionarse ni discutirse.
- Propuesta: Escribir los principios de forma explícita, hacer que el modelo critique y revise sus propias respuestas contra ellos, y usar preferencias generadas por IA para la fase de refuerzo.
- Hito: Sustituye parte del juicio humano por un conjunto de principios explícitos y auditables, y por la autocrítica del modelo.
- Conceptos: IA constitucional, RLAIF, autocrítica, principios explícitos, inocuidad
- Clases del programa: 078, 161
- Fuentes primarias: arXiv:2212.08073
P104 · WebArena: A Realistic Web Environment for Building Autonomous Agents (2023)
- Autoría: Shuyan Zhou, Frank F. Xu, Hao Zhu, Xuhui Zhou, Robert Lo, y otros
- Problema anterior: Los agentes de navegador se evaluaban con capturas, con juicios de un modelo o con el propio informe del agente. Un agente elocuente puntuaba alto sin haber completado la tarea, y los resultados no eran comparables entre trabajos.
- Propuesta: Un entorno reproducible con sitios reales autoalojados —comercio, foro, repositorio, gestor de contenidos— y, para cada tarea, un verificador programático que inspecciona el estado final del sitio.
- Hito: Evalúa agentes de navegador comprobando el ESTADO del sitio al terminar, no lo que el agente dice haber hecho.
- Conceptos: agentes de navegador, verificación funcional, entorno reproducible, evaluación, tareas transaccionales
- Clases del programa: 145
- Fuentes primarias: arXiv:2307.13854
P116 · Why Johnny Can't Prompt: How Non-AI Experts Try (and Fail) to Design LLM Prompts (2023)
- Autoría: J.D. Zamfirescu-Pereira, Richmond Y. Wong, Bjoern Hartmann, Qian Yang
- Problema anterior: Escribir prompts parece accesible a cualquiera, y por eso se hace sin ninguna disciplina de ingeniería: sin versionar, sin conjunto de evaluación y mirando dos o tres ejemplos. Con muestras pequeñas, el ruido tiene el mismo tamaño que las mejoras que se buscan.
- Propuesta: Un estudio con participantes no expertos que documenta sus estrategias reales, identifica el patrón dominante —iteración oportunista basada en anécdotas— y argumenta que el prompt necesita las prácticas del software: versionado, evaluación fija y una hipótesis por cambio.
- Hito: Documenta con usuarios reales que iterar prompts sin conjunto de evaluación produce mejoras imaginarias, y por qué la intuición falla sistemáticamente.
- Conceptos: prompts, LLMOps, evaluación, iteración, interacción persona-computador
- Clases del programa: 155
- Fuentes primarias: doi:10.1145/3544548.3581388
P117 · AgentBench: Evaluating LLMs as Agents (2023)
- Autoría: Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, y otros
- Problema anterior: Los agentes se anunciaban con una cifra global de éxito. Esa cifra no dice en qué entornos sirven, en qué paso se pierden ni por qué modo fallan, que es exactamente lo que hace falta para operarlos y para decidir qué arreglar.
- Propuesta: Un banco de pruebas multi-entorno —sistema operativo, base de datos, grafo de conocimiento, juegos, compras, navegación web— con evaluación por trayectoria y análisis de los modos de fallo, no solo de la tasa final.
- Hito: Evalúa agentes en ocho entornos distintos y hace visible que la tasa agregada esconde dónde y cómo fallan.
- Conceptos: AgentOps, trayectorias, modos de fallo, evaluación multi-entorno, agentes
- Clases del programa: 156, 159
- Fuentes primarias: arXiv:2308.03688
P129 · MusicLM: Generating Music From Text (2023)
- Autoría: Andrea Agostinelli, Timo I. Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, y otros
- Problema anterior: Los pares texto-música son escasísimos comparados con los pares texto-imagen, y la música tiene estructura a escalas que no caben en una sola ventana de contexto: el timbre se juega en milisegundos y la forma, en minutos.
- Propuesta: Una jerarquía de dos tipos de token —semánticos, a baja frecuencia, que llevan la estructura, y acústicos, a alta frecuencia, que llevan el detalle— y un entrenamiento que aprovecha audio sin etiquetar mediante una representación conjunta de texto y música.
- Hito: Genera música coherente de varios minutos desde una descripción en lenguaje natural, y publica MusicCaps para que la tarea se pueda evaluar.
- Conceptos: texto a música, tokens semánticos, jerarquía, MusicCaps, evaluación
- Clases del programa: 093
- Fuentes primarias: arXiv:2301.11325
P130 · Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers (2023)
- Autoría: Chengyi Wang, Sanyuan Chen, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, y otros
- Problema anterior: Adaptar un sintetizador a una voz nueva exigía media hora o más de grabaciones y un ajuste fino del modelo. Eso limitaba la personalización a quien tuviera estudio, y de paso actuaba como barrera práctica frente al uso indebido.
- Propuesta: Tratar los códigos de un códec neuronal como un vocabulario y la síntesis como predicción del siguiente token, con la voz objetivo entrada como aviso en contexto. Sin entrenamiento por hablante: tres segundos bastan.
- Hito: Convierte la síntesis de voz en modelado de lenguaje sobre códigos de audio, y clona una voz con tres segundos de muestra sin entrenar nada.
- Conceptos: síntesis de voz, clonación, códec neuronal, aviso en contexto, identidad vocal
- Clases del programa: 094
- Fuentes primarias: arXiv:2301.02111
P131 · A Watermark for Large Language Models (2023)
- Autoría: John Kirchenbauer, Jonas Geiping, Yuxin Wen, Jonathan Katz, Ian Miers, Tom Goldstein
- Problema anterior: Distinguir texto generado de texto humano se intentaba con clasificadores entrenados a posteriori, que fallan, envejecen con cada modelo nuevo y producen falsos positivos con consecuencias reales sobre personas.
- Propuesta: Partir el vocabulario en cada paso en una lista «verde» y otra «roja», determinadas por un hash del token anterior, y sesgar la generación hacia la verde. Un texto marcado tiene una proporción de verdes anómala, y una prueba estadística la detecta sin acceso al modelo.
- Hito: Deja una firma estadística verificable en el texto generado sesgando qué tokens se eligen, sin degradar apreciablemente la calidad ni necesitar el modelo para detectarla.
- Conceptos: marca de agua, procedencia, detección, prueba estadística, autenticidad
- Clases del programa: 098
- Fuentes primarias: arXiv:2301.10226
P132 · 3D Gaussian Splatting for Real-Time Radiance Field Rendering (2023)
- Autoría: Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, George Drettakis
- Problema anterior: NeRF produce vistas excelentes y renderiza lentísimo: cada píxel exige decenas de consultas a un perceptrón a lo largo de su rayo, y la mayoría caen en el vacío. Eso lo deja fuera de cualquier aplicación interactiva.
- Propuesta: Representar la escena como un conjunto de gaussianas 3D anisótropas con color y opacidad, optimizadas desde las vistas de entrada, y renderizarlas proyectándolas y mezclándolas por orden de profundidad con un rasterizador diseñado a medida.
- Hito: Alcanza calidad de campo de radiancia a velocidad de tiempo real cambiando la función continua por millones de primitivas explícitas que se rasterizan.
- Conceptos: renderizado en tiempo real, primitivas explícitas, rasterización, campos de radiancia, compromiso memoria-cómputo
- Clases del programa: 096
- Fuentes primarias: doi:10.1145/3592433
P14 · Toolformer: Language Models Can Teach Themselves to Use Tools (2023)
- Autoría: Timo Schick, Jane Dwivedi-Yu, Roberto Dessì, Roberta Raileanu, y otros
- Problema anterior: Enseñar a un modelo a llamar APIs requería datos anotados por humanos, caros y limitados a las herramientas anotadas.
- Propuesta: Generar llamadas candidatas, ejecutarlas y conservar solo las que reducen la pérdida de predecir el texto siguiente; reentrenar con ese corpus filtrado.
- Hito: El uso de herramientas se aprende de forma autosupervisada: el criterio de utilidad es la propia pérdida del modelo.
- Conceptos: Toolformer, tool use, autosupervisión, filtrado por pérdida, API calls
- Clases del programa: 080, 113
- Fuentes primarias: arXiv:2302.04761
P15 · Direct Preference Optimization: Your Language Model is Secretly a Reward Model (2023)
- Autoría: Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon, Christopher D. Manning, Chelsea Finn
- Problema anterior: El pipeline RLHF es frágil y caro: entrena un modelo extra, requiere muestreo on-policy y ajustar PPO es delicado.
- Propuesta: Derivar la solución óptima del objetivo RLHF con restricción KL y reescribirlo como una pérdida de clasificación binaria sobre pares de preferencias.
- Hito: Alinear un modelo con preferencias humanas sin modelo de recompensa explícito ni bucle de aprendizaje por refuerzo.
- Conceptos: DPO, preferencias, recompensa implícita, KL, alineación, pérdida de clasificación
- Clases del programa: 078
- Fuentes primarias: arXiv:2305.18290
P16 · Sistemas agentic contemporáneos (nodo de frontera, revisable) (2023)
- Autoría: Varios (nodo compuesto)
- Problema anterior: Un bucle ReAct sin memoria, sin criterio de parada ni presupuesto no sobrevive a tareas largas ni a fallos de herramienta.
- Propuesta: No hay una única propuesta: hay una familia de trabajos que añaden autocrítica, memoria episódica, currículo autónomo, orquestación multiagente y estándares de acceso a herramientas.
- Hito: El agente deja de ser un bucle y pasa a ser un sistema: memoria, reflexión, planificación, presupuesto, múltiples agentes y protocolos de interoperabilidad.
- Conceptos: agentic, reflexión, memoria, multiagente, MCP, presupuesto, criterio de parada
- Clases del programa: 117, 122, 124, 132, 164
- Fuentes primarias: Shinn et al. (2023), Reflexion · Park et al. (2023), Generative Agents · Wang et al. (2023), Voyager · Wu et al. (2023), AutoGen · Model Context Protocol (especificación)
P20 · Mamba: Linear-Time Sequence Modeling with Selective State Spaces (2023)
- Autoría: Albert Gu, Tri Dao
- Problema anterior: La atención cuesta O(n²) y su memoria crece con la secuencia; las alternativas subcuadráticas previas no alcanzaban a la atención en lenguaje.
- Propuesta: Hacer que los parámetros del espacio de estados dependan de la ENTRADA (selección), y compensar la pérdida de la convolución eficiente con un algoritmo paralelo consciente del hardware.
- Hito: El primer competidor serio del Transformer en lenguaje: tiempo lineal y estado de tamaño fijo, sin atención.
- Conceptos: SSM, selección, tiempo lineal, estado de tamaño fijo, escaneo paralelo, contexto largo
- Clases del programa: 054, 055
- Fuentes primarias: arXiv:2312.00752
P29 · Tree of Thoughts: Deliberate Problem Solving with Large Language Models (2023)
- Autoría: Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Thomas L. Griffiths, Yuan Cao, Karthik Narasimhan
- Problema anterior: Una cadena de pensamiento decide de izquierda a derecha y sin vuelta atrás: un paso localmente razonable y globalmente equivocado condena toda la solución.
- Propuesta: Tratar los pasos de razonamiento como nodos de un árbol, hacer que el modelo evalúe estados parciales y aplicar búsqueda con poda y retroceso.
- Hito: Devuelve la búsqueda clásica al razonamiento: explorar varias ramas, evaluarlas y poder retroceder.
- Conceptos: árbol de pensamientos, búsqueda, autoevaluación, poda, retroceso, deliberación
- Clases del programa: 014, 016, 115, 175
- Fuentes primarias: arXiv:2305.10601
P30 · Reflexion: Language Agents with Verbal Reinforcement Learning (2023)
- Autoría: Noah Shinn, Federico Cassano, Ashwin Gopinath, Karthik Narasimhan, Shunyu Yao
- Problema anterior: Un bucle ReAct que falla vuelve a empezar de cero y repite el mismo error, porque no conserva nada de lo aprendido en el intento anterior.
- Propuesta: Tras cada fallo, generar una reflexión verbal sobre qué salió mal y conservarla en una memoria episódica que condiciona el siguiente intento.
- Hito: El agente aprende entre intentos sin tocar un solo peso: el refuerzo ocurre en el contexto, en lenguaje natural.
- Conceptos: Reflexion, refuerzo verbal, memoria episódica, autocrítica, reintento
- Clases del programa: 122, 129
- Fuentes primarias: arXiv:2303.11366
P31 · Generative Agents: Interactive Simulacra of Human Behavior (2023)
- Autoría: Joon Sung Park, Joseph C. O'Brien, Carrie J. Cai, Meredith Ringel Morris, Percy Liang, Michael S. Bernstein
- Problema anterior: Un agente con muchas horas de historia no cabe en su ventana de contexto, y un registro cronológico recupera lo reciente y trivial en vez de lo pertinente.
- Propuesta: Un flujo de memoria con recuperación puntuada por relevancia, recencia e importancia, más un proceso de reflexión que sintetiza recuerdos en conclusiones de nivel superior.
- Hito: Resuelve la memoria de un agente que vive mucho tiempo: qué recordar, cuándo y por qué, cuando el contexto no da para todo.
- Conceptos: memoria episódica, recuperación puntuada, reflexión, planificación, simulación social
- Clases del programa: 107, 118
- Fuentes primarias: arXiv:2304.03442
P32 · Voyager: An Open-Ended Embodied Agent with Large Language Models (2023)
- Autoría: Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, Anima Anandkumar
- Problema anterior: Un agente que resuelve tareas cada vez desde cero no mejora con la experiencia, y meter todo lo aprendido en el prompt no escala.
- Propuesta: Un currículo automático que propone la siguiente tarea alcanzable, una biblioteca de habilidades ejecutables indexada por nombre, y un bucle iterativo que depura el código con la retroalimentación del entorno.
- Hito: El agente acumula habilidades reutilizables en vez de contexto: memoria procedimental que no se borra al terminar la tarea.
- Conceptos: Voyager, biblioteca de habilidades, currículo automático, memoria procedimental, agente encarnado
- Clases del programa: 133, 147
- Fuentes primarias: arXiv:2305.16291
P33 · AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation (2023)
- Autoría: Qingyun Wu, Gagan Bansal, Jieyu Zhang, Yiran Wu, y otros
- Problema anterior: Un solo agente escribe y juzga su propio trabajo, así que arrastra sus propios puntos ciegos; y no había forma estándar de componer varios agentes con humanos en el bucle.
- Propuesta: Agentes conversables y configurables —con o sin persona humana, con o sin ejecución de código— que se coordinan mediante mensajes, con patrones de conversación programables.
- Hito: El multiagente deja de ser una metáfora y pasa a ser un patrón de programación: agentes con rol que conversan hasta converger.
- Conceptos: multiagente, conversación, roles, crítico, human-in-the-loop, orquestación
- Clases del programa: 124, 127, 131
- Fuentes primarias: arXiv:2308.08155
P36 · Lost in the Middle: How Language Models Use Long Contexts (2023)
- Autoría: Nelson F. Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, Percy Liang
- Problema anterior: La industria competía por anunciar ventanas de contexto cada vez mayores, sin medir si los modelos aprovechaban de verdad todo ese espacio.
- Propuesta: Medirlo: colocar el mismo documento relevante en distintas posiciones del contexto y observar cómo cambia la exactitud.
- Hito: Tener contexto largo no es usarlo: el rendimiento cae en forma de U cuando el dato relevante está en el medio.
- Conceptos: contexto largo, curva en U, primacía, recencia, recuperación, posición
- Clases del programa: 101, 109, 110, 118
- Fuentes primarias: arXiv:2307.03172
P37 · MemGPT: Towards LLMs as Operating Systems (2023)
- Autoría: Charles Packer, Sarah Wooders, Kevin Lin, Vivian Fang, Shishir G. Patil, Ion Stoica, Joseph E. Gonzalez
- Problema anterior: La ventana de contexto es un límite duro. Ampliarla es caro y, como muestra P36, no garantiza que se use bien.
- Propuesta: Gestionar el contexto como un sistema operativo gestiona la memoria: un contexto principal pequeño, un almacén externo grande, y el propio modelo decidiendo qué paginar mediante llamadas de función.
- Hito: Aplica al contexto la idea de memoria virtual: una jerarquía que da la ilusión de memoria grande sobre una pequeña y rápida.
- Conceptos: MemGPT, memoria jerárquica, paginación, contexto virtual, llamadas de función, memoria de agente
- Clases del programa: 108, 109, 118
- Fuentes primarias: arXiv:2310.08560
P49 · QLoRA: Efficient Finetuning of Quantized LLMs (2023)
- Autoría: Tim Dettmers, Artidoro Pagnoni, Ari Holtzman, Luke Zettlemoyer
- Problema anterior: LoRA reduce los parámetros entrenables, pero el modelo base seguía teniendo que caber en memoria en precisión alta: eso dejaba fuera a casi todo el mundo.
- Propuesta: Cuantizar el modelo base congelado a 4 bits con un formato adaptado a la distribución de los pesos, y entrenar encima adaptadores LoRA en precisión alta.
- Hito: Pone el ajuste fino de un modelo muy grande al alcance de una sola GPU de consumo.
- Conceptos: QLoRA, cuantización de 4 bits, NF4, ajuste eficiente, memoria
- Clases del programa: 077, 082, 085
- Fuentes primarias: arXiv:2305.14314
P51 · SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (2023)
- Autoría: Carlos E. Jimenez, John Yang, Alexander Wettig, y otros
- Problema anterior: Los benchmarks de programación usaban problemas de juguete autocontenidos y se saturaban rápido; no medían nada parecido al trabajo real de mantener un repositorio.
- Propuesta: Construir el conjunto a partir de incidencias y parches reales de proyectos populares, y evaluar con un criterio objetivo: aplicar el parche generado y ejecutar los tests del propio repositorio.
- Hito: Cambia el criterio de evaluación: no si el código parece bien, sino si los tests del repositorio real pasan.
- Conceptos: SWE-bench, evaluación, tests como criterio, agentes de programación, contaminación
- Clases del programa: 122, 160, 178
- Fuentes primarias: arXiv:2310.06770
P52 · Towards Monosemanticity: Decomposing Language Models With Dictionary Learning (2023)
- Autoría: Trenton Bricken, Adly Templeton, Joshua Batson, y otros (Anthropic)
- Problema anterior: Al inspeccionar neuronas individuales de un modelo se encuentra que responden a conceptos no relacionados entre sí. La interpretabilidad neurona a neurona no funcionaba, y no se sabía por qué.
- Propuesta: La hipótesis de superposición: el modelo representa MÁS características que dimensiones tiene, como direcciones casi ortogonales con interferencia. Y un autoencoder disperso puede recuperar esas direcciones.
- Hito: Explica por qué una neurona no significa una cosa, y propone una forma de descomponer las activaciones en características interpretables.
- Conceptos: superposición, monosemanticidad, autoencoder disperso, interpretabilidad mecanicista, características
- Clases del programa: 160, 162, 167
- Fuentes primarias: Transformer Circuits Thread (2023)
P105 · SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents (2024)
- Autoría: Kanzhi Cheng, Qiushi Sun, Yougang Chu, Fangzhi Xu, Yantao Li, y otros
- Problema anterior: Los agentes de interfaz dependían del árbol de accesibilidad o del HTML: texto estructurado que muchas aplicaciones no exponen, y que no cubre los elementos que solo son un icono. Sin ese texto, el agente no puede ni referirse al botón.
- Propuesta: Trabajar directamente sobre la captura de pantalla y entrenar específicamente el anclaje: dada una instrucción en lenguaje natural, devolver las coordenadas del elemento. Con un banco de pruebas propio para medir esa capacidad por separado.
- Hito: Aísla el anclaje —de una instrucción a unas coordenadas— como la capacidad que separa describir una pantalla de poder operarla.
- Conceptos: anclaje en interfaz, computer use, visión, coordenadas, agentes de GUI
- Clases del programa: 144
- Fuentes primarias: arXiv:2401.10935
P106 · OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments (2024)
- Autoría: Tianbao Xie, Danyang Zhang, Jixuan Chen, Xiaochuan Li, Siheng Zhao, y otros
- Problema anterior: Los bancos de pruebas de agentes se limitaban al navegador o a entornos de juguete. El trabajo de oficina real cruza aplicaciones —hoja de cálculo, ficheros, terminal, navegador— y ahí no había forma comparable de medir nada.
- Propuesta: Un entorno de escritorio completo en máquina virtual con estado reiniciable, cientos de tareas reales recogidas de usuarios, y para cada una un script de verificación que inspecciona el estado final del sistema: una celda, un fichero, un código de salida.
- Hito: Lleva la evaluación de agentes al escritorio completo, con tareas que cruzan aplicaciones y un verificador por tarea que inspecciona el sistema real.
- Conceptos: agentes de escritorio, RPA agéntica, verificación por ejecución, multiaplicación, evaluación
- Clases del programa: 146
- Fuentes primarias: arXiv:2404.07972
P133 · AI models collapse when trained on recursively generated data (2024)
- Autoría: Ilia Shumailov, Zakhar Shumaylov, Yiren Zhao, Nicolas Papernot, Ross Anderson, Yarin Gal
- Problema anterior: La web se está llenando de texto e imágenes generadas. Los corpus futuros se recogerán de ahí, y nadie sabía qué le ocurre a un modelo entrenado sobre lo que generó la generación anterior.
- Propuesta: Formalizar y medir el fenómeno en modelos de lenguaje, autocodificadores variacionales y mezclas de gaussianas: el error de muestreo acumulado basta para que las colas desaparezcan primero y la distribución converja a algo degenerado.
- Hito: Demuestra que entrenar generación tras generación con datos sintéticos estrecha la distribución de forma irreversible, sin que ningún modelo cometa error alguno.
- Conceptos: datos sintéticos, colapso, contaminación de corpus, error de muestreo, procedencia
- Clases del programa: 097
- Fuentes primarias: doi:10.1038/s41586-024-07566-y
P21 · Mixtral of Experts (2024)
- Autoría: Albert Q. Jiang, y otros (Mistral AI)
- Problema anterior: En un modelo denso, cada token paga TODOS los parámetros. Crecer en capacidad implica crecer en coste de inferencia en la misma proporción.
- Propuesta: Sustituir la capa feed-forward por 8 expertos con un router que elige 2 por token, y publicar pesos y resultados bajo licencia abierta.
- Hito: Desacopla capacidad de cómputo: 47 000 millones de parámetros totales, 13 000 millones activos por token.
- Conceptos: mezcla de expertos, router, top-2, parámetros activos, balanceo de carga, Apache 2.0
- Clases del programa: 082, 084, 086, 125
- Fuentes primarias: arXiv:2401.04088
P22 · DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (2025)
- Autoría: DeepSeek-AI
- Problema anterior: La cadena de pensamiento dependía de demostraciones humanas caras, y esa supervisión limitaba la capacidad en problemas complejos.
- Propuesta: Recompensar únicamente el RESULTADO verificable y dejar que el comportamiento de razonamiento emerja del refuerzo, para luego transferirlo a modelos menores.
- Hito: El razonamiento se incentiva con refuerzo puro, sin trazas humanas anotadas; y es el primer LLM de pesos abiertos publicado tras revisión por pares.
- Conceptos: razonamiento, refuerzo, recompensa verificable, cómputo en inferencia, destilación, pesos abiertos
- Clases del programa: 078, 114, 175
- Fuentes primarias: arXiv:2501.12948 · DOI (Nature 645, 633–638, 2025)
Miniaturas del Transformer
El tratamiento especial de Attention Is All You Need se reparte en ocho notebooks:
| Miniatura | Foco |
|---|---|
| T01 — Por qué había que quitar la recurrencia | el problema que motiva el paper |
| T02 — Q, K, V y el producto escalar escalado | la ecuación 1 del paper |
| T03 — Softmax, escala y saturación | por qué √d_k no es cosmética |
| T04 — Self-attention y máscara causal | atender a la propia secuencia, y no atender al futuro |
| T05 — Multi-head attention | varias relaciones a la vez, sin coste extra |
| T06 — Codificación posicional | la atención es permutación-equivariante y eso es un problema |
| T07 — Residual, layer norm y feed-forward | el andamiaje sin el que la atención no entrena |
| T08 — Encoder, decoder, complejidad y qué NO dice el título | el modelo completo y su lectura honesta |