Inicio · Parte 15 — Matemática de Deep Learning
similitud coseno = (a·b) / (‖a‖·‖b‖)
analogía: rey − hombre + mujer ≈ reina
la magnitud no importa, solo la dirección
Un embedding representa cada elemento discreto —palabra, usuario, producto— como un vector denso de dimensión moderada, aprendido de forma que la proximidad geométrica refleje similitud semántica. Es la alternativa a la codificación one-hot, que es enorme, dispersa y en la que todos los elementos están a la misma distancia entre sí.
La medida de similitud habitual es el coseno, no la distancia euclídea. La razón es que la magnitud de un embedding suele correlacionar con la frecuencia del término, que no es información semántica; el coseno la descarta y mide solo la dirección. Es el producto escalar normalizado de la parte 05.
El resultado que hizo famosos a los embeddings es que ciertas direcciones codifican relaciones. El vector que va de «hombre» a «mujer» es aproximadamente el mismo que va de «rey» a «reina», lo que permite resolver analogías con aritmética vectorial. Conviene matizar: el efecto es real pero se exageró bastante en la divulgación, y depende mucho del corpus y del método de evaluación.
Hay una consecuencia ética que no es opcional mencionar. Los embeddings aprenden los sesgos presentes en los datos, y las mismas analogías que capturan «rey es a reina» capturan asociaciones estereotipadas entre profesiones y género. Como el modelo aprende la distribución del corpus, esos sesgos se propagan a cualquier sistema construido encima, y detectarlos requiere auditar explícitamente.
Similitudes y analogía en un espacio de 4 dimensiones.
vocabulario: 5 términos, dimensión 4
similitudes con "rey":
hombre 0,857916
mujer 0,815207
reina 0,768974
mesa 0,3xxxxx
analogía: rey − hombre + mujer
vector resultante: [0,85 ; 0,1 ; 0,1 ; 0,05]
ranking por similitud:
reina 1,000000 ← la analogía funciona ✓
mujer 0,835523
rey 0,768974
Nota: en este espacio pequeño "hombre" es más similar
a "rey" que "reina", lo que muestra que la similitud
directa y la analogía capturan cosas distintas.
Embeddings: geometría del significado y similitud coseno.
python classes/part-15-matematica-de-deep-learning/317-embeddings-como-espacios-vectoriales/lab.py
compmath run 317
dimensionvocabulariosimilitudes_con_'rey'mas_similar_a_reyanalogia_rey-hombre+mujerranking_de_la_analogiaone_hot_necesitariaembedding_denso_usapor_que_coseno_y_no_distancia{
"dimension": 4,
"vocabulario": 5,
"similitudes_con_'rey'": {
"reina": 0.768974,
"hombre": 0.857916,
"mujer": 0.815207,
"mesa": 0.383823
},
"mas_similar_a_rey": "hombre",
"analogia_rey-hombre+mujer": [
0.85,
0.1,
0.1,
0.05
],
"ranking_de_la_analogia": [
[
1.0,
"reina"
],
[
0.835523,
"mujer"
],
[
0.768974,
"rey"
]
]
}
Representación de vocabularios, sistemas de recomendación, búsqueda semántica, bases de datos vectoriales y capa de entrada de todo modelo de lenguaje.
Toda arquitectura moderna, incluido el Transformer, se construye sobre estos bloques y sobre este mismo mecanismo de derivación.
10.48550/arxiv.1301.3781 verificado en DataCite (2026-08-19).10.48550/arxiv.1607.06520 verificado en DataCite (2026-08-19).