Word2Vec
Aprende el significado por los vecinos y da coordenadas a las palabras
- Word2Vec es un método que convierte cada palabra en una coordenada numérica.
- Nadie le explica el significado a mano: aprende solo mirando con qué vecinos aparece.
- Las palabras que comparten vecinos parecidos terminan con coordenadas cercanas.
- A veces la dirección entre coordenadas guarda una relación: la dirección de un país a su capital se repite de forma parecida en otros países.
- Como cada palabra tiene una sola coordenada, las palabras con varios sentidos quedan mezcladas. Los modelos actuales corrigieron este punto.
Contenido
1La analogía
Al ver una transmisión de béisbol, aunque no sepas el nombre de un jugador, puedes intuir su papel por la posición que ocupa: el que batea entre el uno y el tres hace un trabajo distinto al que sigue al cuatro. Si apilas las alineaciones de muchos partidos, saltan a la vista los jugadores que casi siempre tienen los mismos vecinos delante y detrás. Intercambiar entre sí a esos jugadores no hace que la alineación se vea muy rara.
Así es como Word2Vec aprende las palabras. En vez de sacar el significado de un diccionario, reúne una cantidad enorme de datos sobre con qué vecinos aparece cada palabra en las frases. Las palabras que comparten un entorno parecido se pueden intercambiar sin que la frase suene muy extraña, y esas palabras terminan en posiciones cercanas.
Aquí la posición es, literalmente, una coordenada. A cada palabra se le asigna un conjunto de números, y esos números determinan su lugar.
2En detalle
Aprende por los vecinos, no por definiciones
El método de entrenamiento es asombrosamente simple. Se tapa una palabra de la frase y se intenta adivinar qué palabras había unas cuantas posiciones antes y después. También existe la versión contraria: dar los vecinos y adivinar la palabra del medio. Si acierta, la coordenada se queda como está; si falla, se mueve un poco.
Repetir esto en cientos de millones de frases hace que las palabras que aparecían en posiciones parecidas se agrupen por sí solas. «Café» y «té» se acercan porque comparten vecinos como beber, taza o caliente, mientras que «café» y «tornillo» casi nunca coinciden y terminan lejos.
Nadie definió el significado en ningún momento. Solo con el registro de qué aparece junto a qué se construye algo cercano al significado. Esta idea existía en la lingüística desde hacía tiempo, y Word2Vec abrió un camino para lograrlo con un cálculo barato.
Las palabras se vuelven coordenadas numéricas
Cuando termina el entrenamiento, a cada palabra le queda un conjunto de números, normalmente entre decenas y cientos. Esos números señalan la posición de un punto dentro de un espacio muy amplio.
Solo podemos ver dos o tres direcciones, pero el espacio real se extiende en muchas más. Una dirección puede recoger algo relacionado con la cocina, y otra puede separar lo duro de lo blando. Eso sí, nadie decidió qué significa cada dirección, así que no se le puede poner nombre.
Una vez convertidas así, se puede medir con la distancia cuánto se parecen dos palabras. De aquí nace la posibilidad de encontrar documentos que usan otras palabras en una búsqueda, o de agrupar artículos parecidos en una recomendación.
La dirección entre coordenadas guarda relaciones
Word2Vec se hizo famoso porque la forma en que quedaban las coordenadas resultó sorprendentemente regular. La dirección que va de un país a su capital era casi la misma en otros países. Se veían regularidades parecidas entre el singular y el plural de una palabra, o entre el infinitivo y el pasado.
Por eso, con solo sumar y restar coordenadas se puede trasladar una relación. Si tomas la dirección que va de un país a su capital y la aplicas a otro país, llegas cerca de la capital de ese otro país.
Esta regularidad no siempre se cumple. Hay relaciones que funcionan bien y otras que terminan en un lugar equivocado. Aun así, que esta estructura apareciera sin que nadie metiera la regla a mano fue una sorpresa enorme en su momento.
El límite de una sola coordenada por palabra
La mayor debilidad de Word2Vec es que cada palabra tiene una sola coordenada. El «banco» del parque y el «banco» de la esquina terminan compartiendo el mismo lugar: quedan en una posición intermedia que mezcla los dos sentidos, y no encaja del todo en ninguna de las dos frases.
Tampoco recoge casi nada del orden dentro de la frase: solo mira qué palabras había dentro de la ventana, sin fijarse mucho en si iban antes o después. También arrastra tal cual los sesgos de los datos de entrenamiento; un ejemplo típico es que se forme una dirección que une una profesión con un género.
Los modelos de lenguaje actuales superaron esta limitación: en vez de dar una posición fija a cada palabra, hacen que la misma palabra tenga coordenadas distintas según la frase. Word2Vec está en el punto de partida de todo esto, y de aquí se difundió la idea misma de tratar las palabras como números.
3Con más precisión
Word2Vec es un método de entrenamiento publicado alrededor de 2013, con dos variantes: adivinar los vecinos a partir de la palabra central, y adivinar la palabra central a partir de los vecinos. Usa una red neuronal muy poco profunda, de una sola capa, y cuando termina el entrenamiento no se usa la red en sí, sino el conjunto de números por palabra que quedó formado dentro de ella.
Aquí la analogía cojea. Una alineación de béisbol solo tiene nueve puestos y el entrenador la arma con una intención; las coordenadas de las palabras están en un espacio de cientos de direcciones y nadie les asigna un lugar. Además, los vecinos de una alineación siguen un orden fijo, mientras que los vecinos que mira Word2Vec solo necesitan estar dentro de unas cuantas posiciones alrededor, sin importar casi el orden. «Estar cerca» también significa algo distinto de la distancia que conocemos: en la práctica se suele medir cuánto se parecen las direcciones que salen del origen. Y como cambiar el texto de entrenamiento cambia por completo las posiciones, tampoco se pueden mezclar coordenadas creadas en dos entrenamientos distintos.
4Pruébalo
- wevi (observador del entrenamiento de embeddings de palabras) ailearn.space Escribe unas frases cortas, pulsa el botón de entrenar y mira en vivo cómo las palabras van tomando su lugar
- Embedding Projector (explorar un espacio de embeddings) ailearn.space Busca una palabra y gira la vista en 3D para ver qué palabras se agrupan a su alrededor
5Malentendidos comunes
Es fácil pensar que Word2Vec conoce el significado de una palabra, pero en realidad solo fija una posición reuniendo estadísticas de los vecinos con los que apareció.
Es fácil pensar que estar cerca significa tener un significado parecido, pero en realidad los antónimos suelen compartir vecinos parecidos y también terminan cerca.
Es fácil pensar que los chatbots actuales tratan las palabras de esta misma manera, pero en realidad cambiaron a un método donde la misma palabra recibe coordenadas distintas según la frase.
7Resumen en una línea
En resumenWord2Vec es un método que aprende las palabras por sus vecinos y las sienta en una coordenada, y es el punto de partida de la forma actual de tratar las palabras como números.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02