Similitud cosenoCosine Similarity

Una regla que mide cuánto apuntan dos direcciones al mismo lado

Puntos clave
  • La similitud coseno es una regla que mide cuánto apuntan dos direcciones hacia el mismo lado.
  • No mira qué tan lejos está algo. Deja fuera la longitud y solo mira el ángulo.
  • La longitud se descarta para que el texto más largo o la palabra más repetida no gane siempre solo por eso.
  • Cuanto más miran al mismo lado, más se acerca el valor a 1; si no tienen relación, ronda el 0; si son opuestas, sale un número negativo.
  • Un valor alto no significa que el sentido sea el mismo: incluso los antónimos que se usan en contextos parecidos salen muy cercanos.
Contenido

1La analogía

Dos personas se paran en una bifurcación y sacan cada una su brújula para fijar el rumbo. Una mira al noreste y camina cien pasos; la otra mira al mismo noreste y camina solo diez. Si preguntas si van hacia el mismo lado, la respuesta es sí. El número de pasos no tiene nada que ver con esa pregunta.

Al revés, si una mira al noreste y la otra al sur, aunque las dos caminen cien pasos, no van hacia el mismo lado. Lo que decide la respuesta es hacia dónde miran, no cuánto avanzaron.

Si las agujas se superponen del todo, son lo más parecido posible; si quedan en ángulo recto, no tienen relación entre sí; si apuntan en sentidos opuestos, son lo contrario. En esta regla no hay lugar para el número de pasos.

2En detalle

No mira los pasos, mira la dirección

El texto que maneja la IA se convierte en un conjunto largo de números que lleva el significado. Puedes pensar en este conjunto como una flecha que apunta hacia una dirección. Cuando se pregunta cuánto se parecen dos textos, se mira el ángulo que forman las dos flechas.

Como solo se mira el ángulo, la respuesta no cambia aunque dupliques la longitud de la flecha: alargarla no cambia la dirección. Por eso se dice que la similitud coseno no se deja afectar por el tamaño.

Existen otras reglas que miden la distancia. Medir la línea recta entre dos puntos también toma en cuenta la posición, así que la diferencia de longitud se cuela directamente en la respuesta. Hay una razón por la que, al trabajar con texto, se usa con más frecuencia la regla de la dirección.

Por qué se descarta la longitud

Imagina la misma historia escrita en tres líneas y en treinta líneas. Aunque el contenido sea el mismo, la flecha del texto largo queda mucho más larga. Si se mete la longitud tal cual en el cálculo, el documento largo siempre sube arriba, y los resultados de búsqueda terminan llenos solo de textos largos.

Lo mismo pasa si repites una palabra muchas veces. No conviene que un texto que repite la misma palabra veinte veces gane siempre contra uno que la escribe solo una vez.

Si solo se mira la dirección, este problema desaparece. Si un texto de tres líneas y otro de treinta contienen lo mismo, las dos flechas apuntan al mismo lado. Por eso esta regla es la que se usa por defecto en búsqueda y recomendación.

Lo que dice el valor

Cuando dos direcciones se superponen del todo, el valor es 1. Si son perpendiculares, es 0; si apuntan en sentidos opuestos, es -1. Entre documentos reales, casi siempre sale un valor en algún punto intermedio.

Hay que tener cuidado con algo: los conjuntos que producen los modelos actuales suelen agruparse hacia un mismo lado, así que dos textos sin ninguna relación pueden dar un valor bastante alto en vez de 0. Juzgar el parecido con un solo valor lleva a error.

Por eso lo correcto es usarla como una tabla de posiciones: medir mil candidatos con esta regla y quedarte con los diez primeros. Si quieres trazar una línea de corte para saber a partir de qué valor pasa un candidato, esa línea hay que comprobarla directamente con datos.

Estar cerca no es tener el mismo sentido

Si mides «bueno» y «malo», el resultado sale sorprendentemente cercano. Los dos tienen sentidos opuestos, pero se usan casi en los mismos contextos. Cuando las palabras de alrededor se parecen, la dirección también se parece.

También hay que tener cuidado con las fechas, los números y los nombres de personas. Dos fechas distintas tienen direcciones muy cercanas, así que esta regla sola no distingue un documento de marzo de uno de septiembre.

Las frases negativas caen en la misma trampa. «Se puede reembolsar» y «no se puede reembolsar» quedan con direcciones cercanas. Esta regla solo dice si dos textos tratan el mismo tema, no si dicen lo mismo.

Dónde se usa

El lugar donde más se usa es la búsqueda. Se convierte una pregunta en una flecha, se compara con las flechas de los documentos guardados y se ordenan de más cercano a más lejano. El orden que entrega una búsqueda por significado suele ser el resultado de medir con esta regla.

En las recomendaciones funciona el mismo mecanismo: se reúne la dirección de lo que has visto durante más tiempo y se muestra lo que queda cerca de ella. También sirve para detectar, entre un montón de documentos, contenido casi idéntico que se subió dos veces.

Cuando hay millones de flechas para comparar, medirlas una por una se vuelve difícil. Por eso se combina con métodos que agrupan de antemano las direcciones parecidas, reducen los candidatos y solo miden con precisión dentro de ese grupo reducido.

3Con más precisión

La similitud coseno es el valor del coseno del ángulo que forman dos vectores. Con 0 grados da 1, con 90 grados da 0 y con 180 grados da -1. Entre vectores con la longitud ajustada a 1, el orden que da este valor y el que da la distancia en línea recta no se invierten entre sí, así que los sistemas de búsqueda reales a veces eligen el cálculo que resulte más rápido.

Aquí la analogía cojea. La dirección de una brújula es un ángulo sobre un plano, pero la flecha de un texto vive en un espacio de cientos o miles de direcciones. En ese espacio, dos direcciones elegidas al azar casi siempre resultan casi perpendiculares, así que se comporta de un modo distinto a nuestra intuición. Además, el norte de la brújula es el mismo para todos, pero el espacio de las flechas no tiene una dirección de referencia: el valor solo tiene sentido entre dos flechas concretas. Cambiar de modelo cambia el espacio entero, así que tampoco se puede comparar un valor antiguo con uno nuevo. Por eso conviene ver esta regla no como una balanza que dice cuánto se parece algo, sino como una herramienta para ordenar candidatos.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que un valor alto significa el mismo sentido, pero en realidad hasta los antónimos que se usan en contextos parecidos dan un valor muy alto.

  • Es fácil pensar que un puntaje de 0,8 ya es suficientemente parecido, pero en realidad el criterio de un buen valor cambia según el modelo y los datos, así que solo debería usarse como orden.

  • Es fácil pensar que es una regla para medir qué tan separados están dos textos, pero en realidad deja fuera la distancia y solo mira la dirección.

7Resumen en una línea

En resumenLa similitud coseno es una regla que solo mide cuánto apuntan dos flechas hacia el mismo lado: no se deja afectar por la longitud, pero a cambio dice que hasta los antónimos están cerca.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02