AtenciónAttention
Cómo decidir cuánto peso darle a cada entrada
- La atención es la forma de decidir, entre varias entradas, a cuál y cuánto peso darle, y mezclarlas en esa proporción.
- El peso no es un valor fijo. Se recalcula cada vez, según lo que se esté procesando en ese momento.
- Los pesos suman siempre 1. Si uno sube mucho, los demás bajan automáticamente.
- Llega de un salto hasta palabras lejanas. Elimina la debilidad del método anterior, que se iba desdibujando al pasar la información en cadena.
- Cuantas más cosas hay que mirar, el número de pares a comparar crece al cuadrado. Por eso el costo se dispara con textos largos.
Contenido
1La analogía
En la cabina de control de una radio entran varios micrófonos a la vez: la voz del presentador, el público, la música de fondo. El técnico no los saca todos al aire con el mismo volumen. Cuando habla el presentador, sube su fader y baja el resto. Cuando el público se ríe, sube un momento ese canal. Eso es lo que hace la atención: ese movimiento de manos.
Lo que sale al aire es un único sonido, pero por dentro lleva varios micrófonos mezclados en proporciones distintas. No se elige uno solo: se decide una proporción y se mezclan todos según ella.
La proporción cambia a cada instante. Que el presentador sonara fuerte hace un momento no significa que siga fuerte ahora. Los mandos se mueven de nuevo según lo que importe en ese momento.
2En detalle
Cómo se sabe qué fader subir
El técnico decide mirando el guion. La atención decide con tres piezas de información. La posición que se está procesando lanza una condición del tipo "esto es lo que busco", y las demás posiciones responden con una etiqueta del tipo "esto es lo que tengo". Cuanto mejor encajan las dos, más sube el fader de esa posición.
Y lo que realmente se mezcla es otra cosa aparte. La etiqueta solo sirve para juzgar si encaja con lo que se busca; lo que de verdad sale por la posición con el fader arriba es el contenido que esa posición guarda. Es como en una biblioteca: comparas el término de búsqueda con el título del libro, pero lo que lees después es el contenido.
Las tres piezas salen del mismo original, cada una extraída de forma distinta. Cómo se extraen se decidió durante el entrenamiento; no hay ninguna regla escrita a mano.
Los pesos siempre suman 1
Las puntuaciones calculadas no se usan tal cual. Se reordenan una vez para que la suma dé 1. Así se puede leer como "cuarenta por ciento aquí, veinticinco por ciento allá".
Esta regla crea competencia. Si una posición recibe mucho peso, las demás bajan solas. Es como no poder subir todos los faders al máximo a la vez. Por eso el modelo elige, en cada instante, qué deja de lado y qué mira.
A veces el peso se concentra en un solo punto y otras veces se reparte de forma pareja. Concentrado significa que esa posición es decisiva; repartido significa que se consulta el ambiente general.
Llega de golpe aunque esté lejos
El método anterior procesaba la frase palabra por palabra, en orden. Lo que aparecía al principio tenía que pasar por todos los pasos intermedios para llegar al final, y la información se desdibujaba en el camino. De ahí venía el problema de perder el sujeto en frases largas.
La atención eliminó esa estructura. Desde la posición actual se puede mirar directamente cualquier posición anterior, así que una palabra dicha veinte posiciones antes queda a la misma distancia que la de al lado. Es como en la cabina de control: cualquier micrófono queda a un brazo de distancia. Poder sostener un nombre o una condición hasta el final de un texto largo es el mayor logro de la atención.
Cuantas más entradas hay, más grande se hace la mesa de mezclas
La comodidad tiene un precio. Que cada posición mire a todas las demás significa que, si las posiciones se duplican, los pares a comparar se cuadruplican. Con diez micrófonos la mesa aguanta; con diez mil, la cosa cambia.
Ahí está la razón de que el costo y el tiempo suban de golpe con documentos largos. Por eso siguen apareciendo métodos que solo miran las posiciones cercanas, que solo miran unas pocas posiciones representativas, o que cambian el orden del cálculo para ahorrar memoria.
Mirar la tabla de pesos
Qué palabra le dio peso a cuál queda registrado en números. Por eso se considera una de las pocas ventanas para asomarse a lo que el modelo tuvo en cuenta al decidir. A veces esa tabla realmente muestra a qué nombre apunta un pronombre, o cómo se conectan las partes de la frase.
Pero conviene no leer esa tabla directamente como "el modelo se basó en esto". Que un peso sea alto no permite afirmar que fue la razón de la decisión. Sirve como referencia, pero es un dato débil como prueba.
3Con más precisión
La atención se calcula con tres conjuntos de vectores: consulta, clave y valor. Se mide el parecido entre la consulta y cada clave, se reduce una vez ese valor según el tamaño del vector, y pasa por un softmax que lo convierte en pesos que suman 1. El resultado es el promedio ponderado de los valores con esos pesos. El cálculo y la memoria crecen en proporción al cuadrado de la longitud de la entrada.
Al escribir texto de forma continua, se tapa lo que viene después, para que no se pueda espiar una palabra que todavía no ha aparecido: eso equivaldría a copiar la respuesta. Ese tapado solo hace falta al generar; en tareas donde se lee la frase entera de una vez, como clasificarla, no se aplica.
La analogía también tiene sus costuras. En la cabina hay un técnico que decide, pero en la atención no hay nadie que determine qué es importante: los pesos salen solos de multiplicar y sumar números ajustados durante el entrenamiento. Y el técnico escucha el sonido de verdad y juzga por oído, mientras que la atención no entiende el significado: solo calcula cuánto se parecen los vectores entre sí.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que la atención escoge una sola cosa importante, pero en realidad reparte peso entre todas y las mezcla en esa proporción.
Es fácil pensar que el lugar con más peso es la razón de la decisión, pero en realidad es solo una pista de referencia, no una explicación completa.
Es fácil pensar que la atención eliminó el límite de longitud, pero en realidad, al comparar todos los pares, el costo crece al cuadrado cuando el texto se alarga.
7Resumen en una línea
En resumenLa atención es como los faders de una cabina de control: decide de nuevo, en cada instante, a qué darle peso y cuánto, y mezcla según esa proporción antes de pasar al siguiente paso.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02