RNNRecurrent Neural Network
Red que procesa palabra a palabra retomando el resumen anterior
- Una RNN (Recurrent Neural Network, red neuronal recurrente) recibe datos con orden, como texto o sonido, palabra por palabra, en fila.
- Parece que hay muchas casillas seguidas, pero en realidad es la misma casilla usada una y otra vez.
- Lo que pasa de una casilla a otra es un resumen corto de lo escuchado hasta ese momento. No carga el texto original.
- Por eso, cuanto más larga es la frase, más se difumina lo que se oyó al principio. Es la mayor debilidad de la RNN.
- Solo puede avanzar en orden, así que no puede procesar varias palabras a la vez. Por eso el transformer le tomó el relevo.
Contenido
1La analogía
Estás en un campamento jugando al teléfono descompuesto, pero con una regla distinta. Quien dirige el juego lee una frase cortándola en trozos. La primera persona solo oye "hoy", la reduce a un resumen corto y se lo susurra a la siguiente. La segunda persona junta ese resumen que le llegó con lo nuevo que oyó, "llovió", y vuelve a resumir antes de pasarlo. La tercera oye "mucho" y la cuarta oye "aquí": cada una hace exactamente lo mismo.
Solo se puede pasar un resumen corto. Tampoco se puede anotar en papel. Así que, cuanto más larga es la frase, más se va difuminando ese "hoy" que se oyó al principio, a medida que pasa por más personas. En lo que dice la última persona, solo queda claro lo que se escuchó hace poco.
2En detalle
Recibe una palabra a la vez
Una red neuronal normal recibe los datos de golpe, en un bloque completo. Metes una foto entera o una fila de una tabla, con un tamaño fijo, y sale una respuesta. Pero las frases no tienen ese tamaño fijo: las hay de tres palabras y las hay de trescientas.
La RNN resuelve esto con el orden. Corta la frase palabra por palabra y las va metiendo de una en una. Con cada palabra, el cálculo se ejecuta una vez; con la siguiente, se ejecuta otra vez. Así, sin importar cuánto cambie la longitud, se puede procesar del mismo modo.
Lo que pasa es solo un resumen de lo visto hasta ahora
La casilla recibe dos cosas cada vez: la palabra nueva que entra y el resumen que llegó del paso anterior. Junta las dos, calcula, y produce un resumen nuevo que pasa al siguiente paso.
Este resumen no guarda el texto original. Es un grupo de números de tamaño fijo desde el principio, así que da igual si escuchó cien palabras o tres: la cantidad que puede contener es siempre la misma. Cada palabra nueva que entra tiene que hacerse un lugar ahí dentro, y lo que suele ceder espacio es lo que se oyó antes.
Es la misma casilla, usada una y otra vez
Al dibujarlo, se ven casillas en fila, pero dentro del modelo no hay varias casillas: hay una sola, que recibe su propia salida como su propia entrada de nuevo. De ahí viene el nombre de recurrente.
Usar la misma casilla una y otra vez significa que el tamaño del cálculo es idéntico en cada paso. Los controles que se usan para la primera palabra son los mismos que se usan para la palabra cien. Gracias a esto, por muy larga que sea la frase que entra, el modelo no crece ni hay más que aprender.
Cuanto más larga, más se desdibuja el principio
Repetir el mismo cálculo también se vuelve una debilidad. El resumen se comprime un poco en cada paso, y cuando esa compresión se acumula decenas de veces, lo que entró al principio apenas queda. En sentido contrario, si el valor va creciendo poco a poco, también puede dispararse.
Al entrenar, el problema se agranda. Para corregir un error hay que devolver hacia atrás, de paso en paso, cuánto se desvió la respuesta, y esta señal también se va reduciendo cada vez que retrocede un paso. Se aprende bien lo que está cerca del final, pero casi nada de lo que aparece al principio de la frase. A este fenómeno se le llama desvanecimiento del gradiente.
Solo puede avanzar en orden, y eso la hace lenta
La RNN necesita que termine un paso para poder empezar el siguiente. Para calcular la segunda palabra, hace falta que ya exista el resumen de la primera. Así que si hay mil palabras, el cálculo también tiene que esperar en fila mil veces.
Esto encaja mal con las tarjetas gráficas actuales, hechas para lanzar muchos cálculos a la vez. En cuanto apareció una estructura capaz de procesar todas las palabras de una frase al mismo tiempo, la RNN cedió terreno rápido en el terreno del lenguaje. Aun así, sigue usándose bien en lugares donde los datos llegan en tiempo real, uno por uno, como en música o en lecturas de sensores.
3Con más precisión
La RNN es una red neuronal que procesa datos secuenciales actualizando, en cada paso, un grupo de números llamado estado oculto. En cada paso recibe la entrada nueva junto con el estado oculto anterior, los combina, los pasa por una curva, y produce un nuevo estado oculto, del que se puede extraer una salida si hace falta. Que todos los pasos compartan los mismos pesos es la diferencia más grande frente a un perceptrón multicapa.
La analogía también tiene sus costuras. En el teléfono descompuesto cada persona resume de forma distinta, según su carácter, pero en la RNN todos los pasos resumen con exactamente la misma regla. Además, una persona entiende el lenguaje por frases con sentido, pero el resumen que pasa la RNN no es una frase con significado, sino un grupo de números de tamaño fijo: aunque alguien lo abriera, no podría leer lo que dice.
Cuando hace falta mirar hacia adelante y hacia atrás a la vez, a veces se recorre la frase también de atrás hacia adelante, en un segundo paso. Aun así, esto no elimina la exigencia de procesar en orden.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que una RNN recuerda la frase entera, pero en realidad solo lleva un resumen de tamaño fijo, y lo del principio se va desdibujando conforme pasan los pasos.
Es fácil pensar que cada casilla del dibujo es una pieza distinta, pero en realidad es solo una misma casilla dibujada varias veces siguiendo el orden del tiempo.
Es fácil pensar que, con el transformer, la RNN ya no sirve para nada, pero en realidad sigue en uso en procesamiento en tiempo real, dato por dato, y en dispositivos pequeños.
7Resumen en una línea
En resumenLa RNN es una estructura donde una misma casilla retoma el resumen del paso anterior y procesa una palabra a la vez: puede manejar el orden, pero tiende a perder el principio de los textos largos.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02