FeedforwardFeed-Forward

La estructura donde la señal fluye solo hacia adelante

Puntos clave
  • Feedforward es la estructura donde la señal fluye solo del input hacia el output. No hay camino de regreso.
  • El resultado de una capa pasa únicamente a la siguiente. Un lugar por el que ya se pasó no se vuelve a pisar.
  • Al no haber un canal donde guardar lo anterior, recordar el orden queda en manos de otro mecanismo.
  • Dentro de un bloque de Transformer también hay una capa feedforward. Más de la mitad de los números del modelo se concentra ahí.
  • Al entrenar, el error sí vuelve de atrás hacia adelante, pero eso es solo el sentido del cálculo: la estructura sigue fluyendo en un único sentido.
Contenido

1La analogía

En la fila de un comedor escolar, uno avanza con la bandeja solo hacia adelante. Del puesto del pan al de la sopa, de la sopa al plato principal, del plato al postre. Si el plato no te convence, no puedes volver al puesto del pan. La fila fluye en un único sentido.

Cada puesto tiene su trabajo fijo. El de la sopa solo sirve sopa, y usa su propio cucharón sin importar lo que hayas recibido antes. Cuando la bandeja pasa el último puesto, la comida está completa.

Una red feedforward está armada así. Un bloque de números atraviesa las capas —los puestos— en orden, y cada capa añade su parte del cálculo. Al pasar la última capa, sale la respuesta.

2En detalle

Lo que significa que no haya camino de vuelta

Si sigues las flechas en el dibujo de una red neuronal, aparecen dos tipos. Unas van siempre hacia adelante; otras vuelven hacia sí mismas o hacia atrás. Feedforward es la estructura que solo tiene el primer tipo.

Sin caminos de vuelta, el orden del cálculo se vuelve simple. Basta con recorrer de la primera capa a la última una sola vez para obtener la respuesta, y la misma entrada siempre se calcula en el mismo orden. No hace falta guardar ningún valor para usarlo en el turno siguiente.

Esta simplicidad se traduce en velocidad. Sin caminos de regreso, el cálculo dentro de una capa se puede repartir en piezas pequeñas y procesar todas a la vez, así que se aprovecha al máximo el equipo hecho para mover miles de cálculos en paralelo.

En qué se diferencia de una estructura que recuerda

Para procesar texto hace falta retener lo que se dijo antes. Las estructuras con caminos de vuelta resuelven esto mediante un ciclo: el resultado de procesar una palabra se vuelve a meter en sí misma, así que al ver la siguiente palabra también se tiene en cuenta el rastro de la anterior.

Pero eso obliga a respetar el orden: la palabra anterior tiene que terminar antes de poder empezar la siguiente. Si la frase se alarga, el tiempo de espera crece con ella, y el rastro de lo anterior se va desdibujando cuanto más se aleja.

Feedforward es lo contrario. Al no tener un canal donde guardar cosas, puede calcular todas las posiciones a la vez. Los modelos de lenguaje actuales le encargan a la atención la tarea de mirar la relación entre posiciones, y el resto del cálculo lo hace feedforward: así se reparten las ventajas de los dos enfoques.

Se ensancha y luego se vuelve a angostar

La capa feedforward dentro de un bloque de Transformer tiene una forma particular. Toma el bloque de números que entra, lo infla mucho de golpe y luego lo vuelve a doblar a su ancho original. Suele ensancharse unas cuatro veces antes de volver a angostarse.

La razón de ensanchar es dar espacio de sobra. Rasgos que estaban enredados en un espacio angosto se despliegan por separado en un espacio ancho. En ese estado, se apaga la señal que no hace falta y solo se recoge lo que queda para volver a doblarlo.

En este proceso de inflar y doblar se concentra una parte enorme de los números del modelo. Si la atención es la que reúne el material, feedforward es quien lo convierte en un juicio real. Muchas investigaciones sostienen que aquí se guarda buena parte del conocimiento aprendido durante el entrenamiento.

Cada posición por su cuenta, con la misma regla

La capa feedforward de un Transformer se aplica por separado a cada trozo del texto. El primer trozo y el décimo no se miran entre sí: cada uno se calcula con la misma regla, cada uno por su lado.

Por eso, sin importar cuántos trozos haya, el cálculo se puede hacer todo de una vez, sin esperar al trozo vecino. El intercambio de información entre trozos ya quedó resuelto en el paso anterior.

En la atención, los trozos conversan entre sí; en feedforward, cada uno ordena sus propias ideas; y en la siguiente capa, vuelven a conversar. Esta alternancia entre los dos pasos es el esqueleto básico de los modelos de hoy.

3Con más precisión

Una red feedforward es cualquier red neuronal sin conexiones circulares. El perceptrón multicapa es el ejemplo más simple, y las redes convolucionales que procesan imágenes también entran en esta categoría, porque tampoco tienen ciclos. La capa feedforward dentro de un bloque de Transformer usa esta misma estructura por partida doble, con una función de activación que anula los negativos entre el ensanche y el angostamiento.

La analogía también tiene sus costuras. El puesto del comedor solo pone comida sobre la bandeja, pero la capa de una red convierte por completo el bloque de números que recibe en uno nuevo: el valor de la capa anterior no queda intacto. Además, el cucharón de un puesto siempre es el mismo, pero la regla de cálculo de una capa va cambiando poco a poco durante el entrenamiento, y solo queda fija al terminar. Que la fila sea una sola también difiere: en los modelos reales hay un atajo en paralelo que lleva el valor original sin tocarlo, saltándose capas, de modo que el resultado de la capa se suma a ese valor en vez de reemplazarlo por completo.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que feedforward es el nombre de una capa específica dentro del Transformer, pero en realidad es un término que abarca toda estructura sin conexiones de vuelta.

  • Es fácil confundirse pensando que usar retropropagación contradice ser feedforward, pero en realidad devolver el error es un cálculo del entrenamiento, y la estructura por la que fluye la señal sigue siendo de un único sentido.

  • Es fácil pensar que es una capa simple y poco relevante, pero en realidad más de la mitad de los números del modelo se concentra en esta capa.

7Resumen en una línea

En resumenFeedforward es la estructura donde la señal fluye solo hacia adelante, y dentro del Transformer es la capa que convierte en juicio, en cada posición, el material que reunió la atención.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02