RetropropagaciónBackpropagation
El procedimiento que reparte el error hacia atrás, paso a paso
- La retropropagación es el procedimiento que recorre el error de atrás hacia adelante, desde el último paso, repartiendo una parte de responsabilidad en cada etapa.
- Esa parte que reparte es justamente el gradiente de ese valor: indica hacia qué lado y cuánto hay que corregirlo.
- Primero se recorre de adelante hacia atrás para producir una respuesta, y luego se recorre de atrás hacia adelante repartiendo las partes. Ese ida y vuelta es un paso de entrenamiento.
- Se empieza por el final porque la responsabilidad de una etapa temprana solo llega al resultado pasando por las etapas siguientes.
- Con un solo recorrido hacia atrás salen las partes de todos los valores a la vez. Esa eficiencia es lo que permite entrenar modelos con muchísimas capas.
Contenido
1La analogía
Al meter un auto en un túnel de lavado automático, pasa en orden por el chorro de agua, la espuma, el enjuague y el secado, y sale por el otro lado. Pero el vidrio trasero del auto que sale tiene una mancha. Para corregirlo en el próximo auto hay que averiguar qué etapa falló.
La revisión va de atrás hacia adelante. Primero se mira si el secado se saltó justo esa zona; si no, se revisa el chorro de enjuague; si tampoco, se mira si faltó espuma. El error de una etapa temprana solo se nota como mancha después de pasar por las etapas siguientes, así que hay que conocer primero la parte de las etapas de atrás para poder calcular la de las de adelante.
Al terminar esta vuelta hacia atrás, cada etapa queda con un valor que dice "de esta mancha, a vos te toca esta parte". Ajustando cada etapa según esa parte, el próximo auto sale un poco más limpio.
2En detalle
Un recorrido de ida, uno de vuelta
Un paso de entrenamiento es un ida y vuelta. Primero se meten los datos y se los pasa por las capas en orden para producir una respuesta: es el lado de meter el auto al túnel. Se compara esa respuesta con la correcta y se mide el error.
Después viene el camino de vuelta. El error se le entrega a la última capa, y esa capa calcula cuánto contribuyeron sus propios valores al error y le pasa el resto a la capa anterior. Ese traspaso llega hasta la primera capa. Cuando los dos caminos terminan, cada valor del modelo queda con una nota que dice "corregite así, esta cantidad".
Los resultados intermedios del recorrido de ida no se descartan: hay que guardarlos, porque vuelven a hacer falta en el camino de vuelta. Esta es la primera razón por la que entrenar consume mucha más memoria que usar un modelo ya terminado.
Por qué hay que recorrer desde el final
También se podría pensar en revisar etapa por etapa desde el principio: cambiar un valor apenas un poco y medir cuánto cambia el resultado. Pero cada vez que cambia un valor hay que hacer pasar el túnel entero de nuevo. Si hay cientos de millones de valores, habría que repetir esto cientos de millones de veces.
Recorrer hacia atrás elimina ese desperdicio. Si ya se conoce la parte de una etapa de atrás, la parte de la etapa anterior sale con apenas unas pocas multiplicaciones. Con un solo recorrido de atrás hacia adelante se obtienen a la vez las partes de todos los valores. Gracias a este orden, el tiempo de entrenamiento se mantiene manejable sin importar cuántas capas se apilen.
Después de repartir la parte, se mueven los valores
La retropropagación termina en el reparto de las partes. Mover los valores según esas partes es tarea del descenso de gradiente. Cuánto se mueve lo decide la tasa de aprendizaje, y con qué estilo se mueve, el optimizador. Los roles quedan así divididos.
Las partes se recalculan cada vez que se ve un nuevo lote de datos. Con el mismo valor, un lote puede pedir subirlo y el siguiente, bajarlo. Por eso se usa un método que no reacciona de golpe a una sola parte, sino que se mueve un poco cada vez.
Cuanto más se recorre hacia atrás, más se difumina la parte
El recorrido hacia atrás va multiplicando un valor en cada capa que atraviesa. Si ese valor es menor que uno, la parte se achica capa tras capa, y al llegar a la primera capa queda casi en cero. Así se produce el desvanecimiento del gradiente, donde las capas de adelante dejan de aprender y se quedan quietas.
Al revés, si el valor que se multiplica es grande, la parte se infla al recorrer hacia atrás y los valores se disparan. Por eso son tan comunes los atajos que saltan capas, o los mecanismos que reajustan la escala de los valores en cada capa.
Los modelos profundos tardaron mucho en poder entrenarse por este mismo problema. El procedimiento de recorrer hacia atrás se conocía desde antes, pero solo cuando aparecieron los mecanismos que hacen llegar la parte viva hasta las primeras capas se pudo apilar capas sin límite.
3Con más precisión
La retropropagación aplica, capa por capa y en orden, la regla de la cadena para derivar una función compuesta. Cada capa toma la parte que recibió de atrás, la multiplica por su propia derivada, la pasa hacia adelante, y al mismo tiempo obtiene el gradiente de sus propios valores. Los resultados intermedios que hacen falta para ese cálculo se guardan durante el recorrido de ida y se usan al recorrer hacia atrás. Por eso entrenar consume mucha más memoria que hacer inferencia.
La analogía también tiene sus costuras. Las etapas del túnel de lavado se ven y están claramente separadas, pero en un modelo los valores fluyen mezclados entre capas, así que no se puede señalar "esta etapa es la culpable" de forma tajante. Lo que entrega la retropropagación no es un culpable, sino un número: cuánto cambia el error si cada valor se mueve apenas un poco. Además, en el túnel una persona juzga la mancha a simple vista, mientras que en el entrenamiento el criterio para medir el error es un cálculo fijado de antemano, y ese mismo criterio es la función de pérdida de la que sale, al final, todo lo que se reparte hacia atrás.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que la retropropagación es el entrenamiento en sí, pero en realidad solo indica hacia qué lado corregir cada valor; moverlo de verdad es tarea del descenso de gradiente y el optimizador.
Es fácil pensar que lo que viaja hacia atrás son los datos, pero en realidad lo que va hacia atrás es la parte del error, no los datos. Los datos siempre fluyen de adelante hacia atrás.
Es fácil pensar que cuantas más capas, mejor funciona la retropropagación, pero en realidad cuantas más capas hay, más fácil es que la parte se difumine o se dispare, y hace falta corregirlo aparte.
7Resumen en una línea
En resumenLa retropropagación recorre el error del resultado desde la última etapa hacia atrás y reparte, en cada valor, una parte de responsabilidad: es el camino de vuelta del entrenamiento.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02