Desvanecimiento del gradienteVanishing Gradient

Señal de aprendizaje que se debilita hasta desaparecer entre capas

Puntos clave
  • El desvanecimiento del gradiente es cuando la señal que dice qué corregir se va haciendo más pequeña al bajar por las capas, hasta casi no llegar a las primeras.
  • La señal se transmite multiplicándose en cada capa. Multiplicar varias veces un número menor que 1 la acerca rápido a 0.
  • Las capas de entrada se quedan prácticamente congeladas, así que apilar más capas termina dando peores resultados.
  • Cambiar la función de activación, mantener parejo el tamaño de los valores y, sobre todo, abrir atajos que salten capas, resolvieron buena parte del problema.
  • Al revés, si la señal crece en cada capa, aparece el problema opuesto: los valores se disparan.
Contenido

1La analogía

Imagina el juego del teléfono descompuesto, en fila, dentro de un salón de clases. La última persona susurra al oído de quien tiene delante: "revisen desde la tercera fila otra vez". Hay una regla: cada quien solo puede pasar el sonido a la mitad de volumen de como lo escuchó.

Con solo cinco personas, el mensaje ya suena a murmullo; con diez, a la primera de la fila solo le llega un soplo de aire. Quien está al frente nunca se entera de qué tiene que corregir, y se queda parado en su postura inicial. Que el fondo se siga afinando mientras el frente permanece congelado, eso es el desvanecimiento del gradiente.

Cuanto más larga es la fila, peor se pone el problema: cada persona que se suma deja el frente todavía más en silencio.

2En detalle

La señal viaja de atrás hacia adelante

Cuando el modelo produce una respuesta, el cálculo fluye de la entrada hacia la salida. En cambio, la señal que indica "qué hay que corregir" fluye al revés, de la salida hacia la entrada. Solo al final se sabe qué tan errada quedó la respuesta.

Por eso, las capas cercanas a la salida reciben esta señal primero, y con más claridad. Las capas cercanas a la entrada la reciben después, cuando ya ha cruzado muchas capas de por medio. Es el mismo orden que sigue el susurro que arranca al final de la fila y busca llegar hasta el frente.

Se multiplica cada vez que cruza una capa

Al cruzar una capa, la señal cambia de tamaño según el valor de esa capa y las propiedades de su función de activación. El problema es que este ajuste es una multiplicación, no una suma. Si en cada capa se reduce a la mitad, después de diez capas la señal queda por debajo de una milésima.

La función de activación en forma de S que se usaba antes era especialmente propensa a esto: en cuanto la entrada era un poco grande o pequeña, la salida se aplanaba. En esa zona plana, lo que se transmite es muy poco, así que con apenas unas capas la señal ya se nota reducida. Al revés, si en cada capa se multiplica por un valor mayor que 1, la señal crece sin control y los valores se disparan.

Lo que pasa cuando las primeras capas se congelan

Las primeras capas son las que captan los rasgos más básicos de un texto o una imagen. Si esta capa no aprende, las capas de arriba tienen que seguir trabajando con un material sin pulir. Se buscaba mejorar el resultado agregando más capas, y en su lugar aparece un resultado peor que el de un modelo más superficial.

Los síntomas suelen ser así: el entrenamiento avanza mucho tiempo, pero el error deja de bajar en cierto punto, y los números de las primeras capas casi no cambian respecto a sus valores iniciales, elegidos al azar. En los modelos que procesan texto en orden, esto también aparece como que la información del principio de la frase no llega hasta el final.

Formas de proteger la señal

El cambio más importante fue abrir atajos que saltan capas. En vez de que la señal se reduzca capa por capa, se abrió un canal aparte que salta varias capas de una vez. Es como añadir, en la fila de susurros, un camino directo para que la última persona le hable sin intermediarios a la primera.

Usar funciones de activación que no se aplanan también ayudó mucho. Si la función transmite el valor tal cual en la parte positiva, lo que se multiplica no se reduce. A esto se sumó normalizar el tamaño de los valores en cada capa y elegir con cuidado los valores iniciales, ni demasiado grandes ni demasiado pequeños. En los modelos que leen en orden, se agregaron compuertas que deciden qué recordar y qué dejar ir, para que la señal sobreviva más tiempo.

3Con más precisión

La retropropagación es un cálculo en cadena que multiplica, una tras otra, las derivadas locales de cada capa. Si el valor que se multiplica en cada capa es, en promedio, menor que 1, se reduce de forma exponencial según el número de capas; si es mayor, crece de la misma manera. La derivada de la función sigmoide vale como máximo cerca de 0,25, así que apilar solo esta función ya reduce la señal, al menos, a la cuarta parte en cada capa.

La analogía también tiene sus costuras. En el juego de susurros, el sonido no solo se debilita: también el contenido termina cambiando por completo. El desvanecimiento del gradiente, en cambio, mantiene la dirección casi intacta y solo reduce el tamaño. Es más preciso pensar que la señal no desaparece del todo, sino que se vuelve tan pequeña que no llega a reflejarse en el ajuste.

Tampoco todas las rutas se reducen por igual. Algunos caminos sobreviven y otros no, así que dentro de una misma capa puede haber partes que siguen aprendiendo mezcladas con partes que ya se detuvieron.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que apilar más capas siempre hace al modelo más inteligente, pero en realidad, si la señal no llega hasta las primeras capas, el resultado puede ser peor que el de un modelo menos profundo.

  • Es fácil pensar que es un problema viejo ya resuelto, pero en realidad se ha aliviado con más herramientas, y sigue siendo algo a vigilar en modelos muy profundos o con entradas muy largas.

  • Es fácil pensar que basta con subir el tamaño del ajuste para resolverlo, pero en realidad eso también agranda las señales que ya eran grandes, y los valores terminan disparándose, con un entrenamiento más inestable todavía.

7Resumen en una línea

En resumenEl desvanecimiento del gradiente es cuando la señal de corrección se reduce a la mitad capa tras capa hasta no llegar a las primeras, y el entrenamiento se detiene ahí.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02