ReLU
Regla de activación que bloquea negativos y deja pasar positivos
- ReLU es una regla dentro de la red neuronal: si el valor que llega es negativo, lo convierte en 0; si es positivo, lo deja pasar tal cual.
- No tiene techo. Una señal grande sigue siendo grande al pasar a la siguiente capa.
- La regla es tan simple que el cálculo es rápido, y la señal de aprendizaje llega mejor incluso con muchas capas apiladas.
- Cerca de la mitad de las señales se convierten en 0, así que solo trabajan las neuronas que importan en ese momento.
- Una neurona que solo recibe negativos durante mucho tiempo puede quedarse apagada para siempre.
Contenido
1La analogía
En el borde de un lavabo, un poco por debajo del tope, hay un pequeño desagüe de rebose. Mientras el agua sube, si el nivel queda por debajo de ese agujero, no sale ni una gota por ahí. Da igual que el lavabo esté medio lleno o casi al borde: lo que sale por el rebose es 0 en los dos casos. La historia cambia en cuanto el agua toca la altura del agujero. A partir de ahí, todo lo que sobra sale directo por el rebose. Si sobra poco, sale poco; si sobra el doble, sale el doble. El agujero no frena ni recorta nada: por mucho que abras el grifo, lo que sale es exactamente lo que sobra. ReLU hace lo mismo con los números. Por debajo del umbral, todo es 0; por encima, pasa tal cual lo que sobra.
2En detalle
El lugar donde se decide si un valor pasa
Una neurona pesa y suma los valores que le llegan de la capa anterior. Pero ese resultado no pasa directo a la siguiente capa: antes tiene que cruzar una regla, y ahí es donde se sienta la función de activación. ReLU es la más usada de todas, y lo que hace se resume en un solo umbral: si la suma es menor que 0, sale 0; si es mayor, sale el mismo valor que entró, sin tocarlo.
Sin este quiebre, apilar capas no serviría de nada. Encadenar solo multiplicaciones y sumas termina reduciéndose a una única multiplicación y una única suma. Hace falta un quiebre en medio para que cada capa pueda dibujar una forma nueva. ReLU mete, en cada capa, un quiebre baratísimo que ocurre justo en el 0.
Apagar la mitad sale más barato
Si una capa tiene miles de neuronas, cerca de la mitad recibe valores negativos y se convierte en 0. Una neurona apagada no aporta nada a la capa siguiente. Parece una pérdida, pero en realidad es una ganancia: en vez de que todas las neuronas hablen un poco a la vez, solo levantan la voz las que de verdad tienen algo que ver con esa entrada.
Cuando la señal que no aporta se apaga, la que queda se distingue mejor. El cálculo baja de peso, y entradas distintas terminan encendiendo neuronas distintas, con lo que aparece un reparto de tareas natural. A esta propiedad, donde buena parte de los valores queda en 0, se le llama escasez.
La misma entrada enciende unas neuronas y apaga otras, así que la combinación de neuronas encendidas cambia de capa en capa. De esa combinación sale la manera en que trozos rectos se encadenan hasta formar un límite curvo. Por eso una regla con un solo umbral, apilada capa tras capa, termina dibujando formas bastante complejas.
Lo que hizo posible entrenar redes profundas
Una red neuronal aprende devolviendo hacia atrás qué tan lejos quedó de la respuesta correcta. En ese camino, la función de activación de cada capa multiplica su parte a la señal que vuelve. La curva suave en forma de S que se usaba antes multiplicaba valores muy pequeños en sus dos extremos. Con solo diez capas de por medio, la señal casi desaparecía y las primeras capas no llegaban a aprender nada.
ReLU deja pasar la señal sin recortarla en el lado donde está encendida. Aunque se crucen decenas de capas, todavía queda algo que aprender hasta las primeras. Buena parte del mérito de que las redes profundas pasaran de ser teoría en papel a funcionar de verdad es de esta regla tan simple.
Neuronas que se quedan dormidas
También tiene un punto débil. Si una neurona termina recibiendo siempre valores negativos, sin importar la entrada, su salida queda fija en 0 y la señal que vuelve también es 0. No hay manera de corregirla y se queda así, congelada. A este estado se le llama neurona muerta.
Suele aparecer cuando la tasa de aprendizaje se fija demasiado alta. Un ajuste que se pasa de largo empuja a la neurona muy adentro del lado negativo, y ya no tiene fuerza para volver. Cuando muchas neuronas de una capa caen en este estado, esa capa solo ocupa espacio sin hacer ningún trabajo.
Por eso surgieron variantes que, en vez de aplastar del todo el lado negativo, lo inclinan apenas un poco. Dejar algo de señal, aunque sea mínima, abre un camino de vuelta. Fijar una tasa de aprendizaje baja o repartir bien los valores iniciales también ayuda a evitarlo en buena parte.
3Con más precisión
ReLU es la sigla de Rectified Linear Unit (unidad lineal rectificada). Es un quiebre entre dos rectas: la parte menor que 0 queda plana en el suelo y la parte mayor que 0 sube en diagonal. Un cálculo que antes solo podía encadenarse en línea recta consigue, con este único quiebre, dibujar límites curvos.
La analogía también tiene sus costuras. El desagüe de rebose tiene una altura fija, pero el umbral de ReLU siempre está clavado en 0. Subir o bajar ese umbral es tarea del sesgo que lleva cada neurona: se suma al valor de entrada y luego se compara con 0, así que el resultado es como si el umbral se moviera. Además, mientras el lavabo guarda agua dentro incluso mientras rebosa, ReLU descarta por completo la información del lado negativo. Por esa pérdida se usan variantes que inclinan ligeramente el lado negativo o suavizan el quiebre.
Otra diferencia es que el desagüe se pensó para un solo lavabo, mientras que ReLU se repite, idéntica, en miles de neuronas a la vez, capa tras capa. No hay ajuste fino por neurona: la misma regla de un solo umbral se aplica en todas partes, y esa uniformidad es parte de por qué el cálculo resulta tan barato.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que ReLU comprime los valores entre 0 y 1, pero en realidad no tiene techo: un valor grande pasa igual de grande.
Es fácil pensar que convertir los negativos en 0 tira la mitad de la información, pero en realidad apagar la señal que no aporta ayuda al aprendizaje.
Es fácil pensar que una regla tan simple debe rendir peor, pero en realidad esa simpleza fue lo que permitió entrenar redes profundas de verdad por primera vez.
7Resumen en una línea
En resumenReLU corta a 0 todo lo que queda bajo el umbral y deja pasar tal cual lo que lo supera: la regla más simple que hizo que las redes profundas funcionaran de verdad.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02