Dropout
Apagar al azar partes del modelo mientras entrena
- El dropout apaga al azar, durante el entrenamiento, una parte de las neuronas del modelo.
- Las neuronas que descansan se vuelven a sortear en cada paso. El objetivo es que ninguna neurona pueda apoyarse siempre en la misma compañera.
- El resultado es que varias neuronas terminan aprendiendo tareas parecidas por separado, así que si una falla el conjunto no se derrumba.
- La proporción que se apaga la decide una persona. Si es muy alta, el modelo deja de aprender; si es muy baja, no sirve de nada.
- Solo se apaga durante el entrenamiento; al usarlo de verdad se encienden todas, con un ajuste de escala que compensa la diferencia.
Contenido
1La analogía
Una rueda de molino gira cuando el agua que cae llena los cangilones de la rueda. Pero si el chorro siempre cae en el mismo punto, unos pocos cangilones cargan con casi todo el trabajo mientras el resto apenas se mueve. Por fuera gira bien, pero en realidad depende de dos o tres cangilones.
Por eso se preparan varias tablillas y, cada vez que se pone en marcha la rueda, se tapa un grupo distinto de cangilones: hoy estos, mañana aquellos. Como nadie sabe cuáles quedarán tapados, ningún cangilón puede confiar en que el de al lado hará el trabajo. Al final, todos aprenden a sostener su propio peso.
El dropout es esa tablilla. Durante el entrenamiento tapa al azar una parte de las neuronas, y las que quedan tienen que arreglárselas solas. Cuando por fin llega el momento de moler de verdad, se quitan todas las tablillas y se usan todos los cangilones a la vez.
2En detalle
El problema de depender de pocas neuronas
Dentro de un modelo hay muchísimas neuronas que se pasan valores entre sí. Cuando el entrenamiento se alarga, unas pocas suelen formar una combinación que carga con casi toda la respuesta, mientras el resto queda relegado a un papel de apoyo.
Ese modelo acierta muy bien con los datos que usó para entrenar. Pero si esa combinación no funciona con datos nuevos, no tiene a qué recurrir y falla mucho. Una estructura tan concentrada se derrumba en cuanto los datos cambian un poco.
El dropout rompe esa concentración durante el entrenamiento. Como en cada paso desaparece un grupo distinto de neuronas, ninguna combinación tiene tiempo de volverse indispensable. El aprendizaje se inclina entonces hacia que cada neurona produzca, por su cuenta, una señal que sirva de algo.
Se vuelve a sortear en cada paso
Las neuronas que descansan no se deciden de antemano. Cada vez que se procesa un lote de datos se sortean de nuevo. La que resulta elegida para descansar queda en cero durante ese paso, y también queda fuera cuando se reparte la corrección hacia atrás.
Así, cada paso entrena en realidad un modelo un poco distinto. Si hay miles de neuronas, las combinaciones posibles son prácticamente infinitas. El modelo terminado se parece bastante al promedio de todos esos modelos ligeramente distintos: es una manera de imitar, dentro de uno solo, el viejo truco de que promediar varios modelos da resultados más estables.
Cuánto hacer descansar
La proporción que descansa la fija una persona. Apagar cerca de la mitad es una configuración habitual, y en las capas con pocas neuronas se usa mucho menos. Si la proporción es demasiado alta, las neuronas que quedan no dan abasto y el aprendizaje no avanza; si es demasiado baja, no llega a romper la concentración y no sirve de mucho.
También se puede variar por capa: fuerte donde las neuronas están muy amontonadas, suave cerca de donde entran los datos. En entrenamientos con muchísimos datos a veces ni se usa, porque no hay tantas repeticiones como para memorizar.
Conviene saber además que el dropout hace el entrenamiento un poco más lento: como en cada paso falta una parte, hace falta dar más vueltas para llegar al mismo resultado. Si solo se mira el rendimiento sobre los datos de entrenamiento, la versión sin dropout siempre parece mejor; pero al medir con datos aparte, el orden se invierte.
Al usarlo, se encienden todas
Cuando el entrenamiento termina y llega el momento de dar respuestas de verdad, no se apaga nada: no conviene que la misma pregunta dé respuestas distintas cada vez. Pero encender todo sin más trae un problema. Durante el entrenamiento los valores siempre fluían con una parte apagada, y ahora que está todo encendido los valores resultan más grandes de lo esperado.
Por eso se aplica un ajuste de escala. Lo habitual es agrandar de antemano el valor de las neuronas que sobrevivieron durante el entrenamiento. Hecho así, al usar el modelo de verdad no hace falta ninguna corrección adicional: la magnitud de los valores ya coincide con la del entrenamiento.
3Con más precisión
El dropout pone en cero, con una probabilidad fija, cada neurona durante la fase de entrenamiento, y agranda el valor de las que quedan en esa misma proporción. Comparte objetivo con las técnicas que penalizan la magnitud de los valores, así que se clasifica dentro de la regularización en sentido amplio, pero se diferencia en que no añade un término al costo: corta directamente la señal.
La analogía también tiene sus límites. Los cangilones de la rueda se ven y se cuentan uno por uno, pero las neuronas de un modelo son más bien canales por donde fluyen valores, así que contarlas una a una no es tan sencillo. Además, las tablillas las coloca una persona, mientras que el dropout sortea al azar en cada paso. En los modelos grandes actuales es frecuente aplicarlo en otros puntos, no entre capas, o directamente prescindir de él cuando hay datos de sobra. También existen variantes que apagan bloques enteros en lugar de una neurona a la vez, y usos en los que se deja encendido a propósito al responder, repitiendo varias veces para medir cuánto varía la respuesta.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que el dropout elimina neuronas de verdad, pero en realidad solo pone su valor en cero durante ese paso; en el siguiente vuelve a estar activa.
Es fácil pensar que el dropout sigue actuando al dar respuestas, pero en realidad solo se activa durante el entrenamiento; al usarlo se encienden todas.
Es fácil pensar que cuanto más alta la proporción, mejor se evita el sobreajuste, pero en realidad si se pasa de la cuenta las neuronas que quedan no dan abasto y el entrenamiento deja de funcionar.
7Resumen en una línea
En resumenEl dropout es la tablilla que tapa al azar una parte de las neuronas durante el entrenamiento, para que el modelo no dependa siempre de las mismas.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02