EntrenamientoTraining

El proceso de ajustar los parámetros poco a poco con ejemplos

Puntos clave
  • El entrenamiento es el proceso de ir corrigiendo poco a poco los parámetros, según cuánto se desvió la respuesta, mientras se ven ejemplos. No es aprender escuchando una explicación, sino ajustar haciendo.
  • No se corrige mucho de una sola vez. Lo esencial es corregir muy poco, y muchísimas veces.
  • Cuando el entrenamiento termina, los parámetros quedan fijos en algún punto, y esa foto congelada de ese momento es el modelo.
  • El entrenamiento es el motor que hace andar al aprendizaje automático, y el aprendizaje automático es a su vez una de las formas de construir inteligencia artificial.
  • Entrenar más tiempo no mejora todo indefinidamente. Pasado cierto punto, empieza a memorizar lo que vio en vez de aprender la regla.
Contenido

1La analogía

Piensa en el día en que alguien aprende a andar en bicicleta. Por más que se lo expliquen con detalle al lado, no sirve de mucho. Memorizar cuántos grados hay que girar el manubrio y cuánto inclinar el cuerpo no evita que, apenas se sube al asiento, se caiga igual.

El aprendizaje pasa de otra forma. Pedalea, se inclina para un lado, pone el pie y se detiene. Se vuelve a subir, esta vez se inclina un poco menos. Se cae de nuevo, corrige un poco más. Después de repetirlo decenas de veces, en algún momento el cuerpo empieza a mantener el equilibrio solo. Ni siquiera puede explicar con palabras qué corrigió y cómo.

Lo que importa acá es cuánto se corrige cada vez. Si se cayó hacia la derecha y gira el manubrio bien fuerte hacia la izquierda, se cae para el otro lado. Devolver solo lo justo que se desvió, y repetir ese pequeño ajuste hasta el cansancio: así ocurre exactamente el entrenamiento.

2En detalle

Una vuelta son cuatro pasos

El entrenamiento repite una y otra vez los mismos cuatro pasos. Primero, se mete un ejemplo y se saca una respuesta. Segundo, se mide con un solo número cuánto se alejó esa respuesta de la correcta. Tercero, se calcula qué perilla hay que girar y hacia qué lado para reducir ese número. Cuarto, se la gira apenas un poco en esa dirección.

Y se pasa al siguiente ejemplo para repetir los mismos cuatro pasos. En la bicicleta sería: subirse y probar, sentir cuánto se inclinó, saber hacia qué lado corregir, y corregir apenas un poco.

Esta vuelta se repite millones, miles de millones de veces. Lo que cambia en cada vuelta es tan chico que ni se nota, pero esos cambios diminutos se van acumulando hasta que algo que al principio decía cualquier cosa termina dando respuestas bastante razonables.

Por qué se corrige tan poco

Hay una razón para no corregir mucho de una sola vez: el ejemplo que se acaba de ver no representa a todos los demás. Si por casualidad se ve un ejemplo raro y se gira fuerte en esa dirección, todo lo acumulado hasta entonces se desordena de golpe. Es como girar el manubrio con fuerza porque se inclinó a la derecha, y terminar cayéndose para el otro lado.

Por eso el tamaño de cada paso se fija muy pequeño. A ese tamaño se le llama tasa de aprendizaje. Si es demasiado grande, va y viene alrededor de la respuesta sin asentarse nunca; si es demasiado chica, nunca llega. Encontrar el tamaño justo es una de las tareas centrales de quien entrena un modelo.

También es común juntar los ejemplos de a decenas en vez de mirarlos de a uno: si la dirección se decide con el promedio de un grupo, el paso queda más estable.

Medir el desvío con un solo número

Para que el entrenamiento funcione, hace falta saber, con un número, cuánto se está equivocando ahora mismo. A esa vara que mide el error se le llama función de pérdida. Cuanto más se parece a la respuesta correcta, más cerca está de cero; cuanto más se aleja, más grande se vuelve.

El único objetivo del entrenamiento es reducir ese número. En ningún lugar hay una instrucción que diga "dibuja bien" o "habla bien". Lo único que hace una persona es decidir qué se va a usar como vara de medir, y todo lo demás fluye solo hacia reducir ese número.

Por eso, si se elige mal la vara, se va para un lado equivocado. En la bicicleta, si solo se mide "no caerse", se puede terminar aprendiendo a quedarse parado ahí mismo. Este tipo de accidente ocurre seguido en el entrenamiento real.

Entrenar más tiempo no mejora todo para siempre

Si se sigue entrenando, la pérdida sigue bajando. Pero pasado cierto punto ocurre algo raro. Cada vez acierta más con los ejemplos que usó para entrenar, pero con ejemplos que nunca vio, en cambio, empeora. En lugar de encontrar la regla, empezó a memorizar lo que vio. A este estado se le llama sobreajuste.

Por eso se aparta una parte de los ejemplos, sin usarla para entrenar, y se revisa con ella de tanto en tanto. Cuando ese puntaje deja de mejorar y empieza a empeorar, se detiene el entrenamiento, igual que en la bicicleta dar vueltas por la misma cuadra ya no ayuda una vez que se dejó de caer.

Cuando termina el entrenamiento, queda el modelo

Al detener el entrenamiento, los parámetros de ese momento quedan congelados tal cual. Esa copia congelada es el modelo. Entrenamiento es la palabra para el proceso; modelo es el resultado que deja ese proceso.

Un modelo ya congelado no crece por su cuenta. Mientras el servicio da respuestas, no hay entrenamiento ocurriendo. Es como cuando, después de aprender a andar en bicicleta, no se aprende casi nada nuevo mientras simplemente se anda. Para cambiar el nivel hay que volver a entrenar, y también existe, aparte, el método de darle un poco más de datos a un modelo ya terminado solo para ajustarle el carácter.

3Con más precisión

El entrenamiento es un proceso de optimización que actualiza los parámetros una y otra vez en la dirección donde el valor de la función de pérdida se hace más chico. Esa dirección se obtiene calculando qué tan sensible es la pérdida a cada parámetro; a esa sensibilidad se le llama gradiente, y al método de moverse poco a poco en la dirección contraria al gradiente se le llama descenso de gradiente. En una red profunda, el procedimiento que reparte hacia atrás, hasta las primeras capas, la responsabilidad del error medido en la última capa se llama retropropagación. A dar una vuelta completa por todos los ejemplos preparados se le llama época.

También aquí la analogía de la bicicleta se queda corta. Una persona aprende con unas pocas decenas de caídas, pero un modelo suele necesitar entre millones y miles de millones de actualizaciones. Una persona decide sola, cada vez que se cae, qué hacer la próxima; el modelo solo puede saber hacia dónde ir si alguien de afuera le da la vara que mide el desvío. Y una persona traslada, aunque sea un poco, el equilibrio que aprendió a otros vehículos, mientras que un modelo suele tambalearse mucho apenas se sale un poco del rango que aprendió.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que entrenar es guardar conocimiento, pero en realidad no se guardan los ejemplos: se van corriendo los parámetros según cuánto se desvió la respuesta.

  • Es fácil creer que entrenar más tiempo siempre mejora el resultado, pero en realidad, pasado cierto punto, empieza a memorizar lo que vio y empeora frente a problemas nuevos.

  • Es fácil pensar que el modelo sigue aprendiendo mientras se usa el servicio, pero en realidad los parámetros no cambian mientras se dan respuestas: el entrenamiento ocurre aparte, en otro momento.

7Resumen en una línea

En resumenEl entrenamiento es el proceso de corregir poco a poco, muchísimas veces, los parámetros según cuánto se desvió la respuesta ante cada ejemplo, y lo que queda cuando ese proceso se detiene es el modelo.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02