PesoWeight
Importancia, fijada por el entrenamiento, que multiplica cada entrada
- El peso es el multiplicador que se aplica a cada valor que entra. Un mismo valor tiene más o menos fuerza sobre el resultado según el peso que lo multiplique.
- Si el peso es grande, esa entrada sacude mucho el resultado; si está cerca de 0, esa entrada queda prácticamente ignorada.
- También hay pesos negativos. Cuanto mayor es ese valor, más empuja el resultado en la dirección contraria.
- Cada conexión lleva su propio peso. Cuando un modelo actual habla de cuántos parámetros tiene, casi siempre se refiere a la cantidad de estos pesos.
- Nadie los define a mano. Entrenar es, justamente, ir corrigiendo estos valores poco a poco.
Contenido
1La analogía
Aunque se presente el mismo examen, no todas las notas pesan igual en la calificación final. En un curso, es común fijar de antemano cuánto cuenta cada parte: el parcial, un 30 %; el final, un 40 %; los trabajos, un 30 %. Subir diez puntos en el examen final mueve más la nota final que subir diez puntos en los trabajos.
También hay partes con un peso muy pequeño. Si la asistencia cuenta solo un 1 %, sacar el máximo ahí casi no cambia nada en la nota final. Al revés, algo como las faltas o las entregas tardías no suma cuando te va bien: resta cada vez que se acumula.
Ese porcentaje de peso es, justamente, el peso. Si el valor que entra es una calificación, el peso decide cuánto cuenta esa calificación en el resultado final. Hay una diferencia: el porcentaje de un curso lo fija el profesor al comienzo, pero el peso de un modelo se ajusta solo, después de calificar una y otra vez.
2En detalle
Cada conexión lleva su propio número
El peso no va pegado a la neurona, va pegado a la conexión. Si cien neuronas de una capa se conectan a una sola neurona de la siguiente, esa neurona necesita cien pesos, uno por cada conexión que le llega. Si la siguiente capa tiene cien neuronas, entre esas dos capas ya aparecen diez mil pesos.
Por eso el número de parámetros del que se habla al describir el tamaño de un modelo se dispara enseguida a cientos de millones. La mayor parte de esa cifra son pesos, y el resto son sesgos. El tamaño del archivo de un modelo es grande, en buena medida, porque tiene que guardar todos estos números.
El signo marca la dirección
Si el peso es positivo, esa entrada empuja el resultado hacia arriba conforme crece. Si es negativo, empuja hacia abajo. Con solo fuerzas que suman no se puede formar un juicio: para decidir que algo no es cierto, también hace falta una fuerza que reste.
Es más fácil de ver con un modelo que distingue si un correo es publicidad. Ciertas palabras empujan fuerte hacia "sí es publicidad", y una señal de que viene de un contacto conocido empuja hacia el lado contrario. La dirección que queda después de que las dos fuerzas se combinan es el juicio de esa neurona.
Cuanto más grande, más sensible
Cuando el valor absoluto de un peso es grande, un pequeño cambio en la entrada hace que la salida se sacuda mucho. Así aparece el sobreajuste: el modelo se ajusta bien a los datos de entrenamiento, pero se cae en cuanto ve datos que nunca vio antes.
Por eso, al entrenar, se usan a propósito mecanismos que frenan que los pesos crezcan demasiado; penalizar los valores grandes es el más habitual. Al revés, si todos los valores quedan aplastados cerca de 0, ninguna señal logra pasar. El entrenamiento es un proceso de buscar el tamaño justo entre estos dos extremos.
Entrenar es corregir estos números
Al principio, los pesos de un modelo recién creado son valores al azar, sin ningún sentido. Con ese punto de partida, las respuestas salen, como es de esperarse, un desastre. Se mide cuánto se aleja de la respuesta correcta, se calcula hacia qué lado y cuánto hay que mover cada peso para reducir esa distancia, y se desplazan un poco. Repetir esto millones de veces hace que los números vayan encontrando su lugar.
Lo importante es no moverlos mucho de golpe. Moverlos mucho de una vez hace que salten de un lado a otro solo para ajustarse a ese dato en concreto, y moverlos demasiado poco hace que el proceso se alargue sin fin. El valor que decide cuánto moverse es la tasa de aprendizaje.
Después de entrenar, quedan fijos
Cuando el entrenamiento termina, los pesos se quedan fijos en su sitio. Cuando alguien habla con un chatbot, los números dentro del modelo no cambian. Que la respuesta a la misma pregunta salga un poco distinta cada vez no es porque el peso cambie, sino porque el modelo mezcla algo de aleatoriedad al elegir la siguiente palabra.
Para retocar un modelo hace falta entrenarlo de nuevo, otra vuelta. En vez de reentrenar todo desde cero, es habitual ajustar solo una parte pequeña, lo que se llama ajuste fino, o dejar los números originales tal cual y añadir a un lado un grupo pequeño de números de corrección, un método que también se usa mucho.
3Con más precisión
El peso es una tabla de números que conecta una capa con la siguiente. El cálculo de una capa entera se resuelve de una vez multiplicando el grupo de valores de entrada por esta tabla, una multiplicación de matrices. Ese tipo de multiplicación y suma masivas es justo lo que hace bien una tarjeta gráfica, y por eso se usa una para entrenar modelos.
La analogía del porcentaje de calificación también tiene sus costuras. Los porcentajes de un curso siempre suman 100 %, pero los pesos no tienen esa restricción: pueden ser negativos o mayores que 1. Además, el porcentaje de calificación lo define una persona que entiende su significado, pero un peso, por sí solo, no tiene un sentido que una persona pueda leer. Casi nunca se puede explicar con claridad qué representa el valor pegado a una neurona en concreto.
La forma en que se guardan estos valores también afecta al rendimiento. Bajar la precisión y guardarlos con menos dígitos reduce mucho el tamaño del modelo y el uso de memoria; esta técnica es la cuantización. A cambio de algo de exactitud, permite correr el modelo en un portátil o en un teléfono.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que una persona define cada peso a mano, pero en realidad se parte de valores al azar y es el entrenamiento el que los va ajustando por su cuenta.
Es fácil pensar que un peso más grande es un modelo mejor, pero en realidad, si los valores crecen demasiado, el modelo se vuelve demasiado sensible a los datos de entrenamiento.
Es fácil pensar que cada peso tiene un significado propio, pero en realidad casi todos son números que una persona no puede leer, y el significado queda repartido entre muchos valores a la vez.
7Resumen en una línea
En resumenEl peso es la importancia que multiplica a cada entrada, y entrenar es ir empujando estos números poco a poco hacia la respuesta correcta hasta que encuentran su lugar.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02