SesgoBias Term
El valor base que siempre se suma, sin importar la entrada
- El sesgo es el valor base que siempre se suma, sea cual sea la entrada. A diferencia del peso, no se multiplica por nada: solo se añade una vez.
- Su trabajo es desplazar el umbral. Si el valor base es grande, basta con poco para activarse; si es pequeño, hace falta una entrada fuerte.
- Sin sesgo, la neurona debe dar siempre 0 cuando todas las entradas son 0. Eso reduce el abanico de decisiones que puede representar.
- Hay uno por neurona. Son muchos menos que los pesos, pero sin ellos el entrenamiento se nota claramente más lento.
- El nombre es sesgo, pero no tiene nada que ver con el sesgo de discriminación o de datos. Aquí es solo una constante que se suma en el cálculo.
Contenido
1La analogía
Al subir a un taxi, la tarifa ya empieza en un monto fijo desde el momento en que te sientas. Bajes una sola cuadra o te quedes parado en un semáforo, la tarifa base se cobra igual. A partir de ahí se suma lo que corresponde por la distancia recorrida.
Esa tarifa base es una palanca que desplaza toda la tarifa hacia arriba o hacia abajo. Si sube de noche, el mismo trayecto arranca desde un escalón más alto. Con un presupuesto fijo para el viaje: en una noche de tarifa base alta, con recorrer poco ya se supera el presupuesto; en una de tarifa base baja, hay que avanzar bastante más para superarlo. El costo por distancia no cambia, solo se mueve el punto en el que se supera el límite.
El sesgo es justo esa tarifa base. Si el peso que se multiplica por cada entrada es el costo por distancia, el sesgo es el monto inicial que se cobra aunque no se avance nada. Su función es correr hacia adelante o hacia atrás el punto en el que la neurona se activa.
2En detalle
No se multiplica, solo se suma
La neurona multiplica cada entrada por su peso, suma todo y, al final, añade una vez más el sesgo. A diferencia de los demás números, el sesgo no tiene una entrada emparejada: siempre va solo.
Por eso, incluso cuando todas las entradas son 0, la neurona puede dar un resultado distinto de 0. Sin sesgo, cuando no llega ninguna señal el resultado siempre tendría que ser 0, y las decisiones que la neurona puede formar quedarían atadas a las que pasan por el origen.
La palanca que desplaza el umbral
La función de activación tiene una línea fija donde se activa. Esa línea no se mueve por sí sola. Lo que hace el sesgo es correr el valor que entra, hacia arriba o hacia abajo en bloque, y así facilita o dificulta superar esa línea.
Si el sesgo se fija alto, esa neurona se vuelve un detector sensible que se activa con casi cualquier señal. Si se fija muy negativo, se vuelve un detector exigente que casi nunca se activa. Dentro de una misma capa, este valor base cambia de neurona a neurona, así que unas terminan reaccionando a señales comunes y otras solo a señales raras.
Sin sesgo, el entrenamiento se complica
El modelo funciona igual sin sesgo. Pero aparece una restricción: todos los límites de decisión tienen que pasar por el origen. Si los datos están lejos del origen, el modelo no puede desplazar el límite y trata de compensarlo forzando los pesos a valores enormes. El resultado es un entrenamiento más lento y más inestable.
Basta con sumar un solo sesgo para que este problema desaparezca. Como el límite se puede mover entero, los pesos solo necesitan encargarse de la dirección y la pendiente. El número de sesgos es apenas el de neuronas, así que su peso en el total de parámetros es mínimo, y aun así casi todos los modelos lo incluyen.
Se ajusta junto con el entrenamiento
El sesgo también se entrena, igual que los pesos. Empieza en 0 o en un valor muy pequeño, y va desplazándose poco a poco según el error con la respuesta correcta. No es un hiperparámetro que alguien fije de antemano, sino un valor que el modelo mismo encuentra.
Si se abre un modelo ya entrenado, se ve que el sesgo es distinto en cada neurona. Un valor muy negativo significa que esa neurona guarda silencio ante la mayoría de las entradas; uno positivo, que suele estar algo activada de manera constante.
También hay lugares donde se prescinde de él
Cuando una capa ya lleva junto un mecanismo que empareja el tamaño de los valores, a veces se omite el sesgo. Ese mecanismo ya se encarga de desplazar los valores, así que añadir sesgo aparte terminaría duplicando el mismo trabajo.
En los modelos de lenguaje más grandes, para aligerar aunque sea un poco el cálculo, a veces se elimina directamente el sesgo de algunas capas. Se ha comprobado en la práctica que quitarlo apenas cambia el resultado y libera cálculo. El valor base no siempre es imprescindible: cuando algo más cumple su función, cede su lugar.
3Con más precisión
El sesgo es una constante que se suma en el cálculo de la neurona. Visto como la ecuación de una recta, el peso fija la pendiente y el sesgo fija el punto donde se cruza con el eje vertical, por eso también se le llama intercepto. Se ajusta junto con los pesos durante el entrenamiento, y hay uno por cada neurona.
La analogía del taxi también tiene sus costuras. La tarifa base siempre es positiva, pero el sesgo es negativo con mucha frecuencia. De hecho, un sesgo negativo se usa a menudo justo para mantener a una neurona casi siempre en silencio y que solo reaccione ante señales fuertes. Además, la tarifa la fija una empresa como política, mientras que el sesgo se define solo a partir de los datos.
También conviene aclarar la confusión que trae el nombre. El problema de que los datos de entrenamiento estén desbalanceados y perjudiquen a ciertos grupos también se llama sesgo, pero eso habla de los datos y de la sociedad, mientras que el sesgo del que habla este artículo es un solo número que se suma en una fórmula. En inglés también se usa la misma palabra, bias, para ambos casos, así que hay que distinguirlos por el contexto.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que el sesgo es lo mismo que el sesgo de discriminación en los datos, pero en realidad aquí es solo una constante que se suma en el cálculo: comparten nombre, no significado.
Es fácil pensar que el sesgo es un valor de relleno que no importa mucho, pero en realidad es la única palanca que desplaza el límite de decisión, y quitarlo hace notablemente más difícil el entrenamiento.
Es fácil pensar que el sesgo también se multiplica por la entrada, pero en realidad se suma una sola vez al final, sin ninguna entrada emparejada.
7Resumen en una línea
En resumenEl sesgo es el valor base que siempre se suma sin importar la entrada, y su función es correr hacia adelante o hacia atrás el punto en el que la neurona se activa.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02