EtiquetaLabel

La respuesta correcta que alguien anotó de antemano

Puntos clave
  • Una etiqueta es la respuesta correcta que alguien anotó de antemano en un dato. Es esa palabra que alguien escribió junto a una foto: "gato".
  • Con la etiqueta se puede calificar. Hay que comparar la respuesta del modelo con la respuesta anotada para poder corregir según el error.
  • La etiqueta ocupa un lugar distinto al de la característica. La característica es lo que la IA mira para decidir; la etiqueta es la respuesta que ya definió una persona.
  • Si la etiqueta está mal, el aprendizaje también sale mal. Una respuesta anotada por error le enseña al modelo algo equivocado.
  • Poner etiquetas sale caro porque exige mucho trabajo humano. Por eso también se usan métodos que aprenden sin etiquetas.
Contenido

1La analogía

Al hojear un álbum de fotos viejo, muchas imágenes no dicen por sí solas ni cuándo ni dónde se tomaron. Pero al dar vuelta la foto aparece una línea escrita a lápiz: "primavera de 1998, en el patio". Alguien que ordenó esas fotos la escribió para que después se pudiera reconocer. Esa línea es la etiqueta.

El frente y el reverso son cosas de naturaleza muy distinta. El frente es lo que se ve; el reverso es un hecho que alguien conocía y decidió anotar. Por más que se mire la foto, el año en que se tomó no aparece solo.

Por eso, una foto con el reverso en blanco es difícil de usar para ordenar el álbum. Y si se cuela una foto con un dato mal anotado en el reverso, todo el álbum ordenado sobre esa base termina desviado.

2En detalle

La etiqueta la pone una persona

La etiqueta no es un valor que venga incluido en el dato. El archivo de una foto solo trae píxeles; la palabra "gato" no está en ninguna parte. Alguien mira la foto, decide y escribe esa palabra al lado.

Por eso, fabricar etiquetas es una tarea que consume tiempo humano de forma directa. Para ponerle nombre a diez mil fotos hay que mirarlas diez mil veces y escribir diez mil veces. Si además hay que marcar dónde está el objeto, una sola foto puede tomar varios minutos.

Qué se elige como respuesta correcta depende del objetivo. A la misma foto se le puede poner "gato", o "interior", o "con buena luz". La etiqueta no describe una propiedad del dato en sí, sino el problema concreto que se quiere resolver.

Con la etiqueta se puede calificar

Entrenar es repetir un proceso de calificación una y otra vez. El modelo mira el dato y da una respuesta, y esa respuesta se compara con la etiqueta que trae al lado. Si está mal, se mide cuánto se alejó, y se corrigen los números del modelo en esa medida. Repetir este proceso incontables veces es lo que da la capacidad.

Sin etiqueta no se puede calificar. El modelo dio una respuesta, pero si no hay forma de saber si acertó o falló, tampoco hay forma de saber en qué dirección corregir. Por eso al método que enseña con datos etiquetados se le llama aprendizaje supervisado.

La característica y la etiqueta ocupan lugares distintos

Si cada dato es una fila de una tabla, las columnas de adelante son las características y la última columna es la etiqueta. La característica es lo que el modelo ve; la etiqueta es lo que el modelo tiene que acertar. Los dos tienen que ir emparejados para poder usarse en el entrenamiento.

Cuando el modelo ya está en uso de verdad, no hay etiqueta. La foto nueva solo trae características, y averiguar esa respuesta es la tarea del modelo. La etiqueta solo hace falta mientras se enseña y mientras se mide el rendimiento.

Por eso no puede colarse, entre las características, un valor que solo se pueda llenar sabiendo ya la respuesta correcta. El puntaje del examen sale muy bien, pero en la situación real ese valor no se consigue y el modelo queda sin utilidad.

Si la etiqueta está mal, el aprendizaje también sale mal

El modelo no desconfía de la etiqueta que trae puesta. Si por error alguien anotó "gato" junto a la foto de un perro, el modelo aprende exactamente eso. Basta con que unos pocos puntos porcentuales de las respuestas estén mal anotadas para que el rendimiento baje de forma notoria, y encima cuesta mucho descubrir por qué bajó.

También hay casos ambiguos que se prestan a error. Algo como "esta reseña es positiva o negativa" cambia de una persona a otra. Por eso, al etiquetar, se fija un criterio por escrito y se revisa cuánto coinciden varias personas al anotar el mismo material. Si la coincidencia es baja, la señal dice que hay que revisar primero el criterio, no el material.

También hay caminos para aprender sin etiquetas

Como poner etiquetas sale tan caro, surgieron varios métodos para aliviar esa carga. Hay uno que agrupa datos sin etiqueta según qué tan parecidos son entre sí, y otro que combina un poco de material etiquetado con mucho material sin etiquetar.

El método que usan hoy los modelos de lenguaje se acerca a esto. En vez de que una persona escriba la respuesta correcta, se tapa una parte del texto y se le pide al modelo que adivine qué iba ahí. El texto original hace de respuesta correcta, así que no hace falta trabajo humano. Aun así, en la etapa final, donde se ajusta el modelo al gusto de las personas, sigue haciendo falta el juicio anotado por alguien.

3Con más precisión

La etiqueta es el valor objetivo que le corresponde a una muestra. En un problema de clasificación es una de varias opciones fijas; en uno de regresión, es un número. Hay casos en los que una muestra tiene varias etiquetas a la vez, y casos, como la posición de un objeto, en los que la etiqueta son las coordenadas de un recuadro. A este conjunto de respuestas correctas que se usa como referencia para medir el rendimiento también se le llama dato de verdad. Si las etiquetas no están repartidas de forma pareja entre las categorías, sino amontonadas de un lado, el modelo puede sacar un puntaje alto solo con apostar siempre por el lado mayoritario, lo que da una idea equivocada de su capacidad real.

La analogía también tiene sus límites. La nota del reverso de una foto describe un hecho de esa foto, pero la etiqueta que se usa para entrenar se parece más a una convención que las personas decidieron llamar así que a un hecho. Hasta dónde llamar "gato" a algo, o en qué grupo poner una foto borrosa, lo decide quien fija el criterio. Por eso, en la etiqueta queda impresa la mirada de quienes la anotaron, y si esa mirada está inclinada hacia un lado, el modelo se inclina en la misma dirección.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que la etiqueta viene incluida en el dato desde el origen, pero en realidad alguien la mira, la decide y la anota después.

  • Es fácil creer que la etiqueta es siempre una respuesta única y obvia, pero en realidad hay mucho material donde el juicio cambia de persona a persona, así que primero hay que fijar un criterio.

  • Es fácil pensar que usar IA siempre requiere etiquetas, pero en realidad también se usan mucho métodos que aprenden sin etiquetas o que generan la respuesta a partir del mismo dato.

7Resumen en una línea

En resumenLa etiqueta es la respuesta correcta que alguien anotó de antemano en un dato, y solo con ella se puede calificar y corregir lo que el modelo responde.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02