Conjunto de validaciónValidation Set

Datos apartados solo para revisar, nunca para entrenar

Puntos clave
  • El conjunto de validación es el que nunca se usa para entrenar, solo para revisar. Se aparta desde el principio, antes de tocar nada.
  • Mientras el entrenamiento avanza, se califica con este conjunto para decidir cuándo parar y cómo ajustar la configuración.
  • Si la nota de entrenamiento sigue subiendo pero la de validación se dobla hacia abajo, es la señal de que empezó a memorizar.
  • Ajustar la configuración decenas de veces mirando el puntaje de validación termina por acomodarse a ese mismo conjunto. Por eso se guarda aparte un conjunto de prueba que solo se abre una vez, al final.
  • Al separarlo hay que hacerlo sin sesgarlo hacia un lado, y si el mismo contenido aparece repetido en ambas partes, el puntaje sale inflado.
Contenido

1La analogía

Imagina que restauras cien fotos de película, descoloridas por el tiempo. Pones unas cuantas delante y vas subiendo y bajando el color hasta encontrar el ajuste correcto. Esas fotos con las que trabajaste, claro, quedan perfectas: las ajustaste para que quedaran así. Por eso, al principio, se apartan unas cuantas sin tocar. Se guardan en un cajón, y cuando el ajuste parece estar cerca, se sacan y se aplica el mismo retoque tal cual. Si ahí el color falla, significa que el ajuste todavía no está bien. Que las fotos retocadas queden bien no demuestra nada por sí solo. Las fotos que sirven para ajustar y las que se guardan para comprobar hay que separarlas antes de empezar. Al entrenar una IA, esa parte guardada en el cajón es el conjunto de validación.

2En detalle

Separar desde el principio los datos de estudio y de revisión

Si se mete todo el conjunto de datos en el entrenamiento y luego se califica con esos mismos datos, el puntaje siempre sale bien: es corregir algo que ya se ajustó para que quedara bien. Por eso, en cuanto se reúnen los datos y antes de empezar a entrenar, se aparta un bloque a un lado. La proporción suele rondar uno de cada diez, y si hay muchísimos datos, a veces se aparta incluso menos.

Los datos apartados nunca se usan para corregir los valores del modelo. Solo sirven para calificar. Así el puntaje refleja de verdad la habilidad frente a algo nunca visto. En cuanto se deja pasar aunque sea una vez el conjunto de revisión hacia el entrenamiento, desde ese momento el puntaje deja de medir habilidad y pasa a medir memoria.

Las decisiones que toma el puntaje de validación en tu lugar

El entrenamiento mejora un poco en cada vuelta. Si al terminar cada vuelta se califica con el conjunto de validación y se anota el puntaje, esa serie de números toma varias decisiones por sí sola. La más común es cuándo parar: si el puntaje de validación lleva varias vueltas igual o vuelve a empeorar, ahí se corta el entrenamiento.

Cuántas capas apilar, qué tasa de aprendizaje usar, cuánto dropout aplicar, también se eligen con el puntaje de validación. Estos valores no los aprende el modelo por sí solo, los fija una persona de antemano; se prueban varios candidatos y se conserva el que da mejor puntaje de validación.

También puede acabar ajustándose al conjunto de validación

Si en el cajón se saca cien veces la misma foto para afinar el color, el resultado puede terminar encajando solo con esas fotos concretas. Con el conjunto de validación pasa igual: si se ajusta la configuración decenas o cientos de veces mirando siempre el mismo puntaje, quien termina acomodándose a esos datos no es el modelo, es la persona que lo ajusta. El puntaje de validación sigue subiendo, pero con datos nuevos ya no rinde tanto.

Por eso se impuso la costumbre de dividir los datos en tres: la parte para aprender, la parte para revisar durante el entrenamiento, y la parte que se abre una sola vez, cuando todas las decisiones ya están tomadas. Solo el puntaje de esa última parte es un puntaje que nadie ajustó de antemano.

Cómo se separa también cambia el puntaje

Cortar en orden, desde el principio, es arriesgado. Si los datos están ordenados por fecha o por tipo, la parte de revisión puede quedar cargada de un periodo o un tipo concreto. Por eso lo habitual es mezclar bien y apartar al azar, y a veces incluso mantener la proporción de cada tipo al hacerlo.

También es frecuente que el mismo contenido aparezca repetido en ambas partes: el mismo documento llegado por dos vías, o una foto retocada varias veces para multiplicarla. Cuando eso ocurre, algo casi idéntico a lo usado en el entrenamiento se cuela en la revisión, y el puntaje sale mucho más alto de lo real. Con datos que avanzan en el tiempo, conviene apartar la parte de revisión del período más reciente, para acercarse más a una situación real.

Cuando hay pocos datos

Si solo se tienen unos cientos de casos, apartar uno de cada diez ya duele, y el puntaje que da esa parte tan pequeña se mueve mucho según qué datos hayan caído ahí. En ese caso, en lugar de fijar una parte, se divide en varias y se revisa por turnos, promediando los puntajes. Se llama validación cruzada, y aprovecha todos los datos sin descartar ninguno mientras reduce ese vaivén.

3Con más precisión

El conjunto de validación es el bloque de datos que no se usa para actualizar los parámetros del modelo, sino solo para elegir hiperparámetros y decidir cuándo detener el entrenamiento. La forma básica divide los datos en tres: el conjunto de entrenamiento, el de validación para revisar por el camino y el de prueba para el informe final. En la literatura en inglés al conjunto de validación también se le llama dev set, y en algunos campos los términos validación y prueba se usan al revés, así que conviene confirmar a qué parte se refiere cada texto.

La analogía también cojea en algún punto. Al retocar fotos, una persona ve con sus ojos dónde está el desajuste; el conjunto de validación, en cambio, solo devuelve un número, y ese número no dice qué corregir. Además, la foto del cajón se saca una vez y se acabó, pero el conjunto de validación se vuelve a calificar decenas de veces durante todo el entrenamiento. Ese uso repetido trae consigo, a diferencia del retoque de fotos, el riesgo de que la configuración termine ajustándose justo a esa parte.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que el conjunto de validación también sirve para entrenar, así que no pasa nada por incluirlo, pero en realidad en cuanto se incluye una sola vez, el puntaje deja de medir habilidad y pasa a medir memoria.

  • Es fácil creer que un puntaje de validación alto significa que rendirá igual de bien de verdad, pero en realidad, si la configuración se ajustó mucho tiempo mirando ese mismo conjunto, ese puntaje también está inflado.

  • Es fácil pensar que cuanto más grande el conjunto de validación, mejor, pero en realidad cuanto más se aparta, menos queda para aprender, así que hay que buscar un equilibrio razonable.

7Resumen en una línea

En resumenEl conjunto de validación es la parte que se guardó en el cajón antes de empezar, y precisamente por no haberla tocado, solo su puntaje dice cuándo hay que parar.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02