Validación cruzadaCross-Validation
Dividir los datos en partes, turnarlas y promediar los resultados
- La validación cruzada divide los datos en varias partes y usa una distinta como revisión cada vez, por turnos.
- Se repite el entrenamiento tantas veces como partes hay, y los puntajes que salen se promedian en un solo número.
- Si solo se separa una vez para revisar, el puntaje depende mucho de qué datos cayeron ahí. El promedio reduce ese vaivén.
- Como cada dato hace de revisor una vez, no se descarta ningún dato: se aprovechan todos.
- A cambio, hay que repetir el entrenamiento tantas veces como partes, así que el tiempo y el cómputo se multiplican.
Contenido
1La analogía
En un torneo de bolos no se juegan cuatro partidas seguidas en el mismo carril y con eso se decide la puntuación. Cada carril tiene un engrasado distinto: si toca un carril resbaladizo, la puntuación sale más alta de lo real, y si toca uno duro, parece que el jugador rinde menos. Por eso, al terminar cada partida, se cambia al carril de al lado. Después de dar la vuelta a los cuatro carriles quedan cuatro puntuaciones, y el promedio de esas cuatro es el nivel del día. Es una manera de impedir que el estado de un solo carril decida todo el resultado. La validación cruzada, que divide los datos y va revisando por turnos, es justo ese cambio de carril.
2En detalle
Se usa cada parte como revisión, por turnos
Supongamos que los datos disponibles se dividieron en cuatro partes iguales. En la primera vuelta se aparta la primera parte y se entrena con las otras tres; luego se califica con la parte apartada. En la segunda vuelta se devuelve la primera parte y se aparta la segunda. Al completar cuatro vueltas, cada parte hizo de revisión exactamente una vez.
En cada vuelta el modelo se entrena desde cero. Si se continuara con lo aprendido en la vuelta anterior, datos ya vistos se colarían en la parte de revisión y el puntaje saldría inflado. Al final de cada vuelta se anota el puntaje, y al terminar todas se promedian. Mirar además cuánto se dispersan esos puntajes ayuda a saber cuánto confiar en el resultado.
Por qué hace falta promediar
Si los datos se dividen una sola vez para revisar, qué haya caído en esa parte influye mucho en el puntaje. Si por casualidad se juntaron los casos más fáciles, el puntaje sale más alto de lo real; si se juntaron los más difíciles, sale más bajo. Cuantos menos datos hay, más se nota este vaivén, y solo con cambiar cómo se dividen, el puntaje puede subir o bajar varios puntos porcentuales.
En ese estado es difícil decir qué modelo es mejor entre dos: no se sabe si la diferencia de puntaje viene de una diferencia real o de la suerte del corte. El promedio de puntajes obtenidos en varias divisiones borra esa suerte de una sola vez. Y si además se mira cuánto se separan esos puntajes entre sí, se tiene una base para juzgar si la diferencia es significativa o no.
En cuántas partes dividir
Es habitual dividir en cinco o en diez partes. Cuantas más partes, más datos entran en cada entrenamiento y el resultado se acerca más a la situación real, pero también aumenta cuántas veces hay que entrenar. Cuando los datos son muy escasos, a veces se llevan las partes hasta el número de datos mismo, revisando de uno en uno: es la forma más aprovechada, pero también la más lenta.
Si los datos están sesgados hacia un tipo, conviene dividir manteniendo esa misma proporción en cada parte; de lo contrario, alguna parte puede quedarse sin ningún ejemplo de un tipo poco frecuente y el puntaje de esa vuelta se desploma. Cuando los datos tienen fecha, hay que respetar el orden y dividir de modo que se entrene con el período anterior y se revise con el posterior, porque una vuelta que aprenda del futuro para acertar el pasado no podría pasar de verdad.
El precio que hay que pagar
El precio de la validación cruzada es el tiempo. Con cinco partes se entrena cinco veces; con diez, diez veces. En un modelo pequeño que termina en minutos no supone una carga, pero en un modelo grande que tarda días en entrenarse una sola vez, resulta poco práctico. Por eso, en los modelos grandes se suele usar un único conjunto de validación apartado de antemano, y la validación cruzada se reserva para problemas con pocos datos o modelos pequeños.
Tampoco conviene confiarse cuando se usa la validación cruzada para elegir configuraciones. Si se comparan cientos de candidatos con las mismas divisiones, el resultado termina ajustándose justo a esa forma de dividir. Por eso lo más seguro es medir el rendimiento final con datos que nunca entraron en la validación cruzada, ni una sola vez.
3Con más precisión
La validación cruzada divide los datos en k partes, usa cada una como revisión una vez, entrena y evalúa k veces, y promedia el rendimiento. Se le llama validación cruzada de k pliegues; si se mantiene la proporción de clases en cada parte, se llama validación cruzada estratificada, y si el número de partes se lleva hasta el número de datos, validación cruzada dejando uno fuera. Lo que se obtiene es tanto el promedio del rendimiento como una idea de cuánto varía ese valor.
La analogía también cojea en algún punto. En los bolos la misma persona solo cambia de carril, pero en la validación cruzada se entrena un modelo completamente nuevo en cada vuelta, así que al final no queda un único modelo terminado, sino un puntaje. El modelo que se va a usar de verdad se entrena después, con todos los datos juntos, una vez que esa configuración quedó decidida. Otra cosa más: las partes solo tienen sentido si son completamente independientes entre sí; si datos de la misma persona o del mismo aparato quedan repartidos en varias partes, el puntaje sale más alto de lo real.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que hacer validación cruzada produce un modelo mejor, pero en realidad el modelo no mejora: lo que se afina es la precisión con la que se mide su rendimiento.
Es fácil creer que, tras la validación cruzada, ya no hace falta un conjunto de prueba aparte, pero en realidad si se eligen configuraciones varias veces con la misma división, el resultado también se ajusta a esa división.
Es fácil pensar que cuantas más partes, siempre mejor, pero en realidad los entrenamientos se multiplican y, con una parte de revisión demasiado pequeña, el puntaje de cada vuelta puede volverse más inestable en lugar de menos.
7Resumen en una línea
En resumenLa validación cruzada es jugar varias partidas cambiando de carril y promediar el resultado; se usa para medir el nivel real, no un golpe de suerte.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02