Conjunto de datosDataset
El conjunto de datos ordenado para enseñar a la IA
- Un conjunto de datos no es un solo dato, sino todo el material reunido y ordenado con un mismo propósito. No es una foto, es un fajo de diez mil fotos.
- Qué se guarda y cuánto se guarda decide qué tan bien acaba funcionando el modelo. Lo que no está adentro no se puede aprender.
- El fajo entero no se usa de una sola vez: se reparte en la parte para enseñar y la parte para examinar. Si el examen usa el mismo material con el que se enseñó, no dice nada sobre la capacidad real.
- Elegir y depurar el material cuesta mucho más trabajo que reunirlo. Hay que filtrar duplicados, archivos dañados y respuestas mal puestas.
- Más cantidad no es lo mismo que mejor conjunto. Un fajo inclinado hacia un solo lado produce un modelo inclinado, sin importar su tamaño.
Contenido
1La analogía
Una biblioteca no apila libros al azar. Primero decide qué áreas va a cubrir y en qué medida, luego incorpora los libros uno por uno, les pone un número y los coloca en el estante que les corresponde. El libro roto se repara, y si llega un ejemplar repetido, uno de los dos se retira. Todo ese acervo ya ordenado es el conjunto de datos.
Un solo libro no es un conjunto de datos. Lo que define el carácter de la biblioteca es qué áreas cubre y en qué proporción, si faltan huecos, si solo tiene ediciones viejas. Una biblioteca llena solo de libros de cocina, por grande que sea, no responde preguntas de historia.
Y la biblioteca también separa sus estantes: el que presta a diario no es el mismo que el que guarda aparte.
2En detalle
Un dato y un conjunto de datos no son lo mismo
Un dato señala un elemento suelto, pero un conjunto de datos señala todo un fajo reunido con la misma regla. El pedido de un cliente es un dato; el año entero de pedidos es el conjunto de datos.
Dentro de un mismo fajo, la forma del material tiene que coincidir. Si son fotos, hay que igualar tamaño y formato; si son tablas, hay que igualar el nombre y el orden de las columnas. Si unos datos traen fecha y otros no, el modelo no puede aprovechar esa columna.
Por eso un conjunto de datos trae, además del material, una descripción: dónde y cómo se recogió, qué contiene, en qué condiciones se puede usar. Sin esa descripción, nadie más puede usar el fajo con confianza.
Hay que separar los estantes para poder medir la capacidad real
Un conjunto de datos suele repartirse en tres partes: la que se usa para enseñar, la que revisa el estado a mitad del camino y la que mide la capacidad final una sola vez.
La razón de dividirlo es simple. Si el examen usa el mismo material que se mostró al enseñar, solo se confirma lo que se memorizó. La capacidad real se mide por lo que se acierta frente a algo nunca visto, así que la parte reservada para el examen se sella y no se toca durante todo el entrenamiento.
Si esta frontera se rompe es grave. Si el material del examen se filtra al de entrenamiento, el puntaje se ve bien pero el modelo resultante es malo. Por eso, al dividir, hasta se cuida que las fotos de una misma persona no queden repartidas en ambos lados.
Lo que no está adentro no se puede aprender
El modelo no conoce nada fuera de su conjunto de datos. Si se enseña solo con fotos de día, se pierde con las fotos de noche; si se enseña solo con un habla estándar, no entiende los acentos regionales. El alcance de lo que se guardó es el alcance de lo que el modelo puede manejar.
Por eso, al construir un conjunto de datos, se pregunta sin parar qué falta en ese fajo. Las situaciones poco frecuentes hay que reunirlas a propósito, y si aun así faltan, a veces se voltean o se cambia el brillo de las que ya se tienen para multiplicarlas.
Depurar pesa más que reunir
Juntar material es apenas el comienzo. Hay que revisar a mano si un mismo dato entró varias veces, si hay columnas dañadas o vacías, si la respuesta que trae pegada es correcta. Esta depuración se lleva la mayor parte del tiempo la mayoría de las veces.
Poner las respuestas correctas tampoco es sencillo. Alguien tiene que escribir qué aparece en cada foto, y como el criterio cambia de persona a persona, una misma foto termina con respuestas distintas. Por eso se fija un criterio por escrito y se comparan las decisiones de varias personas.
El ajuste importa más que el tamaño
Multiplicar el material por diez y ver que la capacidad sigue igual es algo que pasa seguido. Es porque lo que se agregó solo repitió lo que ya se hacía bien. Al revés, sumar un poco de material justo donde el modelo falla puede mejorar mucho las cosas.
Por eso, en vez de agrandar sin más, hoy se prefiere revisar dónde falla el modelo ahora y elegir material que llene ese hueco. Un fajo pequeño bien ajustado vence a un fajo enorme reunido al azar más seguido de lo que parece.
3Con más precisión
Un conjunto de datos es una colección de muestras ordenadas bajo un mismo formato, y cada muestra suele estar formada por varias características y una respuesta. Si trae respuesta, sirve para el aprendizaje supervisado; si no la trae, para el no supervisado. La proporción para dividirlo no es una regla fija, depende de la cantidad y la naturaleza del material, y cuando hay poco material se recurre a examinarlo por rondas rotando qué parte se usa cada vez. Si el material se acumula con el tiempo, no se mezcla al azar: se separa por período, porque predecir el pasado con material del futuro no corresponde a la situación real.
La analogía también tiene sus límites. La biblioteca presta sus libros uno por uno, pero el modelo no toma el material del conjunto de a una unidad: recorre todo el fajo muchas veces, ajustando sus números poco a poco cada vez. Y cuando termina el entrenamiento, el fajo original no queda dentro del modelo. Los libros de la biblioteca siguen en el estante, pero dentro de un modelo entrenado solo queda la tendencia extraída del material, no el material mismo.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que basta con tener muchos datos para tener un buen conjunto, pero en realidad un fajo inclinado hacia un solo lado produce un modelo inclinado por más grande que sea.
Es fácil creer que todo el material reunido debería usarse para entrenar, pero en realidad, si no se reserva una parte sellada para el examen, no queda forma de medir la capacidad.
Es fácil pensar que, terminado el entrenamiento, el material original queda dentro del modelo, pero en realidad lo que queda no es el material, sino la tendencia extraída de él.
7Resumen en una línea
En resumenUn conjunto de datos es el fajo de material reunido, depurado y dividido bajo una misma regla para enseñarle a la IA, y solo se aprende hasta donde ese fajo llega.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02