Datos sintéticosSynthetic Data

Datos de práctica creados en lugar de los reales

Puntos clave
  • Los datos sintéticos son datos que no ocurrieron de verdad, sino que se crearon porque hacían falta.
  • Se crean por tres motivos: porque faltan datos reales, porque son difíciles de conseguir, o porque contienen información personal.
  • Se pueden generar en la cantidad que se quiera y ya se conoce la respuesta correcta, así que no hace falta el trabajo de etiquetarlos.
  • A cambio, queda un margen que se aleja de lo real. Lo que no se metió al crearlos, directamente no existe.
  • Si se usan datos creados para generar más datos, una y otra vez, se alejan cada vez más de lo real. Por eso se mezcla una porción fija de datos reales.
Contenido

1La analogía

Hay dos formas de poner césped en una cancha. Una es plantar pasto de verdad. Hay que esperar a que arraigue, se hunde cuando llueve y se deteriora con el uso. Exige mucho trabajo, pero a cambio tiene una sensación al pisarlo que nada más reemplaza.

La otra es instalar césped sintético. Se pide la cantidad que se necesite y se instala en un día, se puede usar aunque llueva y aguanta el uso sin deteriorarse. Los datos sintéticos son ese césped sintético.

El césped sintético también tiene sus puntos donde se queda corto. La pelota rueda a otra velocidad y la sensación al resbalar es distinta. Un equipo que solo entrenó sobre césped sintético tropieza cuando pisa una cancha de pasto real. Y la textura del césped sintético, al final, se diseñó copiando al pasto real. Sin un original real de referencia, ni siquiera se sabría qué imitar.

2En detalle

Por qué se crean y se usan

El motivo más común es que faltan datos reales. Cuanto más raro es un suceso, más difícil es reunir datos sobre él. El momento exacto en que una máquina se rompe, o una situación muy peligrosa, no se puede vivir a menudo, y justamente para esos casos hace falta un modelo que responda bien.

El segundo motivo es que los datos contienen información de personas. En campos donde no se puede usar el registro real tal cual, a veces se crean datos nuevos que solo imitan las propiedades estadísticas. Lo clave, en este caso, es que no se pueda rastrear de vuelta hasta ninguna persona en concreto.

El tercer motivo es el trabajo de poner las respuestas correctas. Etiquetar a mano cuesta mucho tiempo y dinero. Los datos creados ya vienen con la respuesta, porque se sabe de antemano qué se generó.

Cómo se crean

El método más simple es construirlos con reglas. Se anota de antemano en qué rango y de qué manera debe salir cada valor, y se generan siguiendo esa regla al pie de la letra. Es fácil de manejar porque se sabe exactamente qué se creó, pero cualquier propiedad que no esté anotada en la regla simplemente no aparece en los datos.

El otro método es crearlos imitando datos reales. Un modelo entrenado con datos reales genera cosas parecidas a esos datos. Las imágenes y el texto suelen usar mucho este método. A cambio de obtener datos más cercanos a lo real, hay que tener presente que las propiedades del material original se trasladan tal cual.

Esto se distingue de retorcer un poco los datos que ya se tienen para estirarlos. Dar vuelta una foto o cambiarle el brillo es un retoque donde el dato original sigue estando ahí; los datos sintéticos, en cambio, son crear algo que antes no existía.

Lo importante es conocer dónde se aleja de lo real

Los datos creados solo contienen el mundo que imaginó quien los creó. Las excepciones que no se metieron en la regla, los valores raros que aparecen pocas veces en los datos reales, las entradas disparatadas que la gente comete de verdad: casi todo eso queda afuera. Un modelo entrenado solo con estos datos rinde bien en situaciones prolijas, pero tropieza seguido al salir al terreno real.

La uniformidad también es una trampa. El césped sintético se siente igual se pise donde se pise, pero el pasto real cambia de un lugar a otro. Los datos creados suelen parecerse demasiado entre sí, así que la cantidad aumenta pero lo que el modelo tiene para aprender no crece igual. Por eso conviene revisar primero qué tan distintos son entre sí, antes que la cantidad.

Por eso la evaluación siempre se hace con datos reales. Si se entrena con datos creados y se evalúa también con datos creados, parece que rinde bien, pero ese puntaje solo vale dentro de la imaginación de quien los creó.

Cuando lo creado se vuelve a imitar

Lo que más cuidado hay que tener es con la retroalimentación. Si un modelo entrenado con datos creados vuelve a crear datos, y con esos datos se entrena de nuevo, y esto se repite, el resultado se aleja de lo real poco a poco. Es como mirar una foto de césped sintético para fabricar el siguiente césped sintético, y volver a copiar ese resultado una vez más.

Este alejamiento tiene un orden. Primero desaparecen los casos raros: solo quedan las formas comunes y se borra lo que estaba en los rincones. Después, incluso lo que queda se va pareciendo cada vez más entre sí. Por eso, en la práctica, se sigue mezclando una porción fija de datos reales, y se deja registrado qué proporción del total son datos creados.

3Con más precisión

Los datos sintéticos no borran del todo el problema de la privacidad. Si el modelo que los crea memorizó de más algún registro particular de los datos reales, ese registro puede reaparecer casi tal cual dentro de los datos generados. Por eso se agrega un paso aparte para revisar cuánto se superponen los datos creados con el original.

Hay un punto donde la analogía se queda corta. El césped sintético se distingue del real a simple vista, pero unos datos sintéticos bien hechos son difíciles de distinguir para el ojo humano. Como esa diferencia no se ve, se confirma de manera indirecta: dibujando la distribución de los valores junto a la de los datos reales, o evaluando solo con datos reales.

También conviene tener presente el peso que debe tener su uso. Los datos sintéticos funcionan mejor como un complemento para llenar lo que falta o cubrir situaciones poco frecuentes, más que como un reemplazo total de los datos reales. Si se cubre por completo con datos creados un lugar donde no hay ningún dato real, desaparece la manera de confirmar qué se estaba imitando, y ni siquiera se puede medir cuánto se alejó. Por eso, dejar anotado en la descripción de los datos cuánto se usó de material creado y a partir de qué se generó se ha vuelto, en la práctica, casi una regla.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que cuantos más datos sintéticos se creen, mejor, pero en realidad, si se parecen demasiado entre sí, la cantidad aumenta sin que el modelo aprenda más.

  • Es fácil pensar que los datos creados no tienen sesgo, pero en realidad heredan tal cual la inclinación del material original y de las reglas que fijó quien los creó.

  • Es fácil pensar que usar datos sintéticos elimina la preocupación por la privacidad, pero en realidad pueden aparecer fragmentos memorizados del original tal cual, así que hay que revisar aparte cuánto se superponen.

7Resumen en una línea

En resumenLos datos sintéticos son datos de práctica creados en lugar de los reales, y sirven bien para llenar lo que falta, pero la evaluación siempre debe hacerse con datos reales.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02