IA generativa Intermedio

Espacio latenteLatent Space

El lugar donde se ubican los valores comprimidos de los datos

Puntos clave
  • El espacio latente es el lugar completo donde se ubican los valores en los que un dato queda comprimido.
  • El lugar tiene sentido propio: lo que está cerca se parece, y lo que queda lejos, es distinto.
  • Nadie decide a mano cómo se reparte el espacio. Es un criterio que se fija solo, durante el entrenamiento.
  • Caminar entre dos posiciones produce resultados que van cambiando de a poco.
  • Salirse mucho de la zona donde están los datos de entrenamiento da un resultado irreconocible.
Contenido

1La analogía

Un cajón con divisiones no guarda las cosas en cualquier lado. Lo largo va en la fila de la izquierda, lo corto en la de la derecha, lo redondo en la fila de adentro, lo anguloso en la de adelante: cada lugar tiene un carácter fijo. Al abrir el cajón, sin mirar cada objeto uno por uno, ya se puede intuir qué hay más o menos en cada zona.

En este cajón, el lugar mismo es información. Los objetos de casillas vecinas se parecen en algo; los de las puntas opuestas del cajón son completamente distintos.

Cuantas más divisiones se agreguen, más fino queda el reparto. Si se mete una casilla nueva entre dos que ya existían, ahí va a caer algo a medio camino entre los dos objetos vecinos. El espacio latente es un cajón así.

2En detalle

El lugar es, en sí mismo, la propiedad

Un modelo no trabaja directamente con una foto o una frase tal cual. Primero las reduce a un grupo corto de números. Ese grupo de números corresponde a un lugar dentro del cajón, y el conjunto de todos los lugares posibles que puede ocupar un valor comprimido es el espacio latente.

Cada lugar lleva pegados varios números. A diferencia de un cajón con solo dos direcciones, aquí hay de decenas a cientos de direcciones. Es difícil imaginarlo en la cabeza, pero medir la distancia entre dos lugares o moverse siguiendo una dirección se puede hacer igual.

Lo importante es que estos lugares no están tirados al azar. Repetir el ejercicio de comprimir hace que los datos parecidos terminen ubicados cerca, porque ordenarlos así conviene a la hora de reconstruir.

Lo cercano se parece, lo lejano es distinto

Fotos del mismo tipo terminan en lugares vecinos. No porque los píxeles se parezcan, sino porque se parece la propiedad que el modelo consideró importante. Puede pasar que el fondo sea completamente distinto y aun así queden cerca, si el objeto fotografiado es el mismo.

Esta propiedad se usa para buscar. Se reduce el dato que se busca de la misma forma para hallar su lugar, y se sacan los que están cerca de ahí. Se puede encontrar algo con una propiedad parecida aunque el nombre o el texto no coincida en nada.

Las direcciones también adquieren sentido

Cuando los lugares quedan ordenados, las direcciones también empiezan a seguir una regla. Moverse un poco en cierta dirección aclara el resultado; moverse en otra, lo hace parecer mayor. Por eso se vuelve posible cambiar una sola propiedad a la vez.

Eso sí, estas direcciones no las definió nadie de antemano. Se encuentran después de que el entrenamiento terminó, moviéndose de un lado a otro por prueba, así que no vienen separadas en compartimentos limpios. Es común que, al intentar cambiar el brillo, el fondo también cambie sin querer.

Tomar un punto intermedio da un resultado intermedio

Si se toman las posiciones de dos datos y se camina entre ellas a intervalos regulares, generando algo en cada paso, aparecen escenas que van cambiando poco a poco de una a otra. No es lo mismo que superponer dos imágenes y mezclarlas de forma borrosa: el resultado de cada punto intermedio es, por sí solo, algo completo.

Para que esta caminata funcione bien, hace falta que el espacio entre posiciones esté bien relleno. Si cada dato deja solo un punto suelto y el resto queda vacío, en el medio sale algo irreconocible. Por eso surgieron los métodos que guardan cada dato como un rango en vez de como un punto.

Fuera de la zona, no hay nada

Que el espacio latente sea amplio no significa que cualquier lugar sirva. Hay una zona donde se acomodaron los datos de entrenamiento, y fuera de esa zona no se practicó nunca. Sacar un valor de ahí afuera da un resultado deformado o sin ningún sentido.

Es como poner un objeto en el piso vacío, fuera de las divisiones del cajón. El lugar existe, pero nadie definió jamás qué significa. Por eso, al generar algo nuevo, no se saca cualquier valor al azar: se saca de cerca de la zona donde se juntan los datos de entrenamiento.

3Con más precisión

El espacio latente es el espacio de muchas dimensiones donde se ubican los vectores que resultan de comprimir la entrada. Cada eje no es una categoría que alguien haya definido, sino un valor que quedó fijado durante el entrenamiento, y un solo eje no corresponde necesariamente a una propiedad reconocible por una persona. Para ver la relación entre dos posiciones, se mide la distancia en línea recta entre ambas o el ángulo entre sus direcciones.

La analogía también tiene grietas. Las casillas de un cajón se tocan con la mano y las divisiones las pone una persona, pero los lugares del espacio latente son valores continuos, sin marcas, y nadie sabe con qué criterio quedaron repartidos. El cajón tiene solo dos direcciones, pero en la realidad hay cientos, así que la noción de distancia que usamos todos los días deja de funcionar bien en algunos rincones.

Un punto más: el espacio latente se arma por separado en cada modelo. La misma foto, metida en otro modelo, cae en un lugar completamente distinto. Por eso un valor calculado en un modelo no se puede llevar tal cual a otro.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que cada eje del espacio latente se encarga de una sola propiedad, como el color o el tamaño, pero en realidad varias propiedades quedan mezcladas en un mismo eje, así que no es fácil cambiar una sola a voluntad.

  • Es fácil pensar que un lugar cercano significa que se parecen en apariencia, pero en realidad es cercano en la propiedad que el modelo consideró importante, y la apariencia puede diferir bastante.

  • Es fácil pensar que cualquier lugar del espacio da un resultado verosímil, pero en realidad, fuera de la zona donde se juntan los datos de entrenamiento, sale algo difícil de reconocer.

7Resumen en una línea

En resumenEl espacio latente es el lugar donde se ubican los valores comprimidos, y como el lugar y la dirección llevan una propiedad pegada, se puede buscar algo parecido o generar algo intermedio.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02