Gaussian Splatting
Una escena 3D guardada en millones de manchas de color
- Gaussian Splatting junta fotos tomadas desde varios ángulos y guarda la escena 3D esparciendo millones de manchas de color en el espacio.
- Cada mancha es un fragmento ovalado, pequeño y difuso, con posición, tamaño, inclinación, color y transparencia. Al superponerse muchas, se ve como una escena real.
- Para dibujar en pantalla, cada mancha se aplana en la dirección desde donde se mira y se pinta de la más lejana a la más cercana. El cálculo es liviano y se puede recorrer en tiempo real.
- Persigue el mismo objetivo que NeRF —construir una escena a partir de varias fotos—, pero guarda el resultado como un montón de piezas visibles.
- Se puede seleccionar y borrar o mover cada pieza, así que es fácil de editar; a cambio, el archivo pesa mucho y los ángulos sin fotografiar salen manchados.
Contenido
1La analogía
Al pegar un mural de mosaico, se colocan teselas de colores una por una. Cada tesela es solo un pedacito de color, pero cuando miles de ellas ocupan su lugar, al alejarse la vista se ve un dibujo entero.
Gaussian Splatting pega esas teselas, pero flotando en el espacio vacío en lugar de sobre una pared. Cada pieza tiene una posición fija, un tamaño, una inclinación y un color. Los bordes no quedan cortados a cuchillo: se van aclarando hacia afuera. Como los bordes difusos se superponen entre sí, no se ven huecos entre pieza y pieza.
Al cambiar el punto de vista, las piezas se superponen de otra manera: las de adelante tapan a las de atrás, y al girar de lado, una pieza que se veía plana se alarga. No se están pegando teselas de nuevo: es el mismo montón de piezas, visto desde otro lugar.
2En detalle
El montón de piezas nace de varias fotos
Todo empieza con decenas de fotos del mismo objeto desde ángulos distintos. Primero se comparan las fotos entre sí para calcular desde dónde se tomó cada una, usando como pista los bordes que se repiten en varias imágenes.
Con la posición de la cámara resuelta, se esparcen piezas al azar en el espacio. Al principio están en lugares equivocados y con colores equivocados. Desde ese estado, se genera una imagen de cómo se vería el montón de piezas desde el mismo punto que la foto original, y se compara con la foto real.
Donde hay diferencia, se mueve la pieza, se cambia su tamaño, se corrige su color. Repetir esto decenas de miles de veces hace que las piezas terminen pegadas a la superficie del objeto. No es una persona pegando piezas: son las fotos las que deciden dónde va cada una.
El valor que guarda cada pieza
Una pieza no es una esfera, sino un óvalo aplanado. Guarda dónde está, qué tan grande es y hacia qué lado se estira, de qué color es y cuánto se transparenta por detrás.
En superficies planas como una pared o un piso bastan pocas piezas, bien aplanadas. En zonas con muchos detalles, como hojas o una malla metálica, se amontonan piezas pequeñas y densas. Como cada pieza cambia de forma según lo que hace falta, las zonas simples usan pocas y las complejas usan muchas.
Al dibujar, se aplasta y se pinta encima
Para mostrar la escena en pantalla, cada pieza se aplana en la dirección desde donde se mira y se proyecta sobre la pantalla. Luego se pintan en orden, de la más lejana a la más cercana. Si la pieza de adelante es semitransparente, el color de atrás se filtra y se mezcla; si es opaca, tapa lo de atrás.
Este método no sigue el camino de la luz punto por punto, así que es muy rápido. Por eso la escena no se traba al girarla con el mouse. Que se pueda recorrer en tiempo real es la razón de que este método se haya extendido tan rápido.
Se agregan y se borran piezas para afinar el resultado
Mientras se construye, la cantidad de piezas cambia todo el tiempo. Donde el ajuste con las fotos no cuadra, una pieza se divide en dos o se agrega una nueva. Al revés, una pieza que se volvió casi transparente y ya no aporta nada se borra.
Al terminar, el número de piezas va de cientos de miles a varios millones, según la escena. Como cada pieza guarda varios valores, el archivo resulta bastante pesado. A cambio, como las piezas son un bloque visible, después se puede editar seleccionando o moviendo solo una parte.
Dónde se separa de NeRF
Ambos métodos construyen, a partir de varias fotos, una escena que se puede ver desde cualquier ángulo. Lo que los separa es en qué guardan el resultado. Splatting lo guarda como un montón de piezas visibles; NeRF lo guarda como una regla de cálculo que devuelve un valor de luz al recibir un punto y una dirección del espacio.
Por eso también cambia cómo se dibuja. Splatting aplasta y pinta encima; NeRF lanza una línea de visión por cada punto de la pantalla y pregunta el valor varias veces a lo largo de esa línea. El que pregunta más veces es el más lento.
3Con más precisión
Cada pieza es una gaussiana tridimensional: una distribución con forma de campana, densa en el centro y cada vez más tenue hacia afuera. Gracias a que el borde no se corta de golpe sino que se desvanece poco a poco, con que se superpongan unas pocas piezas la superficie ya se ve pareja. Al dibujar, esta distribución tridimensional se aplana hacia la cámara para volverla plana, y luego se mezclan color y transparencia en orden, de la más lejana a la más cercana.
El color de una pieza no es fijo. Guarda también valores según la dirección desde donde se mira, así que puede cambiar un poco de color según el ángulo, lo que permite que sobreviva algo del reflejo del metal o del vidrio.
La analogía también tiene grietas. Las teselas de un mosaico las pega una persona siguiendo un diseño; aquí, en cambio, son las propias piezas las que se mueven solas para reducir la diferencia entre la foto y la imagen generada. Las teselas son opacas y no se superponen; las piezas sí, en varias capas semitransparentes. Y un mosaico es un dibujo fijo en la pared, mientras que el montón de piezas es una escena que se redibuja cada vez, según desde dónde se mire.
4Pruébalo
- Visor de Gaussian Splatting (recorrer una escena en 3D) ailearn.space Gira la escena con el mouse y acércate. Cada pieza empieza a verse como lo que es, una mancha
- SuperSplat (editor de Gaussian Splatting) ailearn.space Selecciona y borra manchas sueltas con tus propias manos y sentirás que la escena es, literalmente, un montón de piezas
5Malentendidos comunes
Es fácil pensar que es un escaneo 3D que marca puntos con láser, pero en realidad se construye moviendo, agrandando y borrando piezas a partir de fotos comunes comparadas entre sí.
Es fácil pensar que se ve perfecto desde cualquier ángulo, pero en realidad, en los ángulos que no se fotografiaron, las piezas se separan y aparecen manchas o motas flotantes.
Es fácil pensar que es solo otro nombre para NeRF, pero en realidad tanto la forma de guardar la escena como la forma de dibujarla son distintas.
7Resumen en una línea
En resumenGaussian Splatting toma varias fotos, asienta millones de manchas de color en el espacio y las dibuja superpuestas desde cualquier ángulo, como una forma de representar escenas en 3D.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02