NeRFNeural Radiance Field
Una escena en 3D que responde con luz a un lugar y una dirección
- NeRF junta fotos tomadas desde varios ángulos y convierte la escena en una sola regla de cálculo que responde preguntas.
- Lo que se pregunta es qué punto del espacio y desde qué dirección se mira; lo que responde es el color y la densidad de ese punto.
- Para pintar una imagen, cada punto de la pantalla lanza una línea de visión, pregunta cientos de veces a lo largo de esa línea y acumula las respuestas de adelante hacia atrás para fijar el color.
- Como pregunta también por la dirección, capta reflejos que cambian con el ángulo, como los del vidrio o el metal.
- Comparte el objetivo de Gaussian Splatting: construir una escena 3D con varias fotos. La diferencia es que guarda el resultado como una regla, no como un montón de piezas.
Contenido
1La analogía
Un faro visto desde el mar de noche cambia de brillo según el ángulo. De frente, deslumbra; de costado, se ve apagado. Fijado un punto del faro y una dirección de mirada, la luz que llega al ojo queda determinada.
NeRF no guarda la escena como una foto ni como una maqueta. Supone que en cada punto del espacio hay un farito diminuto, y guarda solo un mostrador de información que responde: si miras desde este punto hacia aquella dirección, ¿qué luz sale y con qué intensidad?
Para ver la escena, cada punto de la pantalla lanza una línea de visión hacia adentro. En cada punto de esa línea se le pregunta al mostrador, y las respuestas se acumulan de adelante hacia atrás para fijar el color de ese punto. La imagen terminada no está guardada en ningún lado: se dibuja de nuevo cada vez que se mira.
2En detalle
Se entrena al mostrador con decenas de fotos
El material son decenas de fotos del mismo objeto tomadas desde ángulos distintos. Primero se calcula desde dónde se tomó cada foto, y desde ese punto se lanza una línea de visión hacia cada punto de la imagen.
Al principio el mostrador responde cualquier cosa. Si se arma una imagen con esas respuestas, sale muy distinta de la foto original. Esa diferencia se usa para corregir, poco a poco, la costumbre de respuesta del mostrador.
Repetir esto cientos de miles de veces hace que el mostrador termine respondiendo casi igual que las fotos, en los puntos y direcciones que sí fueron fotografiados. Y entonces, al preguntar por un punto nunca fotografiado, sale una respuesta verosímil: los ángulos vacíos entre foto y foto quedan rellenados.
El mostrador responde color y densidad
Al preguntar se entregan dos cosas: qué punto del espacio y desde qué dirección se mira. La respuesta también trae dos cosas: el color de la luz que sale de ese punto y qué tan lleno está ese punto.
La densidad funciona como la niebla. Si el valor es casi cero, es aire vacío y la línea de visión pasa de largo; si el valor es alto, es una superficie sólida y ahí se detiene. Nadie tiene que indicar dónde está la superficie: el punto donde la densidad sube de golpe es, justamente, la superficie.
Se acumulan las respuestas a lo largo de la línea para pintar un punto
Para pintar un punto de la pantalla, se lanza una línea de visión hacia la escena desde ese punto. Sobre esa línea se toman decenas o cientos de posiciones, y en cada una se le pregunta al mostrador.
Las respuestas se acumulan de adelante hacia atrás. Si más adelante ya salió una respuesta densa, el color de más atrás queda tapado y casi no cuenta; si adelante estaba vacío, el color de atrás pasa entero. La suma de todo esto es el color final de ese punto.
Pintar una imagen completa exige repetir esto en todos los puntos de la pantalla. Con cientos de preguntas por punto, el total se dispara. De ahí viene la fama de NeRF como algo lento.
La respuesta cambia según la dirección
Un mismo punto puede cambiar de color según desde dónde se mire: el reflejo de un vaso de vidrio, el brillo del metal, la luz que rebota en un piso mojado. Por eso al preguntar se entrega también la dirección.
Si se pregunta solo por el punto y se deja fuera la dirección, una superficie brillante sale plana, como pintura mate. Si se incluye la dirección, el reflejo se mueve al girar la cabeza, y la sensación se vuelve real. A cambio, en ángulos con pocas fotos esta libertad se vuelve un problema: aparecen manchas parecidas a niebla en el aire vacío.
Dónde se separa de Gaussian Splatting
Gaussian Splatting hace lo mismo a partir de varias fotos. La diferencia está en qué guarda como resultado. Splatting guarda un montón de piezas esparcidas por el espacio, un objeto que se puede ver; NeRF guarda una regla de cálculo que responde según el punto y la dirección.
Por eso Splatting solo tiene que estampar las piezas en la pantalla, así que es rápido, mientras que NeRF tiene que preguntar cientos de veces por cada línea de visión, así que es lento. A cambio, NeRF es más fuerte con la niebla o el vidrio translúcido, cosas sin una superficie definida.
3Con más precisión
NeRF significa Neural Radiance Field (campo de radiancia neuronal). Quien hace de mostrador es una red neuronal de tamaño modesto, entrenada para devolver color y densidad a partir de un punto y una dirección, y se entrena una red distinta para cada escena. El cálculo que mezcla los valores de la línea de visión de adelante hacia atrás para fijar un color se llama renderizado por volumen. Cuantas más posiciones se toman a lo largo de cada línea, más fino sale el resultado, pero también sube el costo de calcularlo, así que en la práctica se busca un punto intermedio entre nitidez y velocidad.
La analogía también tiene sus grietas. Un faro emite su propia luz, pero el color que responde el mostrador no nace ahí: es el resultado de una luz que viene de otro lado y pasa por ese punto. Por eso NeRF, en su forma básica, no puede cambiar la iluminación y volver a dibujar la escena. Además, los faros son pocos y están fijos en un puerto, pero aquí las respuestas existen en cualquier punto del espacio, sin un número fijo, y el mostrador solo es confiable cerca de los ángulos que cubrieron las fotos de entrenamiento.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que NeRF entrega un archivo de modelo 3D, pero en realidad solo entrega una regla de cálculo, difícil de llevar tal cual a un videojuego o a un programa de 3D.
Es fácil pensar que bastan unas pocas fotos, pero en realidad hacen falta decenas de fotos repartidas alrededor del objeto, y los ángulos que faltan salen deformados.
Es fácil pensar que Gaussian Splatting lo dejó obsoleto, pero en realidad NeRF sigue siendo fuerte en escenas de bordes difusos, como la niebla o los objetos translúcidos.
7Resumen en una línea
En resumenNeRF no guarda la escena como una imagen, sino como una regla que responde qué luz se ve desde este punto y esta dirección, y acumula esa respuesta cada vez que se mira para dibujarla de nuevo.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02