Visión por computadoraComputer Vision

La tecnología que hace que la computadora entienda fotos y videos

Puntos clave
  • La visión por computadora es la tecnología que convierte fotos y videos en una descripción que la computadora puede manejar.
  • Para la computadora, una foto no es un dibujo: es una tabla llena de números de color y brillo. Sacar significado de ahí es la parte difícil.
  • El procesamiento sube de lo pequeño a lo grande. De las diferencias de brillo saca los bordes, de los bordes los patrones, de los patrones los objetos.
  • Según qué se pregunte, cambia la forma de la respuesta. Qué es, dónde está y hasta dónde llega son tres tareas distintas.
  • Se equivoca en lugares distintos que una persona. Ante un ángulo o una luz que nunca vio, da con total seguridad una respuesta equivocada, incluso con una foto nítida.
Contenido

1La analogía

Delante de un cuadro en un museo hay un cartel explicativo al lado. El cartel no deja el cuadro como una mancha de pintura: lo traduce en palabras, "puerto al atardecer, tres barcos, un faro en el extremo izquierdo". Mirando el mismo cuadro, en cuanto se señala qué hay y dónde está, recién entonces se ve de verdad.

La visión por computadora es ese cartel. Para la computadora, una foto es solo una tabla de puntos de color muy apretados, y por sí sola no tiene ningún sentido. La visión por computadora tantea en ese montón de puntos los bordes y los patrones, y traduce a palabras qué hay, cuántos hay y más o menos dónde están. No es ponerle ojos a la computadora: es pegarle un cartel que convierte puntos en descripción.

2En detalle

Para la computadora, una foto es una tabla de números

Si se amplía mucho una foto en pantalla, aparecen pequeños cuadros alineados en cuadrícula. En cada cuadro hay un número que dice cuánto rojo, verde y azul se mezclaron, y una sola foto es esa tabla de números repetida en varios millones de casillas. Eso es exactamente lo único que recibe la computadora.

Una persona nunca vio esa tabla: el ojo agrupa por su cuenta y separa el fondo del objeto. La computadora tiene que construir ese proceso desde cero: calcula cuánto se diferencia un cuadro del de al lado y qué forma van dibujando esas diferencias, para encontrar los bloques.

De puntos a bordes, de bordes a objetos

El procesamiento no da un salto único: sube por capas. En la capa más baja solo se mira la diferencia de brillo entre cuadros vecinos. Si una fila entera muestra una diferencia marcada, es un borde. La siguiente capa mira cómo se juntan esos bordes: si se repiten en paralelo, es una franja; si se cierran en redondo, es algo circular.

Más arriba se mira cómo están colocados esos trozos entre sí. Cuando se acumula una disposición como "redondo arriba, con dos rayas horizontales y una columna vertical debajo", ya se acerca a un "qué". Las capas de abajo captan patrones que sirven para cualquier foto; las de arriba, rasgos que solo tiene ese objeto en concreto.

Hubo una época en la que una persona diseñaba estas capas una por una. Hoy se impuso el método de mostrar una gran cantidad de fotos de ejemplo y dejar que cada capa aprenda sola qué mirar, y el rendimiento subió mucho después de ese giro.

Según qué se pregunte cambia la forma de la respuesta

Con la misma foto, lo que se hace cambia por completo según qué se pregunte. Si se pregunta "qué es esta foto", sale una sola etiqueta para toda la foto. Si se pregunta "qué hay y dónde está", se dibuja un recuadro alrededor de cada objeto y se le pone nombre.

Si se pregunta "hasta dónde llega", se separa punto por punto entre objeto y fondo. Ahí entran funciones como borrar el fondo o cambiar de color solo un objeto en concreto. Aparte de estas, leer texto, medir a qué distancia está algo o seguir el mismo objeto en un video son ramas distintas.

Ya está metida en todas partes

El enfoque automático y el retoque de brillo de la cámara del teléfono, la función que arma álbumes sola en la galería de fotos, el desenfoque de fondo en una videollamada: todo eso es esta tecnología. También lo es que la barrera de un estacionamiento lea la matrícula, o que una fábrica separe sola los productos con defectos.

Está metida en lugares menos visibles: convertir en texto una foto de un documento, revisar el estado de las hojas en un cultivo. Muchas de las revisiones repetitivas que antes hacía el ojo humano pasaron especialmente a este terreno.

Donde se engaña y se equivoca

Aunque el rendimiento mejoró, se equivoca en lugares muy distintos a los de una persona. Ante un ángulo nunca visto, una luz desconocida o un objeto medio tapado, el resultado se desploma de golpe. Es conocido el experimento de pegarle a la foto un ruido tan fino que el ojo humano no lo nota y ver cómo la respuesta cambia por completo.

Lo más complicado es que, al equivocarse, tampoco duda. El cartel, en vez de decir que no sabe, pega una explicación que suena convincente. Por eso es importante decidir de antemano en qué lugares tiene que revisar sí o sí el ojo de una persona.

3Con más precisión

La visión por computadora es el nombre del campo entero que saca información con significado de una señal de imagen. Dentro caben ramas con metas distintas, como clasificación, detección, segmentación, seguimiento y estimación de profundidad. Durante mucho tiempo una persona diseñaba a mano las reglas para encontrar patrones, pero hoy los métodos basados en aprendizaje, empezando por las redes neuronales convolucionales (CNN, Convolutional Neural Network), son los que dominan, y últimamente también se usa mucho una estructura que se tomó prestada de cómo se procesa el texto y se adaptó a la imagen.

La analogía también tiene sus costuras. El cartel de un museo conoce el contexto en el que se pintó el cuadro y la intención del artista, y explica con eso. La visión por computadora no conoce el significado: solo mira la estadística de los patrones. Como en el caso conocido de un modelo que distinguía perro de lobo fijándose en si el fondo tenía nieve, no es raro que tome como pista un detalle que a una persona le parecería absurdo. Que la explicación suene convincente no significa que haya mirado lo mismo que miraría una persona.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que la computadora ve como una persona, pero en realidad calcula la disposición de números de brillo, así que se equivoca en lugares completamente distintos a los de una persona.

  • Es fácil pensar que con buena calidad de imagen se acierta mejor, pero en realidad, ante un ángulo o una luz que nunca vio, incluso una foto muy nítida puede dar una respuesta equivocada.

  • Es fácil pensar que encontrar una cara y saber de quién es son la misma tarea, pero en realidad detectar si hay algo y averiguar quién es son tareas distintas, con metas y métodos separados.

7Resumen en una línea

En resumenLa visión por computadora le pega un cartel a la foto, que para la computadora es solo una tabla de números, y lo traduce a un lenguaje que ella puede manejar: qué hay y dónde está.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02