CNNConvolutional Neural Network
La red que encuentra patrones en fotos, capa por capa
- CNN (Convolutional Neural Network, red neuronal convolucional) es una estructura de red pensada para tratar fotos. No mira la imagen completa de un vistazo y decide de una vez.
- Alternan capas que recorren la foto en busca de patrones con capas que resumen y reducen el resultado.
- Las capas iniciales reconocen detalles finos como líneas y bordes; las capas finales reconocen piezas grandes como ruedas o marcos de ventana.
- Usan el mismo panel en toda la foto, así que reconocen un objeto sin importar en qué parte de la imagen esté.
- No sirve solo para fotos: también se usa con sonido convertido en imagen y con videos cortos.
Contenido
1La analogía
En una panadería no basta con dejar un saco de trigo frente a una sola máquina para que salga el pan. Hay una fila de máquinas: una que muele, otra que amasa, otra que le da forma a la masa y otra que la hornea. Cada máquina recibe solo lo que le entrega la anterior y hace su parte. Nadie mira el saco de trigo y adivina la forma del pan, pero paso a paso el trigo se vuelve harina, la harina se vuelve masa, y la masa termina siendo pan.
La CNN funciona como esa fila de máquinas. En vez de mirar una foto y decir de inmediato qué es, la hace pasar varias veces por capas que buscan detalles finos y capas que resumen el resultado. Cada capa solo usa lo que le entregó la anterior, y la etiqueta final aparece hasta el final del recorrido. Igual que en la panadería, si se quita una sola máquina no sale el pan; si se aísla una sola capa, es difícil saber qué hacía.
2En detalle
Las primeras capas ven detalles finos
Lo que hace la primera capa que recibe la foto es sorprendentemente simple: coloca un panel muy pequeño sobre la imagen y solo se fija en si el brillo cambia de golpe o si hay una línea inclinada en ese punto. Como el panel es pequeño, el área que examina de una vez es diminuta. En esta etapa todavía no hay ni autos ni perros: solo líneas cortas y manchas.
Estos detalles finos se convierten en el material de la siguiente capa. La segunda capa no mira la foto original, sino la disposición de detalles que encontró la primera, y agrupa dos líneas cortas que se cruzan en ángulo recto como una esquina, o una línea corta que se curva como un borde. La tercera capa vuelve a agrupar esas esquinas y bordes para reconocer piezas como ruedas, marcos de ventana o manijas.
Cuanto más se sube de capa, más se ensancha también el área real que un panel recorre en la foto original: las primeras capas ven un punto diminuto y las últimas ven casi la mitad de la imagen de una vez. Por eso el juicio de "esto es un auto" solo es posible cuando ya se reunieron todas las piezas.
El mismo panel se usa en toda la foto
Aquí está la razón por la que la CNN encaja tan bien con las fotos. El panel que busca líneas verticales en la esquina superior izquierda es el mismo panel que las busca en la esquina inferior derecha. No hay un panel distinto para cada lugar.
Esto trae dos ventajas. Primero, un objeto se reconoce con el mismo patrón sin importar si está a la izquierda o a la derecha de la foto; de ahí viene la capacidad de reconocerlo aunque la foto esté tomada con un pequeño desplazamiento. Segundo, se reduce enormemente lo que hay que recordar: si cada lugar de la foto tuviera su propio panel, los valores se dispararían sin control, pero al reutilizar un solo panel eso no ocurre.
Recorrer y reducir se alternan
Si solo se recorriera la foto, la imagen que hay que manejar no se reduciría nunca. Por eso, después de recorrer, se resume una vez. Al agrupar casillas vecinas y quedarse solo con un valor representativo, la imagen se reduce a la mitad y las capas siguientes pueden ver de un vistazo un área más amplia.
Recorrer, reducir, recorrer, reducir: repetir este compás dos veces, o decenas de veces, es el esqueleto de la CNN. Cuanto más se repite, más pequeña se vuelve la imagen y más denso el significado que contiene. Lo que empezó siendo una imagen ancha y delgada termina siendo un paquete de valores pequeño y grueso.
Al final aparece la etiqueta
Al llegar a la última capa, lo que queda es un paquete de valores pequeño que describe qué piezas había en esta foto y cuánto de cada una. Aquí la información de posición casi desaparece y solo queda el carácter general. Este paquete se compara con la lista de etiquetas posibles, se le da un puntaje a cada nombre de la lista, y se elige el más alto como respuesta.
Con el mismo esqueleto, a veces solo se cambia la parte final para hacer otra tarea. Si al final se hace que salgan la posición y el tamaño de un recuadro en vez de un puntaje, la tarea se convierte en encontrar objetos y marcarlos con recuadros; si se hace que salga una etiqueta por cada punto, se convierte en recortar por punto. Es común dejar igual la parte que extrae patrones y cambiar solo el final.
3Con más precisión
La CNN es una red formada por capas convolucionales, capas de pooling y, al final, capas densamente conectadas. La capa convolucional desplaza un panel pequeño de valores sobre la foto, multiplica y suma los valores de las casillas superpuestas, y coloca ese resultado en su misma posición para formar una nueva imagen. Los valores del panel no los define una persona: se fijan durante el entrenamiento.
La analogía de la panadería también tiene sus costuras. Las máquinas de una panadería siguen un orden que alguien programó de antemano, pero cada capa de la CNN empieza en blanco sobre qué va a buscar. Al ver muchísimas fotos con la respuesta correcta y corregir un poco los valores del panel según cuánto se equivocó, surge por sí sola una división del trabajo: las primeras capas terminan a cargo de los detalles finos y las últimas de las piezas. Nadie le dijo a la primera capa que buscara líneas verticales.
Otra cosa: hoy también se usan mucho otras estructuras que cortan la foto en trozos y los comparan entre sí. La CNN no es la única respuesta para procesar fotos, pero en dispositivos pequeños o en el navegador sigue siendo el esqueleto más usado.
4Pruébalo
- CNN Explainer (explicación visual de la CNN) ailearn.space Haz clic en cada capa para ver en qué imagen se convierte la foto al pasar por ella
- Visualización 3D de una CNN (reconocimiento de dígitos escritos a mano) ailearn.space Gira en 3D el proceso completo mientras un número que dibujas tú se va identificando capa por capa
5Malentendidos comunes
Es fácil pensar que la CNN ve la foto completa de un vistazo, como una persona, pero en realidad recorre desde un punto diminuto y va ampliando la vista poco a poco.
Es fácil pensar que más capas siempre es mejor, pero en realidad, si faltan datos, una estructura muy profunda tiende solo a memorizar y se tambalea ante fotos nuevas.
Es fácil pensar que la CNN es exclusiva para fotos, pero en realidad se usa con cualquier dato donde los puntos vecinos estén relacionados, como el sonido convertido en imagen o los videos cortos.
7Resumen en una línea
En resumenLa CNN apila capas que recorren la foto buscando patrones con capas que resumen el resultado, subiendo de detalles finos a piezas y de piezas a una etiqueta, en una estructura pensada para fotos.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02