Pooling
El paso que reduce la imagen dejando solo un valor por zona
- El pooling es el paso que divide en zonas la imagen que dejó el recorrido y se queda con un solo valor por zona para reducir su tamaño.
- La forma más común es quedarse con el valor más alto de la zona. También se usa la que saca el promedio.
- Al reducir el tamaño, la capa siguiente ve de un vistazo un área más amplia, y bajan a la vez el cálculo y la memoria que hacen falta.
- Aunque el objeto se desplace una o dos casillas, el valor representativo apenas cambia, así que el resultado se sacude menos con fotos movidas.
- A cambio, se pierde en qué casilla exacta estaba ese valor. Conviene tener cuidado en tareas que necesiten posiciones muy finas.
Contenido
1La analogía
Junto a la puerta de entrada de una casa hay un panel de interruptores en la pared. Cada habitación tiene una sola casilla, y si la luz de esa habitación está encendida, se prende una lucecita en esa casilla. Aunque el techo de la sala tenga seis focos, la casilla sigue siendo una sola: basta con que uno solo de los seis esté encendido para que esa casilla se ilumine.
El panel reproduce la distribución de la casa: la casilla de arriba a la izquierda es la entrada, la de abajo a la derecha es el dormitorio principal. Por eso, con solo mirar el panel, se sabe de un vistazo en qué parte de la casa hay luces encendidas, sin tener que recorrer habitación por habitación revisando veinte focos.
Pero también se pierde algo. Con solo mirar el panel, no hay forma de saber cuál de los seis focos de la sala está encendido: una sola casilla representa toda la habitación. Eso mismo es lo que el pooling le hace a una imagen.
2En detalle
Se divide en zonas y se guarda solo un representante
El pooling recibe la imagen que dejó el recorrido y empieza a partir de ahí. La divide en bloques cuadrados de dos casillas por lado y elige un solo valor en cada bloque. Al pasar de cuatro casillas a una, el ancho y el alto se reducen a la mitad cada uno, y el área total baja a un cuarto.
Qué usar como representante suele ser una de dos cosas. Una es tomar el valor más alto entre las cuatro casillas: así solo queda cuánto de marcado estaba el patrón en algún punto de esa zona, sin perder de vista lo que más se destaca. La otra es sacar el promedio de las cuatro casillas, lo que deja un reflejo más suave del ambiente general de la zona.
En el pooling no hay valores que se ajusten con el entrenamiento. A diferencia del recorrido, no tiene números escritos en un panel, solo una regla para elegir. Por eso la capa de pooling reduce la imagen sin sumar ni un solo valor más que recordar.
Reducir permite ver más ancho
Reducir el tamaño tiene su razón de ser. El panel de la capa siguiente mantiene el mismo tamaño, pero si la imagen se reduce a la mitad, el área que ese mismo panel cubre en la foto original se duplica. Repetir esto varias veces hace que un panel que al principio veía un punto diminuto termine, más adelante, recorriendo de una vez buena parte de la foto.
También se ahorra mucho cálculo y memoria. Si la imagen se reduce a un cuarto, el trabajo de la capa siguiente baja en la misma proporción. Es una de las razones por las que se pueden apilar muchas capas y aun así todo funcione en un navegador o en un dispositivo pequeño.
Aunque se mueva un poco, el resultado no cambia
El pooling trae un beneficio extra. Como solo se guarda el valor más alto dentro de la zona, si el patrón se corre una casilla dentro de esa zona, el valor representativo sigue siendo el mismo. De ahí viene la fuerza para que el resultado no cambie mucho cuando la foto tiembla un poco o el objeto queda en una posición ligeramente distinta.
Esa misma propiedad se vuelve una debilidad. Al quedarse solo con el valor representativo, se pierde de qué casilla exacta de la zona vino. Para reconocer un objeto no hay problema, pero en tareas que necesitan trazar un borde punto por punto, esa precisión perdida se nota como una pérdida real. Por eso, en trabajos finos, se suele agrandar de nuevo la imagen reducida y combinarla con la imagen detallada que se guardó en una etapa anterior.
El pooling no es la única forma de reducir
En las estructuras actuales, a veces no se pone una capa de pooling aparte, sino que se reduce el tamaño haciendo que el recorrido salte de a dos casillas. Como incluso la forma de reducir queda sujeta al entrenamiento, a veces encaja mejor.
En el otro extremo, al final se suele usar un pooling bastante drástico: se toma toda la imagen que queda como una sola zona y se saca un solo promedio. Al comprimir la imagen a un solo valor, la posición desaparece por completo y solo queda el hecho de que "este patrón estaba en algún lugar de la foto". Es una escena habitual justo antes del último paso, el que elige la etiqueta.
3Con más precisión
El pooling es una operación que desplaza una ventana de tamaño fijo sin superponerla y reduce a uno los valores dentro de esa ventana. Lo más común es que tanto el tamaño de la ventana como el paso midan dos casillas; si se elige el valor máximo se llama pooling máximo, y si se saca el promedio, pooling promedio. Como no tiene valores que se entrenen, no aumenta el número de parámetros, pero sí queda dentro del grafo de cálculo y la señal de aprendizaje pasa a través de él. En el pooling máximo, la señal solo regresa hacia la casilla que fue elegida.
La analogía del panel de interruptores también tiene sus costuras. Una lucecita solo tiene dos estados, encendida o apagada, pero el valor representativo que deja el pooling es un número con magnitud. Además, las casillas del panel las definió una persona según la distribución real de la casa, pero las zonas del pooling se cortan de forma mecánica, según la cuadrícula, sin importar el significado; es habitual que el borde de un objeto quede partido justo por la mitad. Y aunque un valor se descarte, la influencia que ese valor generó no desaparece del todo, porque en el recorrido anterior las casillas vecinas ya se habían mezclado entre sí.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que el pooling comprime y guarda la información, pero en realidad es un paso que simplemente descarta los valores que no elige, y eso no se puede deshacer.
Es fácil creer que el pooling también tiene valores que se entrenan, pero en realidad solo tiene una regla de selección, sin ningún número que se ajuste.
Es fácil pensar que cuanto más pooling, mejor, pero en realidad, si se reduce demasiado, los objetos pequeños o las líneas finas pueden desaparecer por completo.
7Resumen en una línea
En resumenEl pooling divide la imagen en zonas y guarda un solo valor representativo por zona, reduciendo tamaño y cálculo y haciéndola menos sensible a pequeños movimientos, a cambio de ceder precisión de posición.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02