Perceptrón multicapaMultilayer Perceptron
Red neuronal básica hecha de varias filas de detectores simples
- El perceptrón multicapa es una red neuronal formada por varias filas de un detector muy simple, apiladas una sobre otra. Es la estructura básica con la que se empieza a estudiar las redes neuronales.
- Lo único que hace cada unidad es multiplicar cada valor recibido por un tamaño fijo, sumarlo todo y curvar el resultado una vez.
- Las filas de más atrás no ven los datos originales. Solo reciben las puntuaciones que entregó la fila anterior.
- Con una sola fila solo se puede resolver un problema separable por una línea recta. Apilando filas se pueden dibujar fronteras sinuosas.
- Esta estructura sigue metida como pieza básica dentro de los modelos enormes de hoy.
Contenido
1La analogía
Imagina el punto de reciclaje de un edificio con dos filas de mesas de inspección. La primera fila de mesas solo mira una cosa muy simple cada una: una si brilla, otra si se puede apretar con la mano, otra si es transparente. En vez de decir sí o no, cada mesa entrega una puntuación de cuánto cumple esa característica.
La segunda fila de mesas no mira los objetos directamente. Solo recibe las puntuaciones que anotó la primera fila. Si algo brilla pero no se aprieta, es una lata; si es transparente y liviano, es una botella: esas decisiones salen de esta fila. Mesas simples que solas no distinguen nada, apiladas en filas, terminan haciendo una clasificación bastante razonable. Apilar así detectores simples en varias filas es el perceptrón multicapa.
2En detalle
Lo que hace una sola unidad
Conviene empezar por lo que hace una unidad, porque de ahí sale todo lo demás. La unidad recibe de golpe los números que le llegan de antes. A cada número lo multiplica por un tamaño fijo: ese tamaño decide cuánta importancia se le da a ese dato. A algunos datos les toca un valor grande, a otros uno cercano a cero.
Al sumar todos los productos sale una sola puntuación. A eso se le añade un umbral propio de cada unidad, que define su carácter: "no reacciones salvo que sea muy evidente" o "reacciona con que se parezca un poco".
Sin curvar el resultado, apilar capas no sirve de nada
Pasar la puntuación tal cual a la fila de arriba trae un problema. Repetir multiplicar y sumar varias veces seguidas termina siendo idéntico a hacerlo una sola vez. Cien filas apiladas darían exactamente lo mismo que una sola fila.
Por eso, al final, la puntuación se curva una vez. Lo más habitual es aplastar los negativos a cero y dejar pasar los positivos tal cual. Gracias a ese único quiebre, apilar filas empieza a tener sentido: al superponer varios quiebres se forma una frontera que se aproxima a una curva.
Cada fila decide solo con la puntuación de la anterior
La primera fila de mesas mira el objeto directamente. A partir de la segunda fila ya no se mira el objeto, solo las puntuaciones que dejó la fila de antes. A las filas que trabajan por dentro y no se ven desde afuera se les llama capas ocultas.
Cada unidad se conecta con todas las de la fila anterior sin excepción. Si la primera fila tiene diez mesas, cada unidad de la siguiente fila recibe esas diez puntuaciones. Cuál importa más lo decide el tamaño por el que se multiplica cada una. De ahí viene el nombre de totalmente conectada.
La señal fluye siempre de adelante hacia atrás. No hay camino para que una fila de atrás le vuelva a preguntar a la de delante. Desde que entra el objeto hasta que sale el resultado, todo avanza en una sola dirección.
Se corrige mirando cuánto se alejó de la respuesta correcta
Los tamaños por los que se multiplica no los fija una persona. Al principio son valores repartidos al azar. Si se mete la foto de una lata y sale "botella", se mide cuánto se alejó de lo correcto, y ese error se recorre desde el final hacia el principio para ajustar un poco cada tamaño.
Repetir esta corrección cientos de miles de veces hace que cada mesa termine encontrando por su cuenta qué característica le toca observar. Aunque nadie le anote de antemano cosas como "brillo" o "transparencia", el modelo va descubriendo solo los criterios que sirven para separar los datos.
Sigue dentro de los modelos grandes de hoy
El perceptrón multicapa no es una estructura del pasado. Tanto las redes que procesan imágenes como los grandes modelos de lenguaje, si se abren por dentro, tienen esta estructura metida en cada capa. Cuando un mecanismo de atención reúne información, el lugar donde de verdad se trabaja con ese resultado sigue siendo un conjunto de unidades que multiplican, suman y curvan una vez.
Buena parte del peso de un modelo enorme suele concentrarse justo aquí. Como la estructura es simple, el cálculo es rápido, y agrandar su capacidad muchas veces se reduce a añadir más unidades.
3Con más precisión
El perceptrón multicapa apila la unidad de un solo detector, el perceptrón, en varias filas, con una función de activación entre capa y capa. Tiene una capa de entrada y una de salida con una o más capas ocultas entre medio; dentro de una misma capa las unidades no se conectan entre sí, y la señal no vuelve hacia atrás. Por eso también se le llama red de propagación hacia adelante.
La analogía también tiene sus límites. Las mesas del punto de reciclaje observan rasgos que una persona podría nombrar, como el brillo o la transparencia, pero lo que capta una unidad real suele ser un criterio que no se puede nombrar con facilidad. Incluso abriendo un modelo ya entrenado, es mucho más común no poder explicar en una frase qué está mirando cada unidad.
El número de capas y de unidades también lo fija una persona. Lo único que decide el entrenamiento son los tamaños de multiplicación y los umbrales; cuántas capas usar y cuántas unidades poner en cada una tiene que elegirlo quien construye el modelo, casi siempre probando varias opciones hasta encontrar la que rinde mejor.
4Pruébalo
- TensorFlow Playground (laboratorio de redes neuronales) ailearn.space Sube y baja el número de capas y neuronas, y mira en vivo cómo se curva la frontera que separa los puntos
- ConvNetJS (entrena redes en el navegador) ailearn.space Observa en tiempo real cómo la línea de separación se va acomodando mientras el entrenamiento avanza
5Malentendidos comunes
Es fácil pensar que apilar más capas siempre hace al modelo más listo, pero en realidad pasado cierto punto el entrenamiento empeora y el modelo tiende a memorizar los datos en vez de aprender de ellos.
Es fácil pensar que cada unidad se encarga de un rasgo que una persona reconocería, pero en realidad ese rasgo suele quedar repartido y mezclado entre varias unidades, difícil de leer por separado.
Es fácil pensar que el perceptrón multicapa es una estructura antigua fuera de uso, pero en realidad hoy sigue metido como pieza dentro de cada capa de los modelos grandes.
7Resumen en una línea
En resumenEl perceptrón multicapa apila unidades simples que multiplican, suman y curvan una vez, y con eso, capa tras capa, logra dibujar juntas fronteras complejas que ninguna podría trazar sola.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02