Mezcla de expertosMixture of Experts
Estructura que enciende solo las ramas que necesita cada fragmento
- La mezcla de expertos divide el interior de un modelo en varias ramas y enciende solo un par de ramas encargadas por cada fragmento.
- El modelo entero puede ser enorme, pero la parte que se calcula en cada pasada es solo una parte, así que rinde rápido para su tamaño.
- Un panel pequeño decide a qué rama mandar cada fragmento. Ese panel también se entrena junto con todo lo demás.
- Las ramas no son un reparto de temas que decidió una persona: son usos que se separaron solos durante el entrenamiento.
- Las ramas que no se usan igual ocupan su lugar. La memoria necesaria es la del tamaño completo.
Contenido
1La analogía
Entras a una sucursal bancaria con diez ventanillas y lo primero que haces es sacar un número. El papel te dice a qué ventanilla ir, y hasta que termines tu trámite, las otras nueve ventanillas atienden a su propia gente sin que te importen. Por grande que sea la sucursal, tu trámite lo resuelven una o dos ventanillas.
Así está armado un modelo de mezcla de expertos. El interior se divide en varias ramas, y por cada fragmento que entra, un panel le indica a qué rama encargada ir. Agregar ventanillas amplía el rango de trámites que puede atender la sucursal, pero el tiempo de espera de un solo cliente no crece en proporción a la cantidad de ventanillas.
A cambio, las ventanillas sin clientes también tienen que mantener la luz encendida y el puesto ocupado: el alquiler de las diez se paga igual. Por ahí pasa el motivo de que esta estructura no salga gratis.
2En detalle
Un panel elige la rama encargada
Por cada fragmento que atraviesa el modelo, un panel pequeño de selección le pone puntaje primero. Manda este fragmento a la rama 3 y a la 7; el siguiente, a la 1 y a la 3. Por lo general se eligen solo dos ramas de entre varias decenas.
El resultado que atraviesa las ramas elegidas se vuelve a juntar en uno solo. En vez de sumarlo sin más, se mezcla según la proporción de puntaje que puso el panel, dándole más peso a la opinión de la rama en la que confió más.
El panel también se entrena. Al principio reparte más o menos al azar, y a medida que avanza el entrenamiento va afinando el criterio según qué destino dio mejores resultados para cada tipo de fragmento. Nadie le asigna a cada rama un tema de antemano.
Es grande, pero lo que se calcula en cada pasada es una parte
Un modelo normal usa todos sus valores internos cada vez que pasa un fragmento. Si se duplica el modelo, se duplica también el cálculo, y la respuesta se hace más lenta y más cara.
La mezcla de expertos corta ese vínculo. Aunque las ramas se lleven a ocho, si solo se encienden dos por vez, el conocimiento que guarda el modelo crece mientras el trabajo de cada cálculo se mantiene casi igual. Por eso, al presentar estos modelos, aparecen dos números: el tamaño total y el tamaño que realmente se usa en cada pasada. Fijarse solo en el primero lleva a calcular mal el rendimiento o el equipo necesario.
Parece un método barato para agrandar el modelo, pero tiene un límite claro. Por más que se multipliquen las ramas, la profundidad de cálculo que recibe un fragmento al pasar sigue siendo la misma, así que no se vuelve más inteligente en la misma proporción en que crece.
Las ramas no son un reparto de temas
Como se llaman "expertos", es fácil imaginar que una rama se encarga de matemática y otra de traducción. Al mirarlo de cerca no es tan prolijo. Alguna rama concentra signos de puntuación, otra reacciona a un rasgo gramatical de cierto idioma, y la mayoría se separa según un criterio difícil de explicar en palabras humanas.
Hasta dentro de una misma frase, cada fragmento va a un lugar distinto. No es que una rama procese la frase entera: se abre y se junta de nuevo fragmento por fragmento, cada vez. Por eso no se puede sacar una sola rama y usarla aparte.
Todas las ramas tienen que estar de guardia
Se calcula menos, pero no se usa menos memoria. Como no se sabe de antemano a qué rama va a ir cada fragmento, todas tienen que estar disponibles en todo momento. Un modelo grande de tamaño total sigue exigiendo un equipo grande, y esa es una de las razones por las que es difícil hacerlo correr en una computadora personal.
También hay un problema de acumulación. Si se deja sin control, los fragmentos se amontonan en las ramas populares: unas quedan siempre saturadas y otras casi sin uso. La rama poco usada casi no entrena y termina usándose todavía menos. Por eso, durante el entrenamiento, se agrega una penalización cuando se acumula demasiado en una rama, y a veces se pone un tope a cuántos fragmentos puede recibir cada una por turno. El fragmento que queda afuera de ese tope simplemente pasa esa capa de largo.
3Con más precisión
En la mezcla de expertos, lo que se ramifica no es la capa entera, sino un tramo puntual dentro de ella. El resto del cálculo lo atraviesan todos los fragmentos por igual, y solo ese punto de reparto cambia según el fragmento. La cantidad de ramas que se elige suele quedar fija, casi siempre en dos, y ese número se decide de antemano según cuánto cálculo se quiere gastar en cada pasada.
La analogía también tiene sus límites. En el banco, un cliente resuelve su trámite en una sola ventanilla, pero en el modelo, un fragmento vuelve a sacar número en cada capa; si hay decenas de capas, se reparte de nuevo decenas de veces. Además, el empleado de una ventanilla sabe qué trámite atiende, pero las ramas no llevan ninguna etiqueta así: recién después del entrenamiento se puede intentar adivinar mirando de cerca. El criterio con que el panel reparte tampoco es sentido, sino resultado de cálculo, así que dos frases parecidas pueden terminar en ramas distintas. Elegir la rama no es un cálculo suave sino elegir unas pocas y descartar el resto, y eso vuelve al entrenamiento más inestable.
4Pruébalo
- Netron (visor de arquitecturas de modelos) ailearn.space Abre un modelo publicado y verás el punto donde se abre en varias ramas y después vuelve a juntarse en una sola
- LLM Visualization (disección 3D de un modelo de lenguaje) ailearn.space Sigue en tres dimensiones qué bloques se calculan, uno tras otro, al pasar un solo fragmento
5Malentendidos comunes
Es fácil pensar que un modelo de mezcla de expertos es liviano, pero en realidad solo se reduce el cálculo: la memoria necesaria sigue siendo la del tamaño completo.
Es fácil pensar que cada rama tiene un tema asignado, pero en realidad se separan solas durante el entrenamiento según un criterio difícil de reconocer a simple vista.
Es fácil pensar que un tamaño total grande significa que es proporcionalmente más inteligente, pero en realidad el tamaño que se usa en cada pasada es mucho más chico, así que hay que mirar los dos números juntos.
7Resumen en una línea
En resumenLa mezcla de expertos divide el interior del modelo en varias ventanillas y llama, por cada fragmento, solo a la ventanilla encargada, así que agranda el tamaño sin agrandar en la misma medida el cálculo de cada pasada.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02