Destilación de conocimientoKnowledge Distillation

Pasar el criterio de un modelo grande a uno pequeño

Puntos clave
  • La destilación de conocimiento hace que un modelo pequeño imite el criterio de uno grande que ya rinde bien, para que con un cuerpo chico dé un rendimiento parecido.
  • El modelo pequeño no aprende mirando solo la respuesta correcta. También recibe cuánto dudó el grande entre las opciones, y aprende de eso.
  • En ese grado de duda hay información que no está en la hoja de respuestas: qué opciones se confunden entre sí y cuáles no se confunden nunca.
  • Cuando la duda queda demasiado cargada hacia un solo lado, se estira la escala para que se noten las diferencias antes de enseñarlas.
  • Se usa junto con otras formas de reducir tamaño. Persigue el mismo fin que volver más grueso el redondeo de los números o recortar las conexiones que casi no se usan.
Contenido

1La analogía

La gran clasificadora de fruta de un empaque mide peso, dulzor, color y marcas cada vez que pasa una pieza, y con todo eso decide la categoría. Una tienda de barrio no puede meter esa máquina: ni el espacio ni el precio dan. Así que se hace esto: se pasan decenas de miles de piezas por la máquina grande y se apunta entero el veredicto que da cada vez. Después, a una máquina pequeña que solo mira con una cámara el aspecto de la fruta, se le muestra ese registro para que llegue al mismo veredicto. Aquí hay un truco: se le pasa tal cual incluso el veredicto dudoso, del tipo "se inclina fuerte hacia primera, pero con algo de posibilidad de segunda". En esa duda va metida la distancia entre categorías. Eso, pasar ese contenido, es lo que hace la destilación de conocimiento.

2En detalle

El grande hace de maestro, el pequeño se ajusta

En la destilación aparecen dos modelos: uno grande ya bien entrenado, y uno pequeño que se quiere construir. Al grande se le llama maestro, y al pequeño, alumno. Se les da a los dos exactamente los mismos datos de entrenamiento, y se ajusta solo al alumno para que su salida se acerque a la del maestro. Al maestro no se le toca.

Aquí hay una ventaja grande: no hace falta que los datos traigan respuesta puesta. Basta con pasarlos por el maestro para que se genere algo de qué aprender, aunque nadie los haya etiquetado a mano. El dato con etiqueta siempre escasea, pero el dato sin etiqueta sobra.

Contiene lo que no está en la hoja de respuestas

En un método que solo aprende de la respuesta correcta, se transmite un único hecho: "esta pieza es de primera". El resto de categorías se marca por igual como "no es esta". El veredicto del maestro trae mucho más que eso: se inclina fuerte hacia primera, pero le queda algo de peso a segunda, y casi cero al desecho.

Esa forma revela la distancia entre categorías. El número deja grabado que primera y segunda pueden confundirse, pero primera y desecho jamás. El alumno, en vez de aprender solo una respuesta, imita esa forma entera, y así llega a un criterio parecido con muchos menos datos.

Estirar la escala para que se note

Cuanto mejor entrenado está el maestro, más cargado hacia un lado sale su veredicto: casi todo se junta en primera y a lo demás le queda un valor mínimo. Si se pasa tal cual, para el alumno es casi como ver solo una respuesta correcta. La información que tanto costó guardar se pierde por ser demasiado pequeña.

Por eso se estira la escala por un momento. Se suaviza la diferencia entre los valores para que los pequeños se noten, y así se le pasa al alumno. La salida del alumno también se mide con la misma escala estirada, y al terminar de aprender se vuelve todo a la escala original. Si se estira demasiado, todas las categorías quedan parejas y no hay nada que aprender; si se estira poco, la información se pierde. Ajustar ese ancho es el truco de la destilación.

Cuánto se puede reducir

Se puede achicar mucho el tamaño y aun así conservar buena parte del rendimiento. Se hace un alumno con menos capas o capas más angostas, y a veces se le pasa el promedio del veredicto de varios maestros. Hacer que también coincida la forma de las capas intermedias, y no solo la salida final, suele traspasar mejor el conocimiento.

Lo que se gana es velocidad y costo. El modelo pequeño responde rápido, usa poca memoria y corre en una laptop o en el bolsillo. También se combina con otras formas de reducir tamaño: volver más grueso el redondeo de los números, o recortar las conexiones que casi no se usan persiguen el mismo fin, y no se estorban entre sí.

Lo que no se traspasa

Lo que la destilación transmite es el criterio dentro del terreno donde el maestro ya es bueno. Donde el maestro duda, el alumno duda igual. Sus sesgos y malas costumbres también pasan tal cual. Como la meta del alumno es imitar al maestro, si el maestro se inclina en una dirección equivocada, aprende también esa inclinación.

En tareas que exigen conocimiento amplio y profundo, la brecha vuelve a abrirse. En situaciones frecuentes, el modelo pequeño da casi la misma respuesta que el maestro, pero en situaciones raras y difíciles, la diferencia de tamaño se nota. Por eso la destilación no es una forma de eliminar al modelo grande, sino más bien una forma de fabricar una pareja que resuelva barato lo frecuente.

3Con más precisión

La destilación de conocimiento (Knowledge Distillation) entrena al modelo alumno para que siga la distribución de salida del modelo maestro. A la etiqueta que solo marca una respuesta se le llama etiqueta dura, y a la distribución que entrega el maestro, etiqueta blanda. Al valor que suaviza la distribución se le llama temperatura, y la pérdida del alumno suele armarse mezclando el término que sigue la etiqueta blanda con el que acierta la respuesta real. Al método que ajusta también las representaciones intermedias, y no solo la salida, se le llama destilación de características. Cuando se usan varios modelos maestros a la vez, la técnica se conoce como destilación de conjunto.

La analogía también tiene sus costuras. La clasificadora de fruta mide criterios fijos como peso y dulzor, pero nadie puede escribir en criterios así en qué se basa un modelo grande para decidir. Por eso lo que se traspasa no es la razón, sino la forma del resultado. Además, el veredicto de la clasificadora tiene un criterio firme, la báscula; el veredicto del modelo maestro es, en sí mismo, una conjetura. Donde el maestro se equivoca, el alumno aprende con esmero esa misma respuesta equivocada.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que destilar da el mismo nivel que el modelo grande, pero en realidad solo se parece en situaciones frecuentes; en las raras y difíciles la diferencia se nota.

  • Es fácil pensar que la destilación es una técnica de compresión, pero en realidad no se reduce el modelo grande: se entrena uno pequeño desde cero.

  • Es fácil pensar que basta con aprender la respuesta correcta del maestro, pero en realidad hay que recibir también cuánto dudó entre las opciones para que se note la ventaja de destilar.

7Resumen en una línea

En resumenLa destilación de conocimiento hace que un modelo pequeño imite la forma del criterio de uno grande, para que con un cuerpo chico dé respuestas parecidas.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02