Modelos de lenguaje Intermedio

Aprendizaje few-shotFew-Shot Learning

Mostrar unos pocos ejemplos y pedir que se sigan tal cual

Puntos clave
  • El aprendizaje few-shot es pegar dos o tres ejemplos del resultado deseado y pedir que se sigan tal cual.
  • Funciona especialmente bien para transmitir tono, formato y criterios difíciles de explicar con palabras.
  • Si los ejemplos están sesgados, el resultado sale sesgado también. La calidad y el equilibrio de los ejemplos se reflejan directo.
  • Ver los ejemplos no cambia al modelo en sí. Solo funciona en ese momento, y hay que volver a pegarlos la próxima vez.
  • Sumar ejemplos sin límite no mejora todo. También ocupan lugar y suben el costo.
Contenido

1La analogía

En el gimnasio, cuando alguien agarra una máquina por primera vez, el entrenador no da una explicación larga. Al lado, hace la demostración dos o tres veces. Hasta dónde bajar, a qué velocidad subir, cuándo respirar: todo eso está metido en esas pocas repeticiones.

Ponerlo en palabras alarga la frase y aun así no se entiende bien. "No bajes tanto, hazlo con moderación" funciona peor que mostrarlo dos veces. Una vez visto, queda fijado un criterio y la siguiente repetición sale parecida.

El problema es cuando la demostración está mal hecha. Si el entrenador levanta el hombro dos veces al hacerla, ese vicio también se copia tal cual. Lo que se mostró se convierte en el criterio. El aprendizaje few-shot es exactamente esa demostración.

2En detalle

El ejemplo funciona más rápido que la palabra

Un pedido como "arréglalo para que suene natural" no tiene un criterio fijo. Qué tan natural es "natural" cambia según la persona. Este tipo de cosas no se transmite bien por más que se explique largo.

En cambio, mostrar dos pares de antes y después cambia todo. Cuánto se acortó la frase, hasta dónde se simplificó una palabra difícil, cómo se ajustó el final de cada oración: todo eso está metido en esos dos pares. El modelo intuye esa regla y la aplica a la frase nueva.

El efecto es especialmente grande cuando el resultado lo tiene que leer un programa después. El orden de los elementos, el símbolo separador, cómo marcar un espacio vacío: ese tipo de detalles se fijan con uno o dos ejemplos de forma mucho más precisa que con una explicación.

El ejemplo no da la respuesta, da el molde

Sumar ejemplos no hace que el modelo memorice esa respuesta puntual. Busca la regla común entre los ejemplos y la aplica a la entrada nueva. Si a dos reseñas se les pone la etiqueta de elogio y de queja, a la tercera reseña le va a poner una de esas dos etiquetas.

Por eso importa cómo se arman los ejemplos. Si se ponen solo tres ejemplos de elogio, la entrada nueva también se inclina hacia el elogio. Meter una variedad pareja de los tipos que hay que cubrir, y sumar uno que esté justo en el límite confuso, aclara el criterio.

El orden también influye. Hay una tendencia a seguir con más fuerza el último ejemplo, así que con los mismos ejemplos, cambiar el orden puede cambiar el resultado.

Ver la demostración no cambia el cuerpo

Aunque el nombre lleve la palabra aprendizaje, el modelo no aprende. Es como que ver una demostración dos veces no hace crecer el músculo. El ejemplo es solo material de referencia que se entrega en el momento, y cuando termina la conversación no queda nada.

Para pedir lo mismo la próxima vez, hay que volver a poner los ejemplos. Si es algo que se usa seguido, se suele meter el ejemplo en el prompt del sistema o en una plantilla fija. Si lo que se quiere es cambiar el modelo mismo, eso ya es otra historia, y hay que juntar muchos ejemplos para entrenarlo aparte.

¿Cuántos son los ideales?

Por lo general, la mayor mejora se da entre dos y cinco ejemplos. Con uno solo el formato ya queda algo fijado, pero el criterio tiembla; pasando de cinco, la mejora que se gana se reduce de forma notable.

Aumentar la cantidad también tiene un costo. Los ejemplos también ocupan lugar, así que hay menos espacio para documentos, y lo que se envía y se recibe crece, así que el costo y el tiempo suben también. Si los ejemplos son largos, conviene reducirlos a dos y elegir bien esos dos, en vez de sumar más.

Si la tarea es muy simple o algo que el modelo ya hace bien, no hace falta ejemplo. El ejemplo vale más cuando el formato es exigente o el criterio es ambiguo.

Si la misma tarea hay que hacerla miles de veces al día, la cuenta cambia. El costo de enviar el ejemplo cada vez se va acumulando. En ese caso, sale más barato ajustar el modelo aparte con los ejemplos guardados y, en el pedido real, no incluir ningún ejemplo.

3Con más precisión

El few-shot es una adaptación que ocurre solo dentro de la entrada, sin cambiar los valores internos del modelo. A este fenómeno se lo llama aprendizaje en contexto: el modelo no guarda nada al terminar, pero mientras dura esa entrada, se comporta como si hubiera aprendido la regla que los ejemplos insinúan. Originalmente era el nombre de un método para entrenar un modelo con muy poco material, pero al popularizarse los modelos de lenguaje, pasó a referirse sobre todo a sumar unos pocos ejemplos en el prompt.

También hay puntos donde la analogía no encaja. Quien vio una demostración la recuerda la semana siguiente, pero el modelo no recuerda nada en la próxima conversación: cada entrada empieza de cero. Además, una persona, si la demostración parece rara, pregunta "¿esto está bien?"; el modelo, en cambio, toma incluso un ejemplo raro como regla y lo sigue tal cual, sin cuestionarlo. Si hay un error de tipeo o una etiqueta equivocada mezclada entre los ejemplos, ese error sale reflejado en el resultado tal cual, como si fuera parte de la instrucción. A veces se nombra por la cantidad de ejemplos puestos, como one-shot o two-shot, pero solo cambia el número: el método de fondo, adaptarse dentro de la misma entrada sin tocar el modelo, es el mismo en todos los casos.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que el few-shot entrena un poco al modelo, pero en realidad los valores internos del modelo quedan igual, y solo funciona dentro de esa entrada puntual.

  • Es fácil creer que cuantos más ejemplos, mejor, pero en realidad, pasado cierto número, la mejora se hace chica y solo crecen el lugar ocupado y el costo.

  • Es fácil pensar que el ejemplo da la respuesta correcta, pero en realidad se acerca más a mostrar el molde y el criterio, así que si los ejemplos están sesgados, el resultado sale sesgado también.

7Resumen en una línea

En resumenEl aprendizaje few-shot es mostrar unos pocos ejemplos del resultado deseado para fijar el molde en el momento, sin cambiar el modelo en sí.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02