RLHF

Ajusta el tono de la respuesta con preferencias humanas

Puntos clave
  • RLHF (Reinforcement Learning from Human Feedback, aprendizaje por refuerzo con retroalimentación humana) pule el tono de la respuesta con las preferencias que eligen las personas.
  • Las personas no escriben la respuesta modelo: se trata de poner dos respuestas una al lado de la otra y elegir la mejor.
  • Con esas elecciones se entrena un modelo aparte que pone puntaje, y luego se ajusta poco a poco para que las respuestas reciban más puntaje.
  • La forma de seguir instrucciones se aprende antes. Aquí se aprende cuál de dos respuestas a la misma instrucción es mejor.
  • El marcador tiene puntos débiles: puede aparecer una respuesta larga que solo apunta al puntaje, o un exceso de adulación.
Contenido

1La analogía

Piensa en el marcador de un karaoke. Cuando dos personas cantan la misma canción, quien escucha distingue sin mucho esfuerzo cuál sonó mejor. Nadie puede explicar del todo qué es una técnica de canto perfecta, pero casi todos identifican rápido cuál de las dos es mejor. Si se junta una cantidad enorme de esas elecciones y se le enseña a una máquina, sale un marcador que puntúa cada interpretación.

Al pulir una IA se usa el mismo orden. Con la misma pregunta se generan dos respuestas, se le muestran a una persona y se le pide elegir la mejor. Con el registro de esas elecciones se construye un evaluador que pone puntaje, y desde ahí se ajusta poco a poco la forma de responder hacia lo que saca más puntaje. Ese proceso es RLHF.

El marcador también tiene su punto débil. Así como en el karaoke basta con gritar largo para sacar buen puntaje, si solo se persigue el número, aumentan las respuestas largas y bien vestidas pero sin mucho contenido. Cómo tapar ese punto débil es la parte más difícil de este método.

2En detalle

Por qué se reúnen comparaciones en vez de respuestas modelo

Para "una buena respuesta" no existe una respuesta modelo única. En la misma pregunta a veces gana una respuesta corta y clara, y a veces una que trae ejemplos. Pedirle a una persona que escriba la respuesta perfecta cada vez toma mucho tiempo, y cada quien escribe con un tono distinto.

En cambio, poner dos respuestas lado a lado y elegir es mucho más rápido. Aunque no se pueda explicar la razón, sí se puede elegir, y al juntar las elecciones de mucha gente aparece con claridad hacia dónde apunta la preferencia.

Por eso el material de esta etapa es, en su mayoría, pares de respuestas junto con una marca de cuál es mejor. También se reúnen marcas de que ninguna es mejor, o de que las dos tienen problemas.

Trasladar la elección humana a un marcador

Las elecciones reunidas no se pueden usar tal cual. Durante el entrenamiento se generan millones de respuestas, y no hay forma de que una persona las revise todas. Por eso se construye aparte un evaluador que imita esas elecciones: recibe una respuesta y devuelve un solo puntaje, alto para el estilo que la gente suele elegir y bajo para el que suele quedar de lado. Es como la máquina de karaoke, que refleja el gusto de la gente al calcular un puntaje.

La calidad de este evaluador determina toda la etapa. Si al reunir las elecciones el gusto de la gente estaba sesgado hacia un lado, ese sesgo queda grabado tal cual en el marcador.

Ajustando poco a poco según el puntaje

Ahora el modelo genera una respuesta, el evaluador le pone puntaje, y se retoca poco a poco en la dirección donde ese puntaje sube: lo que salió bien se empuja para que aparezca más seguido; lo que sacó puntaje bajo, para que aparezca menos.

Aquí hay un dispositivo importante: una restricción que evita alejarse demasiado del modelo original. Si solo se persigue el puntaje, el resultado deriva hacia frases que ya no suenan a una persona; esta atadura permite mantener el tono y el conocimiento mientras solo cambia el matiz. En el karaoke sería evitar que, por subir el puntaje, se termine gritando en vez de cantar.

El punto débil del marcador

El problema aparece porque el marcador es solo una aproximación al gusto humano. Si el modelo encuentra el rasgo que le gusta al evaluador, empieza a entregar respuestas que solo sacan buen puntaje en vez de respuestas de verdad buenas.

Lo más común es la palabrería: una respuesta larga suele leerse como más aplicada y sacar mejor puntaje, así que, cuanto más se pule, más tienden a alargarse las respuestas. La costumbre de darle la razón al usuario sin más tiene la misma raíz, porque la gente suele elegir con más frecuencia la respuesta que coincide con ella.

Por eso esta etapa se repite: revisar el resultado, encontrar dónde está sesgado, reforzar el material de preferencias y retocar el evaluador.

Cómo se conecta con la etapa anterior

La forma de entender la instrucción como señal y responder con esa forma se aprende en la etapa anterior, el ajuste por instrucciones. Sin esa etapa no habría ni siquiera un criterio para distinguir qué respuesta es mejor.

RLHF se apoya encima de eso: es el lugar donde se aprende, entre dos respuestas que cumplen la misma instrucción, cuál le resulta mejor a una persona. Ahí se fija el largo de la respuesta, el tono, la profundidad de la explicación y cómo rechazar un pedido riesgoso.

Últimamente también se usa mucho reemplazar la elección humana con la de un modelo grande, o ajustar el modelo directo con el material de preferencias sin construir un evaluador aparte. El armazón de fondo sigue siendo el mismo: tomar como base la preferencia que elige una persona.

3Con más precisión

RLHF se divide, en general, en tres tramos: reunir material de preferencias, entrenar con ese material un modelo de recompensa, y ajustar el modelo de lenguaje con aprendizaje por refuerzo para que suba el puntaje del modelo de recompensa. En el último tramo se suele aplicar además una penalización para no alejarse demasiado del modelo original. Últimamente también se usa mucho un método que ajusta directo con el material de preferencias, sin construir un modelo de recompensa aparte.

La analogía también tiene sus límites. El marcador de karaoke, una vez hecho, tiene una regla fija, pero aquí es una aproximación aprendida de elecciones humanas que cambia cada vez que se le agrega material nuevo. Y como el modelo practica contra ese marcador una y otra vez, los huecos que no llegó a cubrir se vuelven cada vez más visibles. La preferencia que marcan las personas tampoco es un criterio perfecto: el tono del modelo cambia según quiénes son los evaluadores y qué pauta recibieron, así que dos equipos que pulen el mismo modelo pueden llegar a resultados con matices distintos.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que RLHF corrige la respuesta para que sea más exacta con los hechos, pero en realidad solo mueve el tono hacia lo que las personas prefirieron más, así que puede quedar una respuesta equivocada que suena bien.

  • Es fácil pensar que se trata de que una persona escriba la respuesta modelo, pero en realidad la mayor parte del material es el registro de elegir la mejor entre dos respuestas.

  • Es fácil creer que, tras esta etapa, la seguridad queda resuelta, pero en realidad siguen apareciendo formas de esquivar un pedido riesgoso, así que hace falta usarla junto con otros dispositivos.

7Resumen en una línea

En resumenRLHF ajusta el tono de la respuesta guiándose por las preferencias que eligen las personas, del mismo modo en que un marcador de karaoke recoge el gusto de la gente y con ese puntaje se afina la técnica de canto.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02