AlucinaciónHallucination

Cuando la IA inventa una respuesta falsa que suena convincente

Puntos clave
  • La IA no consulta hechos: elige la palabra que mejor continúa lo escrito. Por eso no se detiene ni cuando no sabe algo.
  • Aparece sobre todo con información escasa, con información que cambió después del entrenamiento y con preguntas que dan por cierto algo falso.
  • Hay varias maneras de inventar. Equivocar un año es molesto, pero fabricar una fuente entera es mucho más peligroso.
  • La búsqueda de documentos, el entrenamiento de alineación, exigir fuentes y bajar la temperatura reducen la frecuencia, pero no la dejan en cero.
  • Contrastar nombres, cifras, fechas y citas con el original sigue siendo la defensa más segura.
Contenido

1La analogía

Piensa en la última pregunta de un examen final. No te acuerdas de nada y sabes que el hueco en blanco es un cero seguro. Así que enlazas las palabras que te suenan y rellenas cinco líneas. La letra sale limpia, las frases fluyen y el tono rebosa seguridad. Hasta que quien corrige abre la hoja de soluciones y contrasta línea por línea, ese examen y el de alguien que sí sabía se parecen demasiado por fuera. Cuanto mejor esté redactado, más cierto parece.

La respuesta inventada de una IA es exactamente ese examen. El modelo tampoco deja el hueco vacío: enlaza lo que le suena hasta cerrar el párrafo, y de ahí salen títulos de libros que nunca se publicaron, fechas que no cuadran y artículos de ley inexistentes. Que la frase fluya bien demuestra que está bien escrita, no que sea verdad.

2En detalle

En la plantilla de corrección no hay casilla de hechos

Un modelo de lenguaje no consulta ningún sitio mientras escribe. Calcula qué trozo tiene más probabilidad de venir detrás de lo ya escrito, escoge uno, lo pega y repite. Después de "la capital de Francia es", la palabra "París" sale con muchísima ventaja, así que la respuesta es correcta. No porque conozca el dato, sino porque ha visto esas dos cosas juntas en cantidades enormes de texto.

El problema llega cuando en lo que aprendió casi no aparece esa respuesta. Quedan candidatas mediocres, y el modelo no tiene de serie una opción que diga "parar aquí". Coge la más verosímil de las que quedan y termina la frase. La frase falsa sale del mismo cálculo que la verdadera. Por eso no hay manera de separarlas mirando el tono.

Los huecos aparecen siempre en los mismos sitios

Hay tres. El primero es la información escasa: personas poco conocidas, empresas pequeñas, el programa de una fiesta de barrio, cosas de las que existen cuatro líneas escritas en el mundo. El segundo es la información que cambió después del entrenamiento: el conocimiento del modelo está congelado en un momento, y el modelo no percibe que está congelado. El tercero es la pregunta capciosa. Si preguntas "¿en qué año ocurrió aquello?" sobre algo que nunca ocurrió, el modelo no duda del supuesto: rellena una respuesta que encaje con él.

Inventar tiene varias formas

La más común es el dato torcido: un año corrido, dos personas intercambiadas. Suele ser relativamente fácil de pillar. La incómoda es la fuente fabricada de arriba abajo: aparece un artículo con título creíble, autores creíbles y hasta nombre de revista, y al buscarlo no existe. La tercera es salirse del material entregado: le pegas un documento, le pides un resumen y en el resumen se cuelan frases que no estaban dentro. Las dos primeras chocan con los hechos del mundo; la última choca con el papel que tienes delante.

Los frenos ya vienen en varias capas

El más extendido es el RAG (Retrieval-Augmented Generation, generación aumentada por recuperación). Antes de responder se buscan documentos relacionados y se entregan junto con la pregunta, de modo que la respuesta salga de un material a la vista y no de la memoria. El entrenamiento de alineación premia las respuestas del tipo "no lo sé" y va limando la costumbre de rellenar a la fuerza. Pedir en la instrucción que cada frase venga con su apoyo hace que las frases sin apoyo canten. Y bajar la temperatura, que es un ajuste del sistema, deja fuera a las candidatas raras. Ninguna de estas piezas cambia el principio de fondo: la siguiente palabra se sigue eligiendo por probabilidad.

El último filtro es el hábito de quien lee

No hace falta desconfiar de cada frase. Basta con gastar esfuerzo en lo que duele si sale mal: nombres, cifras, fechas, citas textuales, artículos de ley y enlaces. Si la respuesta trae alguna de esas seis cosas, comprueba solo esa parte en el original. Si hay enlace, ábrelo y mira si la frase citada está de verdad ahí. También ayuda repetir la misma pregunta formulada de otra manera. Lo que cambia entre las dos respuestas suele ser justo lo inventado.

3Con más precisión

La alucinación (hallucination) es la generación, con apariencia de hecho, de contenido que no se sostiene ni en los datos de entrenamiento ni en el material aportado. Cuando choca con el documento entregado se habla de error de fidelidad; cuando choca con los hechos del mundo, de error de factualidad. No tiene ninguna relación con las alucinaciones que experimenta una persona: es un nombre que pusieron pronto los investigadores y se quedó.

La analogía también tiene sus costuras. Quien está delante del examen sabe que no lo sabe. El modelo no tiene esa conciencia. Lo único que maneja es la distribución de probabilidad del siguiente token, y una probabilidad baja no se convierte sola en la señal "esto está mal". Hay un segundo detalle: el modelo ya ha pasado por una corrección. Durante el ajuste que refleja las preferencias humanas, el tono rotundo recibió mejores notas, así que el modelo se inclina hacia frases seguras antes que hacia respuestas dubitativas.

Conviene añadir que la frecuencia no es una constante del modelo. Depende de qué se pregunta, de cuánto material se entrega y de cómo está escrita la instrucción. Una pregunta concreta con documentos delante y otra abierta sin nada apoyando pueden dar tasas de invención muy distintas con el mismo sistema.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que la IA miente a propósito, pero en realidad no hay intención de engañar: lo cierto y lo falso salen exactamente del mismo cálculo.

  • Es fácil creer que si responde con seguridad es que acierta, pero en realidad el aplomo del tono y la exactitud del contenido van cada uno por su lado. Cuanto mejor escribe, más creíble resulta también lo incorrecto.

  • Es fácil suponer que enchufando un buscador desaparece, pero en realidad todavía puede traer documentos equivocados o colar en la respuesta frases que no estaban en los documentos traídos.

7Resumen en una línea

En resumenLa alucinación es la IA rellenando el examen incluso cuando no sabe la respuesta, y una frase bien escrita no es prueba de que sea cierta.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02