BERT
Modelo que aprendió llenando huecos mirando el contexto de ambos lados
- BERT (Bidirectional Encoder Representations from Transformers, representaciones de codificador bidireccional de un transformer) es un modelo de lenguaje entrenado a base de abrir un hueco en la frase y adivinar qué va ahí.
- Puede mirar antes y después del hueco al mismo tiempo. Ese es el punto donde se separa de los métodos que solo miran hacia atrás.
- No sigue escribiendo texto. Su tarea termina en captar el sentido de la frase y entregarlo.
- Por eso es fuerte en tareas donde la respuesta es corta y cerrada, como clasificar, buscar o responder preguntas puntuales.
- Sobre el modelo ya entrenado se le agrega solo un ajuste final pequeño para adaptarlo a cada campo.
Contenido
1La analogía
Abre el mueble zapatero de la entrada: en cada casilla hay un par de zapatos. Si tapas una casilla con un papel y preguntas "¿qué había aquí?", se acierta bastante bien.
El truco no es mirar la casilla tapada. Si a la izquierda hay botas de montaña y a la derecha unas zapatillas de niño, el rango de lo que puede ir en el medio se reduce mucho. Lo que hay arriba y abajo, o si es verano o invierno, también son pistas.
Lo importante es que se pueden ver los dos lados de la casilla tapada a la vez. Si se tapa también el lado derecho, adivinar se vuelve mucho más difícil, porque entonces solo queda apoyarse en lo que hay a un único lado.
2En detalle
Repite miles de veces el ejercicio de tapar y adivinar
Entrenar BERT es sencillo. Se toma cualquier texto, se tapa más o menos una de cada diez palabras y se le pide adivinar qué había ahí. La respuesta ya está en el texto original tapado, así que nadie tiene que anotarla a mano.
Una sola frase da para varios ejercicios: tapar la primera palabra es un ejercicio, tapar la quinta es otro. Así, todo el texto disponible en internet se convierte en un cuadernillo de ejercicios, y eso permitió aprender una cantidad enorme sin que nadie lo tocara a mano.
Este entrenamiento no solo mejora la puntería para adivinar. Para llenar el hueco hace falta entender la estructura de la frase y cómo se relacionan las palabras, así que, repitiendo el ejercicio, el uso del lenguaje termina quedando incorporado por completo.
Ver los dos lados es lo que marca la diferencia
Un modelo que solo lee en una dirección apenas ve el texto que va antes del hueco. Si solo llega hasta "Fue al banco y sacó...", elegirá algo verosímil sin que importe lo que venga después.
BERT también ve lo que sigue. Con "Fue al banco y sacó... y salió con el saldo actualizado en la libreta", esa mención del saldo que viene después acota el hueco de antes. El mismo lugar en la frase se resuelve distinto según se pueda ver hacia adelante o no.
Esto pesa todavía más en frases donde el sentido de una palabra queda fijado por algo que aparece más tarde: un pronombre que recién se aclara después, o una concordancia que llega al final de la oración. En estructuras así, poder mirar ambos lados a la vez se vuelve una ventaja grande.
En vez de seguir escribiendo, entrega el sentido
BERT no es un interlocutor de conversación. Si le das una frase, no fabrica la frase que sigue: ordena qué significa esa frase y lo entrega como un bloque de números. Otra pieza, aparte, recibe ese bloque y hace el juicio real.
Este método encaja con tareas como distinguir si una reseña es un elogio o una queja, dirigir una consulta al área correcta, encontrar documentos de sentido parecido o señalar el tramo de un texto largo donde está la respuesta. Todas son tareas donde basta con entender bien, sin necesidad de inventar texto nuevo.
Se usa mucho en buscadores. Para encontrar documentos de sentido cercano aunque no compartan las mismas palabras, hace falta poder tratar el sentido de una frase como números, y ahí encaja bien BERT.
Sobre lo ya aprendido, solo se agrega un remate
La etapa de aprender tapando y adivinando toma tiempo y cuesta caro. Pero se hace una sola vez. Después, para cada tarea concreta, se agregan pocos ejemplos y se entrena un poco más, en corto.
Con unas diez mil reseñas se arma un clasificador de sentimiento; con unos pocos miles de consultas, un clasificador por área. Lo que habría exigido mucho más material y tiempo si se empezara de cero, se resuelve tomando un modelo que ya conoce el idioma y dándole solo el remate final.
3Con más precisión
BERT apila solo la parte codificadora del transformer. Se entrenó con dos tareas: modelado de lenguaje enmascarado, que tapa parte de los fragmentos de entrada y pide reconstruirlos, y una tarea que juzga si dos frases realmente se siguen una a la otra. Investigaciones posteriores señalaron que esta segunda tarea aportaba poco, y en versiones más recientes se dejó de usar.
La analogía también tiene sus límites. En el zapatero las casillas se ven a simple vista, pero la unidad que maneja BERT no es la palabra: es un fragmento más pequeño, así que una sola palabra puede repartirse en varias casillas. Además, el zapatero solo exige atención a la casilla tapada, mientras que BERT procesa la frase entera de una sola vez y ajusta el sentido de todas las posiciones al mismo tiempo.
Ver ambos lados también tiene un costo. Como puede ver hacia adelante, no sirve tal cual para seguir escribiendo texto: para adivinar lo que viene, hace falta no conocerlo todavía. Por eso BERT y los modelos que siguen escribiendo, como GPT, se complementan más que compiten: cada uno se entrenó para algo distinto.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que BERT conversa como un chatbot, pero en realidad no tiene una estructura para seguir escribiendo texto: su tarea llega hasta ordenar el sentido de la frase y entregarlo.
Es fácil pensar que, por ver ambos lados, siempre es mejor que un modelo que solo mira hacia atrás, pero en realidad esa misma capacidad de ver hacia adelante hace que sea difícil de usar para inventar texto nuevo.
Es fácil pensar que BERT es tecnología vieja que ya no se usa, pero en realidad sigue muy presente donde hace falta algo rápido y liviano, como clasificar o buscar.
7Resumen en una línea
En resumenBERT aprendió el idioma llenando huecos con pistas de ambos lados a la vez, y por eso se usa más para captar el sentido con precisión que para redactar texto nuevo.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02