Reconocimiento de vozSpeech Recognition
La tecnología que transcribe la voz humana en texto
- El reconocimiento de voz es el trabajo de convertir en letras la vibración del sonido que entra por el micrófono.
- Corta el sonido en trozos muy cortos y le da a cada uno un puntaje de qué tan cerca está de cada sonido posible, y luego enlaza esos puntajes en una frase.
- No mira solo el sonido. También toma en cuenta el hilo de lo que se dijo antes y después para elegir entre candidatos que suenan parecido.
- Funciona bien en un lugar callado y con una pronunciación clara, pero el ruido, las voces superpuestas y los nombres poco comunes lo hacen fallar seguido.
- Transcribir es todo lo que hace el reconocimiento de voz. Entender el significado de lo dicho y actuar en consecuencia es un paso aparte.
Contenido
1La analogía
Imagina que en la radio están contando una historia y alguien la está transcribiendo en papel al mismo tiempo. El sonido no se puede retener, así que hay que pasarlo a letras muy rápido, en el mismo orden en que entra por el oído. Ese trabajo de recibir un sonido que se va y dejarlo escrito es el reconocimiento de voz.
Quien transcribe no escribe solo por lo que oye. En una frase como "vino ayer por la tarde", si "vino" es la bebida o el verbo venir no se distingue por el sonido solo. Se puede escribir lo correcto porque se escuchó también lo que venía antes y después.
Si la transmisión se oye limpia, transcribir no cuesta nada. Pero si se mezcla ruido, si dos personas hablan a la vez, o si aparece un nombre que nunca se oyó, la mano se detiene un instante. Es exactamente ahí donde el reconocimiento de voz también tiene problemas.
2En detalle
El sonido se corta en trozos muy cortos
Lo que capta el micrófono es una vibración del aire. Esa vibración se convierte en una fila de números que entra a la computadora. Pero si se toma esa fila entera de una vez y se pregunta "¿qué se dijo?", no sale ninguna respuesta. El habla es un sonido que cambia todo el tiempo.
Por eso primero se corta. Se divide un segundo en unos cien trozos, y de cada uno se extrae qué alturas de sonido están mezcladas y en qué proporción. Con este dibujo del sonido armado así, el sonido de la "a" y el de la "s" aparecen con formas claramente distintas.
Cortar en trozos tan finos tiene su razón. El sonido del habla cambia de forma según lo que viene antes y después. La misma "t" suena distinto dependiendo de qué la sigue. Cortar corto permite seguir ese cambio sin perderlo.
Cada trozo recibe un puntaje
Para cada trozo cortado, el modelo no da una respuesta cerrada. En cambio deja registrado algo como "es muy probable que sea este sonido, y algo probable que sea aquel otro", con un puntaje para cada candidato.
Conviene mucho más dejar ese puntaje así, abierto. Si se decide de golpe con solo mirar un trozo, y después no encaja con el sonido que sigue, ya no se puede volver atrás. Dejar varios caminos abiertos y elegir al final, mirando toda la frase, cuál es el más probable, funciona mucho mejor.
El hilo de antes y después elige la respuesta
Hay muchísimas palabras que el puntaje de sonido solo no alcanza a distinguir. "Casa" y "caza" suenan igual, y "vino" en "este vino es buenísimo" y en "vino temprano" suena exactamente lo mismo.
Por eso el reconocimiento de voz también incluye una parte que conoce el hilo del habla. Si antes se dijo "compré una botella", "vino" va del lado de la bebida; si se dijo "llegó antes de lo esperado", va del lado de venir. Es la misma lógica con la que una persona sigue una conversación incluso en un lugar ruidoso.
Gracias a esta parte, el reconocimiento de voz puede reconstruir una frase aunque el sonido salga un poco borroso. En cambio, en un habla sin ese hilo que ayude, como el nombre de una persona que nunca se oyó o una serie de números al azar, los errores aumentan notablemente porque no hay nada de dónde agarrarse.
Ahora se aprende todo junto
Antes se armaban las piezas por separado y se las pegaba. Una parte que distinguía sonidos, un diccionario con la pronunciación de cada palabra, una parte que conocía el hilo de la frase: cada una se construía aparte y después se unían. Cada pieza necesitaba el trabajo de una persona, así que agregar un idioma nuevo era una obra enorme.
Ahora se muestran muchísimas grabaciones junto con su transcripción, y un solo modelo aprende de un tirón desde el sonido hasta las letras. Ya no hace falta que una persona construya el diccionario de pronunciación, y un mismo modelo puede manejar varios idiomas y grabaciones con ruido a la vez.
Las letras aparecen antes de que termine de hablar
Que las letras aparezcan en tiempo real en la pantalla significa que se está dando una respuesta sin conocer todavía lo que viene después. Por eso, cuando llega la frase siguiente, a veces lo que ya apareció escrito cambia un poco. No es un error: es que se está corrigiendo la respuesta a la luz del hilo completo.
Los espacios y los signos de puntuación no vienen en el sonido. Se agregan aparte, mirando pistas como si el tono sube al final o dónde se hace una pausa para respirar. Por eso las comas y los puntos de una transcripción a veces quedan en un lugar raro.
3Con más precisión
El reconocimiento de voz es el problema de convertir una secuencia de características extraídas de la onda de sonido en una secuencia de letras. Al dibujo del sonido se le llama espectrograma; a la parte que aprende la correspondencia entre sonido y letra se le llamaba modelo acústico, y a la que se encarga del hilo del habla, modelo de lenguaje. Los métodos actuales entrenan estas dos partes como un solo bloque, así que el límite entre ellas se volvió borroso, y a este método se le llama aprendizaje de extremo a extremo. El rendimiento se mide con la tasa de error de palabra, que cuenta cuánto se desvió lo transcrito del texto correcto.
También aquí la analogía tiene sus costuras. Quien transcribe entiende el significado mientras escribe, y si no entiende algo, puede volver a preguntar. El modelo no puede preguntar. Solo elige la secuencia de letras más probable y la entrega, así que también transcribe con total seguridad una frase que no tiene ningún sentido. Distinguir de quién es la voz, o cuántas personas están hablando, suele ir de la mano del reconocimiento de voz, pero en realidad es una tecnología aparte.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que el reconocimiento de voz entiende lo que se dice, pero en realidad solo pasa el sonido a letras, y entender el significado de esa frase es un paso aparte.
Es fácil creer que los errores se deben a una mala pronunciación, pero en realidad casi siempre se deben al ruido de fondo, a voces superpuestas o a nombres que nunca aparecieron en el entrenamiento.
Es fácil pensar que el reconocimiento de voz también identifica de quién es la voz, pero en realidad, distinguir quién habló es otra tecnología que se aprende por separado.
7Resumen en una línea
En resumenEl reconocimiento de voz corta el habla que se va en trozos muy cortos y los transcribe en letras, y elige la respuesta mirando no solo el sonido sino también el hilo de lo dicho antes y después.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02