LatenciaLatency
El tiempo que pasa entre enviar la pregunta y recibir la respuesta
- La latencia es el tiempo de espera desde que se envía la pregunta hasta que llega la respuesta.
- Ese tiempo tiene dos tramos. Hasta que aparece la primera letra y hasta que termina toda la respuesta se miden por separado.
- El primer tramo depende sobre todo de la longitud de lo que se envió y de la cola de espera. Un documento largo pegado delante de la pregunta se convierte directamente en espera.
- El segundo tramo es casi proporcional a la longitud de la respuesta, porque los fragmentos se generan y se envían uno por uno.
- Hacer que el texto aparezca fluyendo en pantalla no cambia el tiempo total, pero reduce muchísimo la sensación de espera.
Contenido
1La analogía
Al llamar a un ascensor se espera dos veces. La primera es hasta que se abre la puerta: eso depende de en qué piso está el ascensor y de si alguien lo llamó antes. La segunda es desde que se sube hasta llegar al piso de destino, y ahí casi todo depende de cuántos pisos hay que subir.
Las dos esperas son de naturaleza distinta. Que la puerta se abra rápido no significa llegar rápido al piso de destino, y al revés: se puede esperar un buen rato para subir y bajarse enseguida porque solo hay que subir un piso. El tiempo que pasa cuando se le pregunta algo a una IA también se reparte en estos dos tramos. Todo ese tiempo de espera junto es la latencia.
2En detalle
La espera se divide en dos tramos
El primer tramo va desde que se envía la pregunta hasta que la primera letra aparece en pantalla. En este tramo todavía no se ha generado ni una sola letra de la respuesta. La petición está llegando al servidor, esperando su turno y leyéndose de principio a fin.
El segundo tramo va desde que aparece la primera letra hasta que la respuesta termina. Es el tiempo en que se genera un fragmento tras otro, así que cuanto más larga es la respuesta, más se alarga.
Los mismos tres segundos pueden esconder cosas distintas por dentro. No es lo mismo que la primera letra tarde 2,5 segundos y el resto fluya casi de inmediato, que empezar a los 0,5 segundos y fluir despacio: lo que hay que arreglar en cada caso es diferente.
Por qué se alarga el primer tramo
La razón más frecuente es que lo que se envió es demasiado largo. Antes de generar la respuesta hace falta leer todo el texto de entrada, y si se pegan varias páginas de un documento, esa sola lectura ya consume bastante tiempo.
La segunda razón es la cola de espera. Cuando llegan muchas peticiones a la vez, hay que esperar el turno propio. Por eso las respuestas empiezan notablemente más tarde en las horas de más uso.
La tercera razón es la distancia que recorre la petición. Si el pedido viaja hasta una máquina al otro lado del mundo y vuelve, ese ida y vuelta se suma. Comparado con el tiempo de cálculo es poco, pero en programas que envían muchas preguntas cortas seguidas, este peso se nota bastante más.
El segundo tramo lo decide la longitud
La respuesta se genera de un fragmento por vez. Como el tiempo que toma cada fragmento es casi constante, si la respuesta duplica su número de fragmentos, este tramo también se duplica. Por eso una simple frase como "responde brevemente" recorta la espera de forma notable.
El español también gasta más fragmentos que el inglés para la misma idea, así que la respuesta fluye algo más despacio. Pedir una tabla o una lista larga aumenta mucho el número de fragmentos, y esa lentitud se nota claramente.
Responder razonando paso a paso también suma tiempo, porque se generan fragmentos incluso en partes que no se muestran en pantalla. A cambio de una respuesta más precisa se cede tiempo, así que para tareas simples conviene pedir respuestas cortas.
Las palancas para acortar la espera
Quitar lo que sobra del texto de entrada acorta el primer tramo. Reducir las instrucciones que se repiten en cada mensaje y meter solo los pasajes relevantes de un documento es lo más efectivo.
Cuando la misma pregunta se repite mucho, guardar la respuesta y devolverla tal cual hace que la espera casi desaparezca. Usar un modelo pequeño y ligero para tareas que no necesitan uno grande también ayuda.
Por último está dejar que el texto salga fluyendo. En vez de mostrar la respuesta completa de golpe al terminar, mostrarla a medida que se genera mantiene el tiempo total igual, pero la persona lo siente mucho más rápido, porque tiene algo que leer mientras espera.
3Con más precisión
La latencia es el tiempo que tarda en completarse una sola petición, y su contraparte es el rendimiento, que mide cuántas peticiones se procesan en el mismo tiempo. Ambos suelen moverse en direcciones opuestas. Agrupar varias peticiones y calcularlas todas juntas dispara el número de peticiones procesadas por hora, pero cada petición que esperó a que se completara el lote tarda más en recibir su respuesta.
La analogía también tiene sus límites. En el ascensor se sabe de antemano a qué piso se va apenas se sube, pero la IA no sabe cuánto va a durar la respuesta cuando recién empieza, así que no puede avisar de antemano cuándo va a terminar. Además, el número de pisos siempre es el mismo, pero aquí la misma pregunta enviada dos veces puede tardar tiempos distintos, porque depende de cuánto tráfico tenga el servidor en ese momento y de cuánto haya crecido la conversación previa. Por eso, al medir la latencia no basta con medirla una sola vez: conviene medirla varias veces y mirar tanto el valor típico como los casos anormalmente lentos. Mirar solo el promedio hace fácil pasar por alto un problema que aparece una de cada diez veces.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que con más velocidad de internet la respuesta llega más rápido, pero en realidad la mayor parte de la espera viene del cálculo y de la cola, así que la velocidad de la conexión cambia poco las cosas.
Es fácil pensar que si la primera letra aparece rápido, todo el resto también será rápido, pero en realidad los dos tramos van por su cuenta, y es común que el arranque sea veloz mientras el final tarda mucho más.
Es fácil pensar que la misma pregunta siempre tarda lo mismo, pero en realidad el tiempo puede multiplicarse varias veces según cuánto tráfico haya en ese momento.
7Resumen en una línea
En resumenLa latencia se reparte en dos tramos —hasta la primera letra y hasta el final de la respuesta— y saber cuál de los dos es el largo es lo que muestra dónde recortar.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02