Servicio de modelosModel Serving
Poner un modelo entrenado a disposición de muchos usuarios
- El servicio de modelos es el trabajo de operar el modelo ya entrenado: subirlo a una computadora y devolver una respuesta por cada petición que llega.
- Tener el archivo del modelo no significa que ya se pueda usar. Hace falta un tiempo aparte para subirlo y dejarlo listo.
- Cuando se juntan muchas peticiones, se forma una cola. Se agregan más lugares de cálculo mientras dura, y se reducen cuando baja la demanda.
- Agrupar varias peticiones para procesarlas juntas aumenta el total atendido, pero la respuesta de cada persona llega más tarde por la espera del agrupamiento.
- Al pasar a una versión nueva, no se cambia todo de golpe. Primero se prueba con una parte y, si no hay problemas, se extiende al resto.
Contenido
1La analogía
Que un colectivo nuevo llegue al depósito no significa que ya pueda subir cualquiera. Hay que asignarlo a una línea, armar el horario y encender el motor antes de la primera salida para que recién ahí suba gente. Fabricar el vehículo y llevar pasajeros son trabajos completamente distintos.
El servicio de modelos es ese trabajo de asignar la línea. El modelo ya entrenado es como el colectivo estacionado en el depósito: hay que subirlo a una computadora y dejarlo listo para que pueda recibir peticiones. Igual que se suman colectivos en la hora pico, cuando aumenta la gente se agregan lugares de cálculo, y cuando baja se reducen.
Si un colectivo se rompe, la línea no puede detenerse, así que se deja uno de repuesto listo, y al cambiar a un vehículo nuevo también se lo incorpora de a uno, con cuidado.
2En detalle
Estacionado en el depósito, nadie puede subir
Hacer un modelo y ponerlo a disposición son tareas tan distintas que suelen tener responsables diferentes. El entrenamiento se parece a una obra grande que se hace una sola vez; el servicio es una operación diaria, como sacar el mismo colectivo a la misma hora todos los días. Que el entrenamiento termine y salga el archivo solo significa que el vehículo está terminado.
Para recibir peticiones, el modelo tiene que quedar cargado entero en la memoria del equipo de cálculo. Ese proceso de preparación no es corto, así que si se sube y se baja cada vez que llega una petición, la respuesta se atrasa mucho. Por eso lo habitual es dejarlo encendido, esperando. Que la primera petición después de un rato sin uso tarde especialmente es porque en ese momento se está encendiendo el motor.
Mientras está encendido, aunque nadie lo use, sigue generando gasto por ese espacio. De ahí que decidir cuánto tiempo mantenerlo así, o si apagarlo de noche, se traduzca directamente en costo.
En las horas pico se agregan más lugares
Cada lugar de cálculo tiene un límite de cuántas peticiones puede atender a la vez. Si llegan peticiones por encima de ese límite, las que llegan después esperan en la cola hasta que termine el cálculo de las anteriores. La sensación de "hoy está lento" que nota quien usa el servicio casi nunca es porque el cálculo se volvió lento, sino porque la cola se hizo larga.
Por eso al servicio se le agrega un mecanismo que suma lugares cuando aumenta la demanda y los reduce cuando baja. Eso sí, abrir un lugar nuevo también toma su tiempo de preparación, así que si la demanda sube de golpe, la velocidad a la que se agregan lugares no alcanza a seguirle el ritmo a la cola que crece. Por eso se mantienen algunos lugares ya calentados de antemano.
En un mismo viaje suben varios
Procesar las peticiones de a una es mucho menos eficiente que juntar varias y calcularlas de una vez. El equipo de cálculo está hecho para procesar muchas cosas al mismo tiempo, así que salir con un solo pasajero es dejar asientos vacíos.
A cambio, para agrupar hay que esperar un momento. Cuanto más larga esa espera, más tarda la respuesta que siente cada persona. Atender mucho en total y responder rápido a cada uno son objetivos que tiran para lados opuestos, así que según el tipo de servicio se decide hacia dónde inclinarse. Si es una conversación en tiempo real, se acorta la espera; si es repasar documentos durante la noche, se agranda el agrupamiento.
La versión nueva sube de a un vehículo
Si al cambiar el modelo a una versión nueva se reemplazan todos los lugares de golpe, no queda margen para retroceder aunque aparezca un problema. Por eso se sube la versión nueva en solo algunos lugares, se dejan pasar algunas peticiones por ahí, se observa la calidad y la velocidad de las respuestas, y recién después se extiende. Si algo anda mal, basta con devolver ese lugar a la versión anterior.
A veces se mantiene la versión vieja funcionando un tiempo en paralelo. Si el tono o el formato de la respuesta cambia, los programas que dependían de esa respuesta también se tambalean, así que se les da tiempo para adaptarse.
Dónde se ubica el depósito
Lo más común es que la empresa del servicio se encargue del depósito, y quien lo usa solo envíe peticiones. Se le delega el trabajo de sumar y reducir lugares, de reemplazar de noche un vehículo que se rompió, y a cambio se paga según lo que se usa.
Los lugares donde los datos no pueden salir hacia afuera, o donde el uso es siempre parejo, a veces montan su propio depósito. Últimamente también se usa la variante de subir un modelo pequeño directo al equipo o al navegador de cada usuario. Ahí el depósito pasa a ser uno por persona, así que la preocupación por la cola desaparece, pero el tiempo de la primera descarga y la capacidad del equipo se convierten en el nuevo obstáculo.
3Con más precisión
En el servicio de modelos, el cuello de botella más frecuente no es la velocidad de cálculo sino la memoria. El modelo tiene que estar cargado entero, y a medida que la conversación se alarga, también crece el espacio que ocupa mantenerla. Cuántas peticiones puede atender a la vez un mismo lugar suele depender justamente de esta memoria. Por eso se combina reducir el peso del modelo al subirlo con reutilizar respuestas frecuentes guardadas de antemano.
La analogía también tiene sus límites. Un colectivo tiene una capacidad fija y visible, pero la capacidad de un lugar de servicio cambia según la longitud de cada petición. El colectivo recorre siempre la misma línea, pero el mismo modelo atiende toda clase de pedidos. Y sobre todo, el trabajo del colectivo termina cuando deja a los pasajeros, mientras que el servicio del modelo sigue vigilando velocidad y errores incluso después de devolver la respuesta, y sigue ajustando los lugares. Cuanto mejor funciona un servicio, menos se nota para quien lo usa: la señal de que todo va bien es, sencillamente, que nadie tiene nada de qué quejarse.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que en cuanto termina el entrenamiento ya se puede usar, pero en realidad hace falta una operación aparte que lo mantenga listo para que la gente pueda usarlo.
Es fácil pensar que si la respuesta es lenta, es porque el modelo es lento, pero en realidad casi siempre se debe a la cola de espera o a que aún no hay un lugar listo.
Es fácil pensar que el servicio es un trabajo más liviano que el entrenamiento, pero en realidad, al estar encendido todo el día, mantenerlo mucho tiempo puede exigir más esfuerzo en total.
7Resumen en una línea
En resumenEl servicio de modelos es como asignar un colectivo ya construido a su línea: importa menos qué tan bueno es el modelo y más qué tan seguido y a tiempo responde.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02