InferenciaInference
El momento en que un modelo ya entrenado responde
- La inferencia es el momento en que un modelo ya entrenado recibe una entrada nueva y da una respuesta. Aprender y usar lo aprendido ocurren en momentos distintos.
- Mientras infiere, el modelo no aprende nada. Los números que tiene adentro se quedan igual; solo calcula la entrada que llega y la devuelve.
- El entrenamiento suele ser una sola vez, pero la inferencia ocurre cada vez que se usa. Por eso, cuanto más tiempo funciona un servicio, más pesa la parte de inferencia.
- La inferencia es más útil cuanto más rápida es. Si juzgar una sola foto tarda diez segundos, no sirve para meterla en una aplicación de cámara.
- Con la misma entrada, la respuesta no siempre sale igual. Cambia un poco según cómo se elige una entre varias candidatas.
Contenido
1La analogía
Hay personas que llevan meses revisando una aplicación de compraventa de segunda mano. Después de repasar cientos de casos, viendo a qué precio se publicó algo y a qué precio se terminó vendiendo, el ojo para los precios se afina solo. Entonces aparece la foto de un artículo nuevo y, sin volver a repasar todas las ventas anteriores, ahí mismo dice: "esto anda por acá". Ese instante breve en que se pone el precio es la inferencia.
Aprender el mercado y poner el precio son dos tareas completamente distintas. Aprenderlo tomó meses, pero ponerle precio a un solo artículo toma unos segundos. Eso sí, poner el precio hay que hacerlo de nuevo, desde cero, cada vez que aparece un artículo nuevo.
Y mientras se pone el precio, el criterio interno no cambia. Ver este artículo en particular no actualiza el sentido del mercado que ya se tenía.
2En detalle
Aprender e inferir ocurren en momentos distintos
Usar un modelo se divide en dos tramos. El primer tramo es el entrenamiento: se le muestra mucho material y se van corrigiendo poco a poco los números de adentro. El segundo tramo es la inferencia: los números ya corregidos se dejan tal cual, y una entrada nueva pasa por esos números para sacar un resultado.
Los dos tramos suelen ocurrir en días distintos y en computadoras distintas. El entrenamiento lo hace, semanas antes, quien construye el modelo; la inferencia ocurre cada vez que la persona que lo usa aprieta un botón. Casi todos los momentos en que usamos un servicio de IA son, en realidad, del lado de la inferencia.
Mientras infiere, no aprende nada
Después de conversar un buen rato con un chatbot da la impresión de que esa conversación le está enseñando algo sobre uno. Pero mientras corre la inferencia, los números de adentro del modelo no cambian ni un poco. Que la conversación parezca continuar se debe a que, cada vez, se le vuelve a pegar todo lo dicho hasta ese momento a la entrada.
Por eso, al abrir una conversación nueva, desaparece lo que se había contado antes. Como no aprendió nada, tampoco hay nada que olvidar. Para que lo conversado quede reflejado de verdad en el modelo, hace falta un trabajo aparte que reúna ese contenido y vuelva a entrenar con él.
Cada uso cuesta de nuevo
El entrenamiento se paga una vez, en grande, y ya. La inferencia no funciona así. Cada vez que una persona hace una pregunta, el cálculo corre otra vez desde el principio. Si hay un millón de personas usándolo, son un millón de veces; si cada una lo usa diez veces al día, son diez millones.
Un solo cálculo es liviano comparado con el entrenamiento. Pero como se repite tantísimas veces, cuanto más tiempo lleva funcionando un servicio, la parte que ocupa la inferencia en el costo total termina superando al entrenamiento. Por eso los servicios de IA vienen con límites de uso y planes de precios.
La velocidad de respuesta define la utilidad
Con la inferencia no alcanza con acertar. Para que una aplicación de cámara reconozca un objeto en la pantalla, el juicio tiene que salir en una fracción de segundo, y un sistema de asistencia al manejar necesita ser todavía más rápido. Si el tiempo de espera se alarga, por más que acierte no sirve de nada en ese momento.
Por eso, quien construye el modelo a veces sacrifica algo de exactitud a cambio de una inferencia más liviana: reduce la cantidad de dígitos de los números, recorta las partes que casi no se usan, o entrena por separado un modelo más chico que imite el juicio del modelo grande.
Dónde calcular también hay que elegirlo
La inferencia puede ocurrir en un servidor lejano o dentro del propio dispositivo que se tiene en la mano. Hacerla en un servidor permite usar un modelo grande, pero exige conexión a internet y los datos salen del dispositivo. Hacerla dentro del dispositivo responde de inmediato sin internet y los datos no salen, pero el tamaño de modelo que cabe ahí es mucho menor.
Que hoy funciones de un teléfono, como ordenar fotos o generar subtítulos, sigan andando incluso en un avión se debe a que esa inferencia ocurre dentro del propio dispositivo. En cambio, un servicio que redacta textos largos todavía depende de la inferencia del lado del servidor.
3Con más precisión
La inferencia es el cálculo que hace pasar una entrada una sola vez por los parámetros ya fijados tras el entrenamiento, para obtener una salida. A este cálculo en una sola dirección se le llama propagación hacia adelante. El entrenamiento agrega, además, un paso que corrige los números repasando hacia atrás cuánto se equivocó la respuesta; la inferencia no tiene ese paso, así que resulta mucho más liviana y rápida. Por eso el entrenamiento necesita varios equipos costosos, mientras que la inferencia a menudo corre en un solo equipo pequeño o hasta dentro de un teléfono. También se junta el pedido de varias personas y se calcula todo de una vez para aumentar cuántas respuestas se procesan por segundo.
La analogía también tiene sus límites. Una persona actualiza un poco su sentido del mercado cada vez que ve un artículo nuevo, pero un modelo jamás cambia con una sola inferencia. Además, la palabra "inferencia" trae a la mente un razonamiento cuidadoso, pero lo que se llama inferencia aquí se acerca más a hacer pasar un cálculo ya fijado una sola vez. Que algunos modelos actuales alarguen su razonamiento antes de responder tampoco es que se pongan a pensar: es que fabrican un texto intermedio más largo y repiten la inferencia varias veces.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que la IA aprende de uno mientras conversan, pero en realidad, durante la inferencia, los números de adentro del modelo se quedan igual. Que la conversación parezca seguir se debe a que se vuelve a meter lo dicho antes en cada entrada.
Es fácil creer que solo el entrenamiento sale caro y usarlo después es casi gratis, pero en realidad la inferencia se repite tantas veces como usuarios haya, así que cuanto más tiempo funciona un servicio, más pesa esa parte.
Es fácil pensar que la inferencia es razonar con calma como una persona, pero en realidad es un cálculo que hace pasar una entrada, una sola vez, por números ya fijados.
7Resumen en una línea
En resumenLa inferencia es el momento en que un modelo ya entrenado recibe una entrada nueva y ahí mismo da una respuesta, y es casi todo el tiempo que pasamos usando IA en la práctica.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02