CómputoCompute

El total de cálculo que cuesta ejecutar el modelo una vez

Puntos clave
  • El cómputo es el número total de multiplicaciones y sumas que hacen falta para ejecutar el modelo una vez.
  • No es el tiempo que tarda, sino la cantidad de trabajo que hay que hacer. El mismo trabajo, repartido entre más equipos, tarda menos.
  • Entrenar recorre los datos una y otra vez, así que exige un cómputo incomparablemente mayor que responder una sola vez.
  • Crece con el tamaño del modelo y con el largo de la entrada. La longitud de la entrada es lo que más rápido lo dispara.
  • El cómputo se traduce directo en factura eléctrica y en alquiler de equipos. Es un límite distinto al de quedarse sin memoria.
Contenido

1La analogía

Imagina un día cualquiera en un centro logístico de paquetería. Hoy entraron 10.000 cajas, y cada caja necesita cinco toques de mano —escanear, clasificar, cargar— antes de salir. El trabajo de hoy, entonces, son 50.000 toques. Esos 50.000 son el cómputo.

Ese número no cambia si el almacén es grande o pequeño, ni si hay mucha o poca gente trabajando. Si se duplica la cinta transportadora, los mismos 50.000 toques se terminan en medio día. Solo cuando entran el doble de cajas, o se añade un toque más por caja, el total del trabajo realmente aumenta.

Por eso el dueño del centro mira dos números distintos: cuántos toques hay que dar hoy, y en cuántas horas se pueden terminar. El primero es el cómputo.

2En detalle

La cantidad de trabajo se cuenta en multiplicaciones

Casi todo lo que pasa dentro de un modelo es multiplicar números y sumarlos. Cada vez que se atraviesa una capa, el bloque de números que entra se empareja con el bloque de números que tiene esa capa, y esa multiplicación y suma ocurre millones de veces. Al terminar todas las capas, esas veces se acumulan y dan el total que cuesta responder una sola vez.

Por eso el cómputo no se mide en segundos ni en minutos. Se mide en el tamaño mismo del trabajo, como la cantidad de cajas. El tiempo es apenas el resultado de dividir ese tamaño entre la velocidad del equipo. Por eso el mismo modelo puede tardar un segundo en una computadora y treinta en otra, y aun así el cómputo es idéntico.

Entrenar y usar son de otra magnitud

Usar un modelo se parece a sacar una sola caja del almacén y despacharla. Una pregunta, una respuesta, unos segundos y listo. Entrenarlo es una obra enorme que reordena el almacén entero una y otra vez: dar una respuesta, medir cuánto se equivocó, y corregir paso a paso hacia atrás, repitiendo esto sobre todos los datos incontables veces.

Corregir hacia atrás cuesta más o menos el doble que dar la respuesta. A eso se le suma cuántas veces se recorren los datos, y la diferencia se dispara a millones de veces. De ahí viene que entrenar un modelo grande implique miles de computadoras trabajando durante semanas.

Qué hace crecer el cómputo

Primero, el tamaño del modelo. Si se duplican los números que ajusta el entrenamiento, las multiplicaciones también se duplican, más o menos. Segundo, la cantidad de datos: si el texto por recorrer se duplica, el trabajo de entrenar también.

Tercero, el largo de la entrada, que crece de otra manera. Hay un cálculo donde cada trozo de la frase se compara con todos los demás, así que si el largo se duplica, esa parte del trabajo casi se cuadruplica. Por eso meter un documento entero muy largo sale mucho más caro que diez preguntas cortas. Recibir una respuesta larga también aumenta el trabajo, porque cada trozo adicional exige otra vuelta completa de cálculo.

Cómo terminar lo mismo por menos

Hay dos caminos: reducir el trabajo total, o subir la velocidad de proceso. Para reducir el total se usa un modelo más pequeño, se traslada el conocimiento de un modelo grande a uno chico, o se pasan los números a una unidad más gruesa para que cada multiplicación sea más liviana. Si la misma pregunta se repite, también sirve guardar el resultado ya calculado y reutilizarlo.

Subir la velocidad va por repartir el trabajo entre más equipos. Pero no se puede repartir indefinidamente. El resultado de una capa hace falta para calcular la siguiente, así que por más gente que se sume no se puede saltar el orden. Coordinar lo que cada equipo calculó también toma tiempo, y llegado cierto punto, sumar más equipos ya no acelera gran cosa.

3Con más precisión

El cómputo suele medirse en FLOPs (operaciones de punto flotante, Floating Point Operations). El total que cuesta entrenar un modelo de lenguaje grande se estima, a grandes rasgos, proporcional al número de parámetros multiplicado por la cantidad de tokens usados en el entrenamiento. El costo de generar una sola respuesta es mucho menor: se calcula aproximadamente el doble del número de parámetros.

La analogía también tiene sus costuras. Las cajas del almacén se pueden procesar por separado, sin depender unas de otras, pero en una red neuronal el resultado anterior es el material del cálculo siguiente, así que el orden es obligatorio. Por eso duplicar los equipos no reduce el tiempo exactamente a la mitad.

Otro punto: muchas veces la respuesta llega tarde no por el número de multiplicaciones, sino porque el equipo de cálculo pasa el rato esperando a que los números lleguen desde la memoria. El cómputo es una buena medida del costo, pero no predice la velocidad tal cual: dos modelos con el mismo cómputo pueden sentirse muy distintos de rápidos según cómo estén organizados por dentro y qué tan bien aprovechen el equipo donde corren.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que el cómputo es directamente el tiempo que tarda, pero en realidad el mismo cómputo puede tardar mucho más o mucho menos según el equipo y en cuántas partes se reparta.

  • Es fácil pensar que con una buena tarjeta gráfica alcanza para correr un modelo grande, pero en realidad, aunque el cálculo sea rápido, si no hay espacio para guardar los números, ni siquiera arranca.

  • Es fácil pensar que responder una pregunta sale tan barato que no importa, pero en realidad, aunque una sola vez sea barata, sumadas cientos de millones de veces pueden superar con creces lo que costó entrenar.

7Resumen en una línea

En resumenEl cómputo es el total de cálculo que cuesta ejecutar un modelo, y esa cantidad es lo que define la factura y el tiempo de espera.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02