Memoria de videoVRAM
Espacio donde la tarjeta gráfica despliega los números por calcular
- La memoria de video (VRAM, Video RAM) es la mesa de trabajo donde la tarjeta gráfica despliega los números que va a calcular.
- Si no cabe todo en la mesa, no se vuelve lenta: directamente no arranca. Se detiene con un error.
- Lo que tiene que caber ahí es tres cosas: los números del modelo, la entrada y el historial de conversación actuales, y los resultados intermedios del cálculo.
- Si se guardan los números en una unidad más gruesa, en la misma mesa cabe un modelo más grande.
- Es un límite distinto al de la capacidad de cálculo. Uno es un problema de espacio; el otro, un problema de cantidad de trabajo.
Contenido
1La analogía
Piensa en la barra de una cocina pequeña. Para preparar un solo plato hay que sacar el arroz, las verduras, la salsa y las especias, y dejarlos todos al alcance de la mano antes de empezar. Si la barra es estrecha, da igual lo rápidas que sean las manos: si no caben todos los ingredientes extendidos, la preparación ni siquiera arranca.
La memoria de video que lleva la tarjeta gráfica es esa barra. Tiene un tamaño fijo, y solo lo que está sobre ella se puede usar en el cálculo. Si llegan varios pedidos y hay que tener dos ollas al fuego a la vez, hace falta más espacio, y si no lo hay, todo se detiene en el momento en que llega el pedido.
Da igual cuántos ingredientes haya guardados en la despensa del fondo. Solo lo que está puesto sobre la barra está al alcance de la mano.
2En detalle
Qué sube a la mesa de trabajo
El bloque más grande son los propios números del modelo. Estos números, fijados durante el entrenamiento, hacen falta durante todo el cálculo, así que ocupan espacio de principio a fin. En cuanto eliges un modelo, ya se ocupa más de la mitad de la mesa.
Después vienen la entrada actual y el historial de la conversación hasta ese momento. El modelo anota los resultados intermedios como una libreta, para no tener que recalcular lo ya leído, y esa libreta crece a medida que la conversación se alarga. Por último, los resultados intermedios que surgen al cruzar cada capa ocupan un poco de espacio y se liberan enseguida.
Si falta espacio, no se vuelve lenta: se detiene
Esta es la mayor diferencia frente a otros componentes. Una tarjeta lenta simplemente tarda más en dar la respuesta, pero al final la da. En cambio, si falta espacio, el cálculo ni siquiera puede empezar, y se detiene ahí mismo con un error.
Por eso este es el primer muro con el que se choca al intentar correr un modelo en el propio equipo. Si el cálculo es rápido o lento es una pregunta que viene después; primero hay que ver si cabe o no. Cuando el espacio queda muy justo, puede que una pregunta corta funcione y que meter un documento largo haga que todo se detenga: el historial de la conversación terminó de llenar la mesa.
Formas de ahorrar espacio
El método más usado es guardar los números con una unidad más gruesa. Si un número que llevaba muchos decimales se acorta, la misma cantidad de números ocupa la mitad o hasta la cuarta parte del espacio. Es parecido a picar los ingredientes más finos para que ocupen menos volumen. A cambio, se pierden diferencias muy pequeñas y la respuesta puede quedar algo menos fina.
Otra opción es reducir el lote que se procesa de una vez: es como poner una sola olla al fuego en vez de dos. Se ahorra espacio, pero terminar todo el trabajo lleva más tiempo. También se puede elegir de entrada un modelo más pequeño, repartir el modelo en varios trozos entre varias tarjetas, o bajar temporalmente a la memoria del equipo lo que no se está usando en ese momento.
El entrenamiento necesita mucho más espacio
Para solo recibir respuestas, basta con los números del modelo y el historial de la conversación. Pero para entrenar, hace falta subir además la señal que indica hacia dónde y cuánto corregir cada número, y los valores que van guardando el recorrido. Como el cálculo se devuelve hacia atrás, también hay que conservar, sin borrar, los resultados intermedios del camino de ida.
Por eso, incluso con el mismo modelo, entrenar necesita varias veces más espacio que solo recibir respuestas. De ahí que sea posible correr un modelo grande en el propio equipo, pero mucho más difícil entrenarlo. Es también la razón por la que se usan tanto los métodos que entrenan solo una pieza pequeña añadida, en vez de todo el modelo: ocupan mucho menos espacio en la mesa.
3Con más precisión
El espacio necesario se estima multiplicando el número de parámetros por el tamaño que ocupa cada número. Si un número se guarda en 16 bits, cada parámetro pesa 2 bytes; si se reduce a 4 bits, pesa 0,5 bytes. A esto se suma lo que crece con la longitud de la conversación, además de un margen. Esta parte crece a la vez con el número de capas y con la longitud de la conversación, así que en conversaciones largas se vuelve un bloque que no se puede ignorar.
La analogía también tiene sus costuras. Los ingredientes de la barra se pueden retirar un momento y volver a sacar cuando hagan falta, pero traer de vuelta, desde la memoria del equipo, un número que se bajó de la memoria de video es mucho más lento que el cálculo mismo. Por eso, si se ahorra espacio subiendo y bajando cosas todo el tiempo, la velocidad puede caer varias veces.
También puede pasar que el espacio libre parezca suficiente en total, pero esté repartido en trozos pequeños y no alcance para un bloque grande. El espacio disponible que se muestra y el que realmente se puede usar no siempre son lo mismo.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que basta con tener suficiente memoria en el equipo, pero en realidad la memoria de la tarjeta gráfica es aparte, y por muy grande que sea la del equipo, no puede usarse en su lugar.
Es fácil pensar que basta con el tamaño del archivo del modelo, pero en realidad hace falta más espacio para el historial de conversación y los resultados intermedios, así que conviene dejar un margen amplio.
Es fácil pensar que, si falta espacio, todo se vuelve un poco más lento, pero en realidad, casi siempre, se detiene ahí mismo con un error.
7Resumen en una línea
En resumenLa memoria de video es la mesa de trabajo donde se despliegan los números por calcular, y si no cabe todo ahí, el modelo no se vuelve lento: directamente no llega a funcionar.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02