GPU
El chip que hace muchos cálculos iguales a la vez
- La GPU (Graphics Processing Unit, unidad de procesamiento gráfico) es un componente que hace el mismo cálculo muchísimas veces a la vez.
- No es rápida porque termine un cálculo antes que nadie. Es rápida porque deja pasar muchos cálculos al mismo tiempo.
- Al principio era un chip para dibujar la pantalla. Pintar millones de puntos a la vez y hacer cálculos de IA tienen la misma forma, así que terminó usándose para eso también.
- Hay tareas que le sientan bien y otras que no. Una tarea donde hay que ver el resultado anterior para empezar la siguiente apenas se acelera al pasarla a este chip.
- El cómputo es la cantidad de trabajo por hacer, la memoria de video es el espacio donde se despliegan los números, y la GPU es el chip que procesa ese trabajo a la vez.
Contenido
1La analogía
Piensa en un peaje de autopista en un fin de semana de mucho tráfico. Si hay un solo carril, por más rápido que sea el auto que llega, tiene que esperar a que pase el de adelante. Para acortar la fila, conviene más multiplicar los carriles que hacer más veloz un solo auto.
La GPU es un peaje con miles de carriles. Cada carril, tomado por separado, es más bien lento. Pero si todos los autos siguen el mismo trámite, deja pasar miles a la vez.
Eso sí, hay una condición: todos los carriles tienen que seguir el mismo trámite. Si un auto saca su boleto automático y otro discute en la ventanilla, multiplicar carriles no acorta la fila. Ahí está la razón por la que los cálculos de IA le sientan tan bien a este chip: lo que hay que hacer son millones de multiplicaciones y sumas todas con la misma forma.
2En detalle
No es rápida, es que hace muchas cosas a la vez
El procesador central de una computadora se parece a unos pocos trabajadores muy fuertes. Cada uno es muy rápido y resuelve sin problema tareas con juicios complicados de por medio. A cambio, son pocos.
La GPU es lo contrario. Adentro hay miles de trabajadores pequeños que solo saben hacer cálculos simples. Si se los enfrenta uno contra uno, gana el procesador central. Pero si se le lanzan miles de esos mismos cálculos a la vez, el resultado se da vuelta.
Por eso, al elegir entre los dos chips, la pregunta no es "cuál es más rápido", sino "¿este trabajo se puede repartir en partes que corran a la vez?". Corregir una línea de un documento no necesita miles de carriles.
Por qué el cálculo de IA le sienta bien a este chip
Al mirar por dentro lo que hace una red neuronal, casi todo es multiplicar una tabla de números por otra tabla de números. En cada casilla de la tabla hay que multiplicar y sumar, y esos cálculos no necesitan esperarse entre sí: se puede calcular la casilla número cien sin saber el resultado de la primera.
Que no haga falta esperarse entre sí es lo decisivo. Cuantos más carriles se agregan, más rápido va, en la misma proporción. Pintar puntos en una pantalla tenía esa misma propiedad, así que un chip hecho para gráficos terminó encajando perfecto en el cálculo de IA.
En cambio, en una tarea donde hace falta el resultado anterior para empezar el siguiente cálculo, esta ventaja no funciona. Por más carriles que se agreguen, si los autos entran de a uno, el resto de los carriles queda vacío.
Separemos tres cosas que se confunden
Hay tres cosas que aparecen juntas pero son distintas. El cómputo cuenta cuántas veces hay que hacer el trabajo. Este número no baja aunque se agregue más equipo: crece cuando el modelo se hace más grande o cuando la entrada se alarga.
La memoria de video es el espacio donde se despliegan los números por calcular. Si el espacio no alcanza, no es que vaya más lento: directamente no puede empezar. Es un problema de espacio, así que no tiene nada que ver con el número de carriles.
La GPU es el chip que procesa ese trabajo de verdad, y corresponde al número de carriles. Cuando una respuesta tarda en llegar, qué hay que revisar depende de cuál de las tres está trabada. Si lo que frenó todo fue la falta de espacio, agregar carriles no sirve de nada.
El entrenamiento y la inferencia le exigen cosas distintas
El entrenamiento es la tarea que más le gusta a este chip. Los datos entran empujados en bloques de decenas o cientos a la vez, así que los carriles quedan llenos y el chip trabaja sin parar durante días. Por eso, para construir un modelo grande, se juntan cientos de estos chips a la vez.
Dar la respuesta final es un poco distinto. Como el texto se arma pegando pedazo tras pedazo, hace falta el pedazo anterior para empezar el siguiente, y de por medio quedan carriles vacíos. Por eso, en los servicios, se juntan varias solicitudes de distintas personas en un solo lote para llenar los carriles. Que el equipo quede ocioso en la madrugada, cuando hay pocas conexiones, tiene la misma razón de fondo.
No siempre es un chip gráfico
También hay chips hechos a propósito para el cálculo de IA, sin la función de dibujar pantallas y concentrados solo en multiplicar y sumar; el nombre cambia según la empresa. Hasta un teléfono trae un pequeño acelerador para mejorar fotos y reconocer voz.
El navegador también puede usar hoy el chip gráfico, y por eso ya hay herramientas donde un modelo de IA corre con solo abrir una página, sin instalar nada.
3Con más precisión
La GPU es un chip que reúne miles de unidades de cálculo simples y las hace trabajar aplicando la misma instrucción a números distintos, todo al mismo tiempo. A esa unidad de cálculo se le llama núcleo, aunque hace un trabajo distinto al núcleo de un procesador central. Los chips actuales traen además un circuito dedicado solo a la multiplicación de matrices, la operación que más se repite en una red neuronal.
La analogía también tiene sus límites. Los carriles de un peaje se mueven por su cuenta, pero los de este chip se agrupan y reciben la misma instrucción en bloque. Si se mezcla un cálculo donde el camino se bifurca según una condición, un grupo espera a que el otro termine y la velocidad baja. Además, en la práctica, lo que suele frenar las cosas es la velocidad para traer y sacar números de la memoria, más que el número de carriles: carriles vacíos con una rampa de entrada demasiado angosta. Por eso, al elegir equipo, conviene ver también qué tan rápido se mueven los números y cuánto se puede desplegar de una vez.
4Pruébalo
- Visualización TensorSpace ailearn.space Ver miles de números pasando a la vez por cada capa deja claro por qué hace falta un chip con tantos carriles
- WebLLM Chat (IA conversacional que corre en el navegador) ailearn.space El chip gráfico de tu propia computadora hace el cálculo. Por la velocidad de la respuesta se siente en carne propia lo que hace este chip
5Malentendidos comunes
Es fácil pensar que la GPU siempre es más rápida que el procesador central, pero en realidad, en una sola tarea, el procesador central suele ganar, y el orden se invierte solo cuando hay que hacer muchas a la vez.
Es fácil creer que la tarjeta gráfica de un videojuego y el chip para IA son objetos totalmente distintos, pero en realidad comparten la misma raíz, y se diferencian en la cantidad de memoria y en cómo se conectan varios equipos entre sí.
Es fácil pensar que con una buena GPU alcanza para correr un modelo grande, pero en realidad, si los números no caben en la memoria de video, el proceso ni siquiera puede empezar.
7Resumen en una línea
En resumenLa GPU es como un peaje con miles de carriles: deja pasar de una vez cálculos con la misma forma, y así sostiene el cálculo de IA.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02