Estimador de GPU necesarias para procesamiento por lotes LLM

Calcula cuántas GPU hacen falta para completar un lote LLM dentro de una ventana de tiempo determinada. Parte del volumen de tareas y de los tokens de salida por tarea, los convierte en demanda total de generación y los compara con el rendimiento efectivo de una GPU.

La estimación es útil para planificar ejecuciones nocturnas, pipelines offline o campañas de procesamiento masivo. El resultado redondea a GPU enteras e incluye una reserva opcional, pero no sustituye la comprobación de memoria ni las restricciones de paralelismo del modelo.

Datos de entrada

tareas
tokens
h
tokens/s
%
Resultado
GPU necesarias para la ventana
Tokens totales de salida
GPU base
GPU con reserva
  1. Introduce el número de tareas. Usa el total que debe completarse dentro de la ventana.
  2. Estima la salida por tarea. Introduce tokens generados de media.
  3. Define la ventana objetivo. Expresa en horas el tiempo disponible.
  4. Introduce tokens/s por GPU. Usa rendimiento efectivo medido con tu configuración.
  5. Añade reserva. Cubre variabilidad, reintentos y capacidad no utilizable.
Tokens totales = tareas × tokens de salida por tarea Tokens/s requeridos = tokens totales / (horas × 3.600) GPU base = tokens/s requeridos / tokens/s por GPU GPU objetivo = GPU base × (1 + reserva / 100)

El cálculo dimensiona la fase de generación. Si el prefill o la preparación de datos son dominantes, debes incorporarlos al rendimiento efectivo medido.

Qué significa el resultado

Es el número mínimo de GPU enteras que, según el rendimiento introducido, debería cubrir el volumen del lote dentro de la ventana.

Comprueba además que la topología elegida satisface memoria, paralelismo y ancho de banda necesarios para el modelo.

Datos: 100.000 tareas, 300 tokens de salida, ventana de 6 h, 850 tokens/s por GPU y 20 % de reserva.

Cálculo: 30.000.000 tokens totales. Requeridos = 30.000.000 / 21.600 = 1.388,89 tokens/s. GPU base = 1.388,89 / 850 = 1,63. Con reserva = 1,96.

Resultado: 2 GPU.

¿Por qué solo se usan tokens de salida?

El cálculo se centra en capacidad de generación. Si el procesamiento de entrada es importante, usa un rendimiento efectivo por GPU que ya incluya esa carga o modela prefill por separado.

¿Qué rendimiento por GPU debo introducir?

El observado en una prueba con el modelo, precisión, batch y longitud representativos del lote.

¿Puedo fijar una ventana inferior a una hora?

Sí. Introduce horas decimales; por ejemplo, 0,5 para 30 minutos.

¿El redondeo puede dejar demasiado margen?

Con pocas GPU, redondear una unidad puede añadir bastante capacidad. Aun así, es necesario porque no puedes provisionar fracciones de GPU dedicadas en este modelo.

¿Qué pasa si uso GPU compartidas?

Reduce el rendimiento efectivo por GPU para reflejar la fracción realmente disponible o modela solo las GPU equivalentes dedicadas a este lote.