- Define la demanda. Introduce solicitudes por segundo y tokens generados de media por solicitud.
- Usa un rendimiento realista por GPU. Obtén tokens/s por GPU de un benchmark con tu modelo, precisión, tamaño de lote y motor de inferencia.
- Añade reserva. Incorpora margen para picos, fragmentación y degradaciones.
- Revisa el redondeo. El resultado principal siempre sube a la siguiente GPU completa.
Estimador de GPU necesarias para inferencia LLM
Convierte una demanda de generación LLM en una estimación del número de GPU necesarias usando el rendimiento efectivo que puedes obtener por GPU. En lugar de asumir una arquitectura o un modelo concreto, el cálculo pide un dato medido de tokens por segundo y lo compara con la demanda agregada.
Es una forma rápida de crear escenarios de capacidad antes de una prueba de carga más completa. El resultado incorpora una reserva configurable y redondea hacia arriba, porque en la práctica la infraestructura se provisiona en unidades enteras.
Datos de entrada
El modelo supone que el rendimiento por GPU ya refleja el nivel de concurrencia y batching que piensas utilizar.
Qué significa el resultado
Es el número entero mínimo de GPU que cubre la demanda calculada después de aplicar la reserva de capacidad.
No comprueba si el modelo cabe en memoria ni si requiere paralelismo tensorial entre varias GPU; esos requisitos deben aplicarse además del cálculo de rendimiento.
Datos: 12 req/s, 420 tokens de salida por solicitud, 900 tokens/s por GPU y 25 % de reserva.
Cálculo: demanda = 12 × 420 = 5.040 tokens/s. GPU base = 5.040 / 900 = 5,6. Con reserva: 5,6 × 1,25 = 7.
Resultado: 7 GPU.
¿Debo usar tokens de entrada y salida?
Esta versión dimensiona por generación y utiliza tokens de salida. Si el prefill domina tu carga, mide un rendimiento efectivo que refleje también esa fase o modela ambas por separado.
¿De dónde saco los tokens por segundo por GPU?
De una prueba con el mismo modelo, cuantización, hardware y motor que usarás. El rendimiento teórico del chip no sustituye un benchmark de inferencia.
¿El resultado garantiza que el modelo cabe en memoria?
No. Debes comprobar memoria de pesos, KV cache, activaciones y cualquier requisito de paralelismo adicional.
¿Cómo trato el autoscaling?
Usa el resultado como capacidad necesaria durante la carga objetivo. Luego define mínimos, máximos y tiempos de escalado según el comportamiento de tu plataforma.
¿Por qué una GPU más rápida puede no reducir el número linealmente?
Porque batching, memoria, comunicación y scheduler pueden limitar la ganancia. Actualiza el rendimiento por GPU con mediciones reales al cambiar de hardware.