- Indica cuántas GPU sirven tráfico. Cuenta solo las unidades disponibles para esta carga.
- Introduce el rendimiento por GPU. Usa tokens/s observados con la configuración prevista.
- Ajusta la eficiencia. Reduce el ideal para representar huecos de batching, sobrecarga, balanceo y capacidad reservada.
- Define la salida media. Permite convertir tokens/s efectivos en solicitudes/s aproximadas.
- Compara escenarios. Cambia GPU o eficiencia para estudiar la capacidad disponible.
Estimador de throughput de inferencia LLM
Estima el throughput disponible de un servicio de inferencia LLM a partir del número de GPU, el rendimiento efectivo por GPU y el tamaño medio de la respuesta. El cálculo ofrece tanto tokens por segundo como una aproximación de solicitudes por segundo.
Resulta útil para comparar configuraciones de hardware o comprobar si una flota puede sostener un objetivo de tráfico. Como el rendimiento real depende del batching, la longitud de secuencia y la implementación, conviene introducir una cifra de tokens/s medida en condiciones cercanas a producción.
Datos de entrada
La conversión a solicitudes/s presupone una longitud media de salida estable y no modela por separado el coste de prefill.
Qué significa el resultado
Representa la capacidad efectiva de generación que la flota puede entregar bajo la eficiencia indicada.
Si las solicitudes tienen longitudes muy variables, complementa la media con escenarios de percentiles y pruebas bajo concurrencia real.
Datos: 8 GPU, 950 tokens/s por GPU, 85 % de eficiencia y 400 tokens de salida por solicitud.
Cálculo: teórico = 8 × 950 = 7.600 tokens/s. Efectivo = 7.600 × 0,85 = 6.460 tokens/s. Solicitudes/s ≈ 6.460 / 400 = 16,15.
Resultado: 6.460 tokens/s efectivos y unas 16,15 req/s.
¿Qué significa eficiencia operativa?
Es la fracción del throughput teórico que esperas sostener de forma útil. Resume pérdidas por batching imperfecto, planificación, balanceo y otras sobrecargas.
¿Puedo usar el rendimiento máximo publicado del hardware?
Puedes usarlo para un escenario optimista, pero para planificación es mejor un benchmark del modelo y motor concretos.
¿Por qué el throughput en solicitudes depende de la longitud de salida?
Porque una solicitud que genera más tokens consume una mayor parte de la capacidad de generación. Con el mismo tokens/s, respuestas más largas reducen req/s.
¿Este cálculo incluye tokens de entrada?
No de forma explícita. Si el prefill es significativo, incorpora su efecto en el rendimiento efectivo por GPU que introduces.
¿Cómo comparo dos configuraciones?
Mantén iguales la longitud de salida y el criterio de eficiencia, cambia GPU o rendimiento por GPU y compara tokens/s efectivos.