Estimador de capacidad de latencia para inferencia LLM

Estima cuántas solicitudes deben poder estar en proceso simultáneamente para sostener una carga de inferencia LLM con una latencia determinada. La relación sigue una forma práctica de la ley de Little: concurrencia aproximada igual a tasa de llegada multiplicada por tiempo de permanencia.

El cálculo ayuda a dimensionar colas, réplicas y límites de concurrencia. No intenta predecir la latencia de un modelo concreto; parte de una latencia medida o fijada como objetivo de diseño y la convierte en una necesidad de capacidad simultánea.

Datos de entrada

req/s
ms
%
Resultado
solicitudes simultáneas de capacidad
Concurrencia base
Holgura añadida
Capacidad redondeada
  1. Introduce la tasa de llegada. Usa las solicitudes por segundo que el servicio debe sostener.
  2. Indica la latencia de diseño. Emplea una medición representativa, preferiblemente del percentil que quieras proteger.
  3. Define la holgura. Añade capacidad para variaciones de tráfico, jitter y pequeñas degradaciones.
  4. Revisa la concurrencia. El valor base aproxima las solicitudes activas a la vez; el principal incluye la holgura y se redondea hacia arriba.
Concurrencia base = solicitudes por segundo × (latencia en ms / 1.000) Capacidad objetivo = concurrencia base × (1 + holgura / 100)

La fórmula supone una carga relativamente estable y que la latencia usada representa el tiempo completo durante el que una solicitud ocupa capacidad.

Qué significa el resultado

Indica cuántas solicitudes concurrentes debería admitir el sistema para sostener la tasa introducida sin que la cola crezca de forma sostenida.

La latencia puede aumentar con la propia concurrencia; valida el resultado con pruebas de carga y ajusta por límites de memoria, batching y scheduler.

Datos: 25 req/s, 1.800 ms de latencia y 20 % de holgura.

Cálculo: 25 × 1,8 = 45 solicitudes simultáneas base. Con holgura: 45 × 1,20 = 54.

Resultado: capacidad objetivo de 54 solicitudes simultáneas.

¿Qué latencia conviene introducir?

Usa la métrica que corresponda a tu SLO. Si el objetivo se define con p95, introducir p95 suele ser más prudente que usar solo la media.

¿Puedo introducir solicitudes por minuto?

Convierte primero el valor a solicitudes por segundo dividiendo entre 60. La calculadora trabaja en req/s para mantener las unidades consistentes.

¿La concurrencia equivale al número de GPU?

No. La concurrencia es una necesidad de servicio; para convertirla en GPU necesitas conocer el rendimiento y los límites de cada GPU o réplica.

¿Qué pasa si hay picos breves?

Una media de tráfico puede infradimensionar el sistema. Modela el pico esperado o añade holgura suficiente para absorberlo.

¿Por qué la capacidad se redondea hacia arriba?

No puedes provisionar una fracción de ranura concurrente. El redondeo evita quedar por debajo del valor calculado.