Estimador de throughput de procesamiento por lotes LLM

Estima el throughput de un pipeline LLM por lotes a partir del número de workers o ranuras paralelas, la duración media de cada tarea y la eficiencia operativa. El resultado principal se expresa en tareas por hora y el desglose añade tareas por segundo y tiempo aproximado para procesar mil tareas.

Es útil para comparar configuraciones de concurrencia o para traducir benchmarks individuales en capacidad de lote. La eficiencia permite descontar huecos de cola, coordinación y tiempo ocioso sin atribuirlos a la duración base de cada tarea.

Datos de entrada

tareas
s
%
Resultado
tareas por hora
Tareas por segundo
Tareas por hora
Tiempo por 1.000 tareas
  1. Indica el paralelismo sostenible. Introduce cuántas tareas pueden ejecutarse al mismo tiempo de manera continua.
  2. Mide la duración media. Usa segundos por tarea bajo una carga comparable.
  3. Ajusta la eficiencia. Descuenta periodos sin trabajo útil, esperas y otras pérdidas.
  4. Revisa el throughput. Compara tareas/hora entre distintas configuraciones.
Throughput teórico (tareas/s) = tareas paralelas / segundos por tarea Throughput efectivo = throughput teórico × (eficiencia / 100) Tareas/hora = throughput efectivo × 3.600

El cálculo presupone que siempre hay trabajo disponible y que el paralelismo introducido puede sostenerse sin aumentar de forma significativa la duración por tarea.

Qué significa el resultado

Representa el ritmo de procesamiento efectivo esperado del lote con la concurrencia y eficiencia elegidas.

Si la duración crece al aumentar el paralelismo, vuelve a medirla para cada configuración en lugar de mantenerla constante.

Datos: 160 tareas simultáneas, 5,2 s por tarea y 88 % de eficiencia.

Cálculo: teórico = 160 / 5,2 = 30,77 tareas/s. Efectivo = 30,77 × 0,88 = 27,08 tareas/s. Por hora = 27,08 × 3.600 ≈ 97.477.

Resultado: aproximadamente 97.477 tareas por hora.

¿Qué se considera un worker en esta fórmula?

Cualquier ranura que pueda ejecutar una tarea en paralelo: un proceso, réplica o unidad lógica. Lo importante es que el número represente concurrencia sostenible.

¿Puedo usar milisegundos por tarea?

Convierte el valor a segundos dividiendo entre 1.000 antes de introducirlo.

¿Cómo estimo la eficiencia?

Compara throughput efectivo observado con el throughput ideal derivado del paralelismo y la duración. También puedes usar varios escenarios si aún no tienes mediciones.

¿Más paralelismo siempre aumenta el throughput?

No. Puede aparecer contención de GPU, memoria, red o colas, y la duración por tarea puede crecer.

¿En qué se diferencia de la estimación de latencia del lote?

El throughput expresa ritmo de trabajo; la estimación de latencia usa ese tipo de capacidad para calcular cuánto tarda en terminar un volumen concreto.