Estimador de capacidad por latencia para datos sintéticos

Este estimador convierte una tasa de generación y una latencia media en la cantidad de trabajos simultáneos que el sistema debería poder mantener. En flujos de datos sintéticos, una cola puede crecer aunque el total diario parezca razonable si cada generación tarda demasiado; por eso la relación entre llegadas y tiempo de servicio es clave para dimensionar capacidad.

El cálculo incorpora un objetivo de utilización para no diseñar el sistema al 100 % de ocupación. El resultado es una referencia de slots concurrentes necesarios, útil para decidir cuántas réplicas, workers o procesos paralelos deben estar disponibles.

Demanda y tiempo de servicio

tareas/min
s
%
Resultado
Slots concurrentes
Concurrencia ocupada
Holgura de capacidad
Utilización objetivo

1. Introduce la tasa de trabajo. Indica cuántas tareas llegan por minuto en el escenario que quieres dimensionar.

2. Añade la latencia media. Usa el tiempo medio durante el que una tarea ocupa capacidad de procesamiento.

3. Define la utilización objetivo. Elige el porcentaje máximo de ocupación sostenida que quieras asumir.

4. Revisa la concurrencia ocupada. Comprueba cuántos slots estarían ocupados de media con esa carga.

5. Usa la recomendación redondeada. Toma los slots concurrentes recomendados como punto de partida y añade redundancia si tu arquitectura la necesita.

Slots requeridos = (tareas/min × latencia en s / 60) ÷ (utilización/100)

La primera parte estima la concurrencia media ocupada mediante la relación entre tasa de llegada y tiempo de servicio. Dividir por la utilización objetivo añade capacidad libre.

Qué significa el resultado

El resultado es el número aproximado de trabajos que el sistema debe admitir de forma simultánea para sostener la carga indicada.

No sustituye un modelo de colas detallado; picos, variabilidad de latencia y límites de la plataforma pueden exigir capacidad adicional.

Datos: 900 tareas/minuto, 1,8 s de latencia media y objetivo de utilización del 70 %.

Cálculo: concurrencia media ocupada = 900 × 1,8 / 60 = 27. Capacidad ajustada = 27 / 0,70 = 38,57.

Resultado: se recomiendan al menos 39 slots concurrentes para ese escenario.

¿Por qué se divide por la utilización objetivo?

Porque una capacidad diseñada exactamente al promedio no deja margen para variación. Al usar, por ejemplo, 70 %, la herramienta aumenta los slots requeridos para mantener holgura operativa.

¿Qué latencia debo usar si hay una cola externa?

Usa el tiempo que realmente ocupa un slot de procesamiento. Si la cola no consume capacidad de cómputo, no debe sumarse al tiempo de servicio; si sí la bloquea, inclúyela.

¿La latencia p95 es mejor que la media?

Para capacidad media, la media es coherente con el modelo. Para diseñar frente a colas o SLO estrictos, conviene repetir el cálculo con una latencia alta representativa y comparar.

¿El resultado indica cuántas GPU necesito?

No necesariamente. Indica concurrencia requerida. La relación entre slots y GPU depende de cuántas tareas pueda procesar cada GPU en paralelo y de la arquitectura de inferencia.

¿Qué pasa si las llegadas son muy irregulares?

La estimación puede quedarse corta en picos concentrados. En ese caso usa una tasa de llegada de pico o añade margen mediante un objetivo de utilización más conservador.