- Mide la latencia media. Usa el tiempo desde que una tarea empieza a ocupar capacidad hasta que libera ese recurso.
- Indica la concurrencia. Introduce cuántas tareas pueden ejecutarse simultáneamente.
- Define la utilización objetivo. Un valor inferior al 100 % deja margen para picos, variabilidad y mantenimiento.
- Añade la demanda. Introduce las tareas por minuto que esperas recibir.
- Compara capacidad y margen. Un margen negativo indica que la configuración no cubre la demanda introducida.
Estimador de capacidad según latencia para transcripción con IA
Estima cuántas transcripciones puede sostener un sistema de IA a partir de la latencia media por tarea, el número de tareas simultáneas y un nivel de utilización objetivo. Es útil para convertir una medición de tiempo de respuesta en una capacidad operativa comparable con la demanda.
El resultado expresa tareas por minuto y por hora, y muestra el margen frente a la carga objetivo. Así puedes comprobar si reducir latencia, aumentar concurrencia o reservar más holgura tiene mayor impacto antes de escalar infraestructura.
Datos de entrada
La fórmula supone que la latencia media representa correctamente el tiempo de ocupación y que las tareas pueden repartirse de forma uniforme entre los huecos concurrentes.
Qué significa el resultado
La capacidad es una estimación de régimen estable; el margen frente a demanda muestra cuánto tráfico adicional o déficit existe con los supuestos introducidos.
Colas, límites de proveedor, variabilidad de duración, reintentos y lotes pueden reducir la capacidad real, especialmente en picos.
Datos: latencia de 10 s, concurrencia 18, utilización del 75 % y demanda de 70 tareas/min.
Cálculo: capacidad = 18×60/10×0,75 = 81.00 tareas/min. Por hora = 81.00×60 = 4860 tareas.
Resultado: el margen frente a la demanda es +11.00 tareas/min.
¿Por qué no se recomienda usar siempre el 100 % de utilización?
Porque una operación al límite deja poca capacidad para variaciones de latencia, ráfagas de tráfico y tareas más pesadas. La holgura objetivo depende del nivel de servicio que necesites.
¿Debo usar latencia media o percentil p95?
La media sirve para capacidad promedio. Si quieres proteger un objetivo de experiencia o dimensionar picos, también conviene revisar percentiles altos por separado.
¿Qué significa un margen negativo?
Que la capacidad estimada es menor que la demanda objetivo. Necesitarías reducir latencia, aumentar concurrencia, bajar la carga o cambiar la arquitectura.
¿La concurrencia es igual al número de GPU?
No necesariamente. Una GPU puede atender varias tareas en paralelo y una tarea puede usar más de un recurso; introduce la concurrencia efectiva observada.
¿En qué se diferencia de un estimador de throughput?
Ambos relacionan tiempo y capacidad, pero este cálculo parte explícitamente de latencia y demanda objetivo para mostrar holgura operativa.