Estimador de capacidad por latencia de un pipeline de imágenes con IA

Estima cuánta capacidad puede ofrecer un pipeline de generación o procesamiento de imágenes con IA cuando conoces su latencia media, el número de tareas que puede ejecutar en paralelo y una utilización objetivo. Convierte esos parámetros en tareas por minuto y por hora, lo que ayuda a comprobar si una arquitectura puede absorber la demanda prevista sin operar de forma permanente al límite. Es especialmente útil para comparar mejoras de latencia frente a aumentos de concurrencia.

Capacidad del pipeline

tareas
s
%
Resultado
Capacidad estimada por hora
Tareas por segundo
Tareas por minuto
Duración media de ciclo
Margen de capacidad

1. Cuenta la concurrencia. Indica cuántas tareas pueden estar procesándose simultáneamente de forma efectiva.

2. Mide la latencia. Usa el tiempo medio extremo a extremo desde que entra una tarea hasta que termina.

3. Fija una utilización objetivo. Reserva holgura por debajo del 100 % para colas, variabilidad y mantenimiento.

4. Compara la capacidad. Revisa tareas por segundo, minuto y hora frente a tu demanda pico.

5. Prueba mejoras. Reduce la latencia o aumenta la concurrencia para ver qué cambio aporta más capacidad.

La relación principal utilizada es:

Capacidad por segundo = concurrencia ÷ latencia(s) × utilización

concurrencia: número de tareas simultáneas.

latencia: segundos medios que ocupa cada tarea.

utilización: fracción de capacidad que se desea utilizar, expresada como porcentaje.

Supuesto: El modelo supone un flujo estable y tareas de duración similar. No modela colas complejas, límites de API ni cuellos de botella externos.

Qué significa el resultado

La capacidad por hora indica cuántas tareas podría completar el pipeline manteniendo la latencia y utilización introducidas.

Para dimensionar producción, compara este valor con la demanda de pico y valida el resultado con pruebas de carga.

Datos: concurrencia 12, latencia media 5 s y utilización objetivo 80 %.

Cálculo: 12 ÷ 5 × 0,80 = 1,92 tareas/s. Por minuto: 115,2. Por hora: 6.912.

Resultado: capacidad estimada de 6.912 tareas de imagen por hora.

¿Debo usar latencia media o p95?

La media sirve para una estimación de rendimiento. Para garantías de experiencia o colas, contrasta también p95 o p99 porque las colas largas pueden reducir la capacidad práctica.

¿Qué significa concurrencia?

Es el número de tareas que el sistema puede ejecutar a la vez, considerando GPU, workers y límites de servicio.

¿Por qué no usar 100 % de utilización?

Operar siempre al 100 % deja poca capacidad para variaciones, reintentos y picos. Una utilización objetivo menor introduce margen operativo.

¿Esto predice el tamaño de la cola?

No directamente. Estima capacidad de servicio; para colas necesitas además el patrón de llegada y la variabilidad de los tiempos.

¿Cómo sé si necesito más GPU?

Si la demanda pico supera la capacidad estimada incluso con una latencia optimizada, utiliza un estimador de GPU para dimensionar recursos adicionales.