Estimador de rendimiento de un pipeline de imágenes con IA

Estima el rendimiento de un pipeline de imágenes con IA a partir del número de GPU, el tiempo de procesamiento por tarea y una utilización objetivo. Muestra cuántas tareas pueden completarse por hora y por día en condiciones sostenidas, por lo que permite traducir benchmarks técnicos en capacidad operativa. Puedes usarlo para comparar hardware, modelos o niveles de utilización antes de decidir si aumentar recursos o reducir el tiempo de inferencia.

Recursos y velocidad

GPU
s
%
h
Resultado
Tareas estimadas por hora
Tareas por minuto
Tareas por día
Tareas/h por GPU
Holgura de utilización

1. Indica las GPU. Introduce el número de GPU que ejecutan tareas en paralelo.

2. Mide el tiempo por tarea. Usa segundos de procesamiento por tarea para una sola GPU equivalente.

3. Ajusta la utilización. Refleja pérdidas por esperas, preparación, variabilidad o capacidad reservada.

4. Define las horas diarias. Para cargas no continuas, reduce las horas operativas respecto a 24.

5. Compara escenarios. Observa el impacto de más GPU o menor tiempo por tarea en la producción horaria y diaria.

La relación principal utilizada es:

Tareas/h = GPU × (3600 ÷ segundos por tarea) × utilización

GPU: número de unidades de procesamiento equivalentes.

segundos por tarea: tiempo medio de GPU para completar una tarea.

utilización: proporción efectiva de tiempo productivo por GPU.

Supuesto: Se supone que las tareas se distribuyen bien entre GPU y que no existe otro cuello de botella que reduzca el flujo.

Qué significa el resultado

El resultado principal es un rendimiento sostenido estimado por hora para el conjunto de GPU.

Los benchmarks aislados pueden ser optimistas; usa telemetría de producción cuando esté disponible.

Datos: 8 GPU, 5 s por tarea, 70 % de utilización y 20 h de operación diaria.

Cálculo: por GPU = 3.600/5 × 0,70 = 504 tareas/h. Total = 504 × 8 = 4.032 tareas/h. Día = 4.032 × 20 = 80.640.

Resultado: unas 4.032 tareas por hora y 80.640 por día.

¿Es lo mismo throughput que latencia?

No. La latencia mide cuánto tarda una tarea; el throughput mide cuántas se completan por unidad de tiempo. Un sistema puede mejorar uno sin mejorar el otro en la misma proporción.

¿Debo contar GPU de distintos modelos como iguales?

Solo si conviertes su rendimiento a una capacidad equivalente. Si difieren mucho, calcula cada grupo por separado y suma los rendimientos.

¿Qué incluye la utilización efectiva?

Puede absorber tiempos ociosos, preparación de lotes, fallos y otros factores que impiden usar toda la capacidad teórica.

¿Puedo usar 24 horas aunque haya mantenimiento?

Sí, pero entonces refleja la indisponibilidad en una utilización menor. Alternativamente, reduce las horas operativas para representar ventanas de servicio.

¿Cómo relaciono este resultado con GPU necesarias?

Compara el rendimiento calculado con tu demanda. Si es insuficiente, el estimador de GPU puede convertir la demanda objetivo en un número de unidades requerido.