Estimador de GPU necesarias para un pipeline de imágenes con IA

Calcula una estimación del número de GPU necesarias para sostener un volumen horario de tareas de imagen con IA. Parte del tiempo de GPU consumido por tarea, la utilización objetivo y una reserva de capacidad, y redondea el resultado al siguiente número entero de GPU. Sirve para preparar despliegues, comparar modelos más rápidos y evaluar cuánto cambia la infraestructura cuando aumenta la demanda, sin asumir que las GPU pueden funcionar al 100 % de forma continua.

Carga y rendimiento

tareas/h
s
%
%
Resultado
GPU necesarias
GPU teóricas
Demanda con reserva
Capacidad por GPU
Utilización objetivo

1. Define la demanda. Introduce las tareas de imagen por hora que el sistema debe atender.

2. Mide segundos de GPU. Usa tiempo de cómputo por tarea en una GPU representativa de producción.

3. Fija la utilización. Elige una utilización sostenible que deje margen operativo.

4. Añade reserva. Incluye capacidad extra para crecimiento, picos o indisponibilidad parcial.

5. Redondea para desplegar. La calculadora muestra GPU teóricas y redondea hacia arriba para obtener una cantidad entera.

La relación principal utilizada es:

GPU = ceil([demanda × (1 + reserva)] ÷ [(3600 ÷ segundos/tarea) × utilización])

demanda: tareas requeridas por hora.

reserva: porcentaje de demanda adicional que se desea cubrir.

segundos/tarea: tiempo de GPU consumido por una tarea.

utilización: porcentaje efectivo de uso previsto por GPU.

ceil: redondeo hacia arriba al entero siguiente.

Supuesto: Se asume que las GPU tienen rendimiento similar y que las tareas pueden distribuirse de forma aproximadamente uniforme.

Qué significa el resultado

El entero resultante es una referencia de capacidad mínima bajo las hipótesis indicadas, no una garantía de rendimiento del sistema completo.

Otros límites, como memoria, CPU, red, colas o cuotas del proveedor, pueden exigir más recursos.

Datos: 7.200 tareas/h, 3 s de GPU por tarea, 80 % de utilización y 25 % de reserva.

Cálculo: demanda ajustada = 7.200 × 1,25 = 9.000 tareas/h. Capacidad por GPU = 3.600/3 × 0,80 = 960 tareas/h. GPU teóricas = 9.000/960 = 9,375.

Resultado: se redondea a 10 GPU.

¿Por qué se redondea hacia arriba?

Porque una fracción de GPU no representa una unidad física completa en un despliegue dedicado. El redondeo evita quedar por debajo de la capacidad teórica requerida.

¿Qué tiempo por tarea debo medir?

El tiempo de GPU real, no necesariamente la latencia total si incluye espera, red o CPU. Usa el mismo tipo de GPU que planeas desplegar.

¿La reserva y la utilización no duplican el margen?

Cumplen funciones distintas: la utilización limita cuánto quieres cargar cada GPU y la reserva aumenta la demanda que deseas cubrir. Puedes ajustar ambos para evitar un margen excesivo.

¿Funciona con GPU compartidas?

Puede servir como equivalencia de capacidad, pero la variabilidad de recursos compartidos puede ser mayor. Valida el resultado con métricas del entorno real.

¿Cómo afecta un modelo dos veces más rápido?

Si reduce a la mitad los segundos de GPU por tarea, la capacidad por GPU aproximadamente se duplica bajo las mismas condiciones.