1. Introduce traducciones por hora. Usa la demanda que necesitas cubrir, preferiblemente en periodo pico.
2. Estima tokens totales. Suma entrada y salida medias por traducción para reflejar trabajo procesado.
3. Mide tokens por segundo. Usa un benchmark por GPU con el mismo modelo, precisión y estrategia de batching.
4. Fija utilización y reserva. Añade holgura tanto a la carga por GPU como a la demanda cubierta.
5. Comprueba el entero final. Revisa las GPU teóricas y el redondeo hacia arriba usado para el despliegue.