1. Indica las sesiones concurrentes
Introduce cuántas sesiones de voz pueden necesitar generación al mismo tiempo.
2. Define la velocidad por sesión
Especifica los tokens por segundo que quieres sostener por sesión durante la generación.
3. Añade el rendimiento por GPU
Usa un valor de tokens por segundo por GPU obtenido de pruebas comparables.
4. Fija la utilización objetivo
Reserva margen operativo reduciendo el porcentaje de utilización efectiva.
5. Revisa las GPU requeridas
La herramienta redondea hacia arriba porque una fracción de GPU no cubre por sí sola una unidad completa de capacidad dedicada.