1. Introduce las GPU disponibles
Indica cuántas GPU están asignadas al tramo de generación analizado.
2. Añade el rendimiento por GPU
Usa tokens por segundo medidos para el mismo modelo y configuración.
3. Fija la utilización efectiva
Reduce la capacidad teórica para reflejar margen operativo, esperas o ineficiencias.
4. Define el tamaño de un turno
Introduce los tokens de salida medios generados por cada respuesta del agente.
5. Consulta el throughput
El resultado muestra turnos por minuto y tokens por segundo efectivos del conjunto.