1. Introduce las GPU
Indica cuántas GPU participan en el servicio.
2. Añade el rendimiento unitario
Usa tokens por segundo medidos por GPU en condiciones comparables.
3. Describe una solicitud media
Indica tokens de prompt y de salida.
4. Marca la parte reutilizada
Introduce el porcentaje del prompt atendido desde caché.
5. Lee el throughput
El resultado principal muestra solicitudes por segundo y el desglose incluye solicitudes por minuto.