1. Fija el objetivo de tráfico
Introduce las solicitudes por segundo que quieres sostener.
2. Añade entrada y salida
Indica los tokens medios de prompt y de respuesta por solicitud.
3. Introduce el porcentaje cacheado
Usa la proporción del prompt que puede reutilizarse.
4. Mide el rendimiento por GPU
Introduce un valor de benchmark representativo para tu modelo, precisión y hardware.
5. Comprueba el redondeo
El resultado se redondea al entero superior porque una fracción de GPU no cubre una instancia completa.