1. Indica la demanda
Introduce las solicitudes por segundo que esperas recibir en el periodo de mayor carga.
2. Define el tamaño del prompt
Usa el número medio de tokens de entrada por solicitud antes de aplicar la caché.
3. Separa la parte cacheada
Indica qué porcentaje de esos tokens corresponde a un prefijo o contexto reutilizable.
4. Añade las velocidades
Especifica la velocidad efectiva para tokens normales y para tokens servidos desde caché.
5. Introduce la concurrencia
Usa el número de solicitudes que tu infraestructura puede procesar simultáneamente.
6. Revisa el margen
Compara la capacidad calculada con la demanda y presta atención a una utilización cercana o superior al 100 %.