1. Indica la concurrencia
Introduce cuántas ejecuciones del agente pueden estar activas a la vez.
2. Mide la latencia
Usa la latencia media de una llamada al modelo en segundos bajo una carga representativa.
3. Cuenta las llamadas
Especifica cuántas llamadas al modelo requiere una tarea típica desde el inicio hasta el resultado.
4. Ajusta la utilización
Reserva parte de la capacidad para variación, colas y picos reduciendo la utilización sostenible.
5. Interpreta la tasa
Revisa las tareas por minuto y por hora como capacidad aproximada del conjunto.