1. Introduce la latencia de recuperación
Usa el tiempo medio dedicado a buscar y recuperar el contexto relevante antes de llamar al modelo.
2. Añade la latencia de generación
Indica el tiempo medio que tarda el modelo en producir la respuesta una vez disponible el contexto.
3. Define la concurrencia útil
Especifica cuántas solicitudes pueden estar en proceso al mismo tiempo sin superar los límites de la aplicación o la infraestructura.
4. Interpreta la capacidad
Compara las solicitudes por segundo estimadas con tu carga objetivo y deja margen para picos y variación de latencia.