Estimador de capacidad por latencia de agentes de IA

Este estimador convierte la latencia de las llamadas de un agente en una capacidad operativa aproximada. Relaciona el número de agentes o ejecuciones concurrentes, la duración media de cada llamada y cuántas llamadas necesita una tarea completa.

Es útil para comprobar si una arquitectura puede sostener un volumen objetivo sin confundir latencia individual con capacidad total. La cifra supone un flujo estable y recursos disponibles para mantener la concurrencia indicada; colas externas, límites de proveedor, herramientas lentas o variabilidad de red pueden reducir la capacidad real.

Datos de entrada

agentes
s
llamadas
%
Resultado
Capacidad estimada
Tareas por minuto
Tiempo serial por tarea
Concurrencia efectiva

1. Indica la concurrencia
Introduce cuántas ejecuciones del agente pueden estar activas a la vez.

2. Mide la latencia
Usa la latencia media de una llamada al modelo en segundos bajo una carga representativa.

3. Cuenta las llamadas
Especifica cuántas llamadas al modelo requiere una tarea típica desde el inicio hasta el resultado.

4. Ajusta la utilización
Reserva parte de la capacidad para variación, colas y picos reduciendo la utilización sostenible.

5. Interpreta la tasa
Revisa las tareas por minuto y por hora como capacidad aproximada del conjunto.

Tiempo serial por tarea = latencia por llamada × llamadas por tarea
Tareas/hora = concurrencia × utilización × 3.600 / tiempo serial por tarea

Variables:

  • concurrencia: número máximo de ejecuciones simultáneas
  • latencia por llamada: segundos medios por llamada
  • llamadas por tarea: llamadas necesarias para completar una tarea
  • utilización: fracción de la concurrencia que se considera sostenible

Supuesto: Las llamadas de una misma tarea se tratan como secuenciales. Si varias se ejecutan en paralelo, el tiempo efectivo por tarea será menor.

Qué significa el resultado

El resultado es una estimación operativa basada en los valores introducidos. Úsalo para comparar escenarios y dimensionar capacidad, no como sustituto de mediciones en producción.

Si la carga tiene mucha variabilidad, repite el cálculo con valores medios y conservadores para entender el rango posible.

Datos:

  • 20 ejecuciones concurrentes
  • 2,4 s por llamada
  • 4 llamadas por tarea
  • 80 % de utilización

Cálculo:
Tiempo serial = 2,4 × 4 = 9,6 s. Concurrencia efectiva = 20 × 0,80 = 16. Capacidad = 16 × 3.600 / 9,6 = 6.000 tareas/hora.

Resultado: 6.000 tareas/hora

Interpretación: Con ese perfil, el sistema podría sostener alrededor de 100 tareas por minuto en régimen estable.

¿La latencia debe ser media o percentil p95?

Para capacidad media, usa una media representativa. Si quieres un dimensionamiento conservador frente a picos, repetir el cálculo con p95 puede ser más útil.

¿Qué incluye una llamada por tarea?

Cuenta cada interacción con el modelo que forme parte del flujo, incluidas revisiones o decisiones intermedias. Las llamadas de herramientas deben modelarse aparte si añaden espera relevante.

¿Por qué se aplica una utilización inferior al 100 %?

Mantener todos los recursos ocupados de forma continua deja poca capacidad para absorber variaciones. El porcentaje permite introducir una reserva operativa explícita.

¿Qué pasa si las llamadas del agente se ejecutan en paralelo?

La fórmula serial puede infravalorar la capacidad. En ese caso, sustituye el tiempo serial por el tiempo crítico real del flujo o usa un modelo de paralelismo específico.

¿Esta capacidad garantiza el SLA?

No. La tasa estimada no sustituye el análisis de colas ni los percentiles de latencia de extremo a extremo necesarios para un SLA.