Estimador de rendimiento de agentes de IA

Este estimador calcula cuántas tareas terminadas puede producir un conjunto de agentes de IA por unidad de tiempo. Parte de la concurrencia disponible y de la duración media de una tarea, y permite descontar las ejecuciones que no llegan a un resultado válido mediante una tasa de éxito.

La métrica ayuda a comparar configuraciones, dimensionar lotes o evaluar si una mejora de latencia se traduce en más trabajo útil. El modelo supone una llegada continua de tareas y una ocupación estable; si existen periodos de espera, límites de tasa o cuellos de botella externos, conviene reducir la concurrencia efectiva o ampliar la duración media.

Datos de entrada

agentes
s
%
Resultado
Rendimiento efectivo
Tareas brutas por hora
Tareas correctas por minuto
Tareas no completadas por hora

1. Indica la concurrencia
Introduce cuántos agentes pueden procesar tareas al mismo tiempo.

2. Mide una tarea completa
Usa la duración media desde que el agente comienza hasta que termina una tarea, no solo la latencia de una llamada.

3. Añade la tasa de éxito
Indica qué porcentaje de tareas produce un resultado aceptable sin necesitar una repetición completa.

4. Compara bruto y efectivo
Revisa la producción bruta y el rendimiento útil para separar capacidad de calidad operativa.

5. Prueba escenarios
Cambia concurrencia o duración para ver qué variable mejora más la capacidad final.

Throughput bruto/h = agentes concurrentes × 3.600 / duración media
Throughput efectivo/h = throughput bruto/h × tasa de éxito / 100

Variables:

  • agentes concurrentes: ejecuciones que trabajan simultáneamente
  • duración media: segundos que tarda una tarea completa
  • tasa de éxito: porcentaje de tareas que terminan con un resultado válido

Supuesto: Cada agente procesa una tarea cada vez y siempre hay trabajo disponible. La tasa de éxito descuenta tareas fallidas, pero no añade el tiempo de reintento.

Qué significa el resultado

El resultado es una estimación operativa basada en los valores introducidos. Úsalo para comparar escenarios y dimensionar capacidad, no como sustituto de mediciones en producción.

Si la carga tiene mucha variabilidad, repite el cálculo con valores medios y conservadores para entender el rango posible.

Datos:

  • 12 agentes concurrentes
  • 45 s por tarea
  • 92 % de éxito

Cálculo:
Throughput bruto = 12 × 3.600 / 45 = 960 tareas/h. Throughput efectivo = 960 × 0,92 = 883,2 tareas/h.

Resultado: 883,2 tareas correctas/hora

Interpretación: La configuración produce unas 14,72 tareas correctas por minuto; alrededor de 76,8 tareas/hora no llegarían a completarse correctamente.

¿En qué se diferencia throughput de latencia?

La latencia mide cuánto tarda una tarea; el throughput mide cuántas tareas se completan en un periodo. Una mayor concurrencia puede elevar el throughput sin reducir la latencia individual.

¿Incluyo el tiempo de espera de herramientas externas?

Sí. Si forma parte del tiempo que una ejecución permanece ocupada, debe incluirse en la duración media de la tarea.

¿Cómo reflejo los reintentos?

Si los reintentos consumen capacidad, lo más fiel es incorporarlos en la duración media observada o calcular una duración efectiva mayor. La tasa de éxito por sí sola solo descuenta resultados.

¿Puedo usar el p95 de duración?

Sí para un escenario conservador, aunque entonces el resultado representa capacidad bajo una duración alta, no la media esperada.

¿Qué significa una tasa de éxito del 100 %?

Significa que el throughput efectivo coincide con el bruto. No implica que las respuestas tengan una calidad perfecta, solo que todas cumplen el criterio operativo que hayas definido.