Estimador de capacidad por latencia para agentes de voz con IA

Este estimador convierte la latencia media por respuesta de un agente de voz en una capacidad aproximada de solicitudes por minuto. Combina el tiempo medio que tarda cada ciclo de respuesta, el número de flujos que pueden procesarse en paralelo y un objetivo de utilización para evitar diseñar el sistema al 100 % de ocupación.

Resulta útil al estudiar si una configuración puede sostener una carga interactiva sin acumular cola. El valor no sustituye una prueba de carga, porque la latencia real suele variar entre turnos y depende de red, audio, herramientas y modelos, pero ofrece una referencia rápida para comparar configuraciones bajo un mismo supuesto.

Datos de cálculo

s
flujos
%
Resultado
solicitudes por minuto de capacidad operativa
Capacidad teórica al 100 %
Capacidad reservada
Tiempo de servicio por flujo

1. Mide la latencia media

Introduce los segundos medios que tarda una respuesta completa en el tramo que quieres dimensionar.

2. Indica el paralelismo

Especifica cuántos flujos o respuestas pueden procesarse simultáneamente.

3. Fija la utilización objetivo

Usa un porcentaje inferior al 100 % si quieres reservar capacidad para picos y variabilidad.

4. Consulta la capacidad

El resultado muestra solicitudes por minuto y el tiempo de servicio equivalente por flujo.

Capacidad (solicitudes/min) = flujos paralelos × 60 / latencia media (s) × utilización objetivo

Variables:

  • Flujos paralelos: número de respuestas que pueden procesarse simultáneamente
  • Latencia media: segundos por respuesta
  • Utilización objetivo: fracción operativa del 0 al 1 aplicada a la capacidad teórica

Supuestos: Cada flujo procesa una solicitud a la vez y la latencia media representa de forma razonable el tramo analizado. No se modelan colas ni distribuciones de latencia.

Qué significa el resultado

La cifra aproxima cuántas respuestas por minuto puede sostener el sistema con el paralelismo y utilización indicados.

Es una estimación de capacidad, no una garantía de latencia extremo a extremo bajo carga real.

Datos:

  • 2,4 s de latencia media
  • 24 flujos paralelos
  • 75 % de utilización objetivo

Cálculo:
24 × 60 / 2,4 × 0,75 = 450 solicitudes/min

Resultado: Capacidad estimada = 450 solicitudes por minuto

Interpretación: La cifra representa una capacidad operativa aproximada con un 25 % de margen respecto a la capacidad teórica.

¿Debo usar latencia media o percentil 95?

Para planificación básica puedes usar la media, pero un percentil alto suele ser más conservador cuando importa la experiencia en picos. Calcula ambos escenarios si la distribución es amplia.

¿Qué significa un flujo paralelo?

Es una unidad de trabajo que puede atender una respuesta simultáneamente. Puede corresponder a un worker, una ranura de inferencia o cualquier capacidad concurrente equivalente.

¿Por qué incluir una utilización inferior al 100 %?

Porque operar al límite deja poco margen ante variabilidad, reintentos o picos. El porcentaje elegido debe reflejar la tolerancia operativa de tu sistema.

¿La capacidad estimada equivale a usuarios simultáneos?

No directamente. Un usuario puede generar solicitudes a intervalos y una sesión contiene varios turnos; para pasar a usuarios simultáneos necesitas modelar el patrón de interacción.

¿Qué limita la precisión de esta estimación?

No modela colas, latencias de red, llamadas a herramientas ni variación por longitud de contexto. Una prueba de carga sigue siendo necesaria antes de fijar capacidad de producción.