Estimador de throughput para agentes de voz con IA

Este estimador calcula el throughput de un agente de voz a partir del número de GPU disponibles, el rendimiento de generación por GPU, la utilización efectiva y los tokens medios generados por turno. El resultado principal expresa cuántos turnos de agente podrían completarse por minuto bajo esas hipótesis de cómputo.

Es una forma práctica de comparar configuraciones de inferencia o comprobar si una flota de GPU puede sostener el volumen de turnos previsto. Para no mezclar componentes, el cálculo se centra en generación de tokens; si reconocimiento de voz, síntesis, red o herramientas externas dominan el tiempo total, deben analizarse como cuellos de botella adicionales.

Datos de cálculo

GPU
tokens/s
%
tokens
Resultado
turnos por minuto estimados
Tokens efectivos por segundo
Tokens efectivos por minuto
Turnos por segundo

1. Introduce las GPU disponibles

Indica cuántas GPU están asignadas al tramo de generación analizado.

2. Añade el rendimiento por GPU

Usa tokens por segundo medidos para el mismo modelo y configuración.

3. Fija la utilización efectiva

Reduce la capacidad teórica para reflejar margen operativo, esperas o ineficiencias.

4. Define el tamaño de un turno

Introduce los tokens de salida medios generados por cada respuesta del agente.

5. Consulta el throughput

El resultado muestra turnos por minuto y tokens por segundo efectivos del conjunto.

Turnos/min = GPU × tokens/s por GPU × utilización × 60 / tokens de salida por turno

Variables:

  • GPU: número de GPU asignadas
  • Tokens/s por GPU: rendimiento de generación por GPU
  • Utilización: fracción de rendimiento efectivo
  • Tokens por turno: salida media generada en una respuesta

Supuestos: El rendimiento escala aproximadamente con el número de GPU y los tokens de salida son el principal trabajo cuantificado por turno.

Qué significa el resultado

El resultado aproxima cuántos turnos de generación pueden completarse por minuto con la capacidad de GPU indicada.

Otros componentes del agente pueden reducir el throughput extremo a extremo aunque la generación disponga de capacidad suficiente.

Datos:

  • 4 GPU
  • 360 tokens/s por GPU
  • 75 % de utilización efectiva
  • 180 tokens de salida por turno

Cálculo:
Tokens efectivos/s = 4 × 360 × 0,75 = 1.080; turnos/min = 1.080 × 60 / 180 = 360

Resultado: Throughput = 360 turnos por minuto

Interpretación: La estimación indica la capacidad de generación. El throughput real puede ser menor si otros componentes del agente añaden esperas o límites de concurrencia.

¿Debo usar tokens de entrada o de salida por turno?

Esta versión usa tokens de salida porque dimensiona la generación. Si el prefill o contexto de entrada es dominante, el rendimiento medido por GPU debe reflejar ese coste adicional o debes modelarlo aparte.

¿Qué ocurre si el tamaño de las respuestas varía mucho?

El promedio ofrece una referencia central, pero puede sobreestimar capacidad durante respuestas largas. Prueba también un tamaño de turno alto para un escenario conservador.

¿La utilización efectiva puede ser del 100 %?

Matemáticamente sí, pero suele dejar poco margen. Para planificación conviene usar un porcentaje que represente tus pérdidas reales y la reserva operativa deseada.

¿Este resultado es igual al número de usuarios por minuto?

No. Un usuario puede generar varios turnos y cada sesión tiene pausas. Para convertirlo en usuarios necesitas conocer turnos por sesión y patrón temporal.

¿Cómo puedo validar la estimación?

Compara los turnos por minuto previstos con una prueba de carga en condiciones representativas. Ajusta rendimiento por GPU y utilización hasta que el modelo reproduzca tus mediciones.