Estimador de GPU para agentes de voz con IA

Este estimador calcula cuántas GPU se necesitan aproximadamente para sostener la generación de tokens de un conjunto de sesiones de voz simultáneas. Relaciona el número de sesiones concurrentes y la velocidad de generación requerida por sesión con el rendimiento efectivo de una GPU, ajustado por una utilización objetivo.

El resultado es útil para crear escenarios de infraestructura propia o dedicada sin fijar un modelo de GPU concreto. La capacidad real depende de cuantización, batching, longitud de contexto, arquitectura del modelo y hardware, por lo que el usuario debe introducir un rendimiento medido o razonablemente probado en su entorno.

Datos de cálculo

sesiones
tokens/s
tokens/s
%
Resultado
GPU estimadas necesarias
Demanda total
Capacidad efectiva por GPU
Capacidad total instalada

1. Indica las sesiones concurrentes

Introduce cuántas sesiones de voz pueden necesitar generación al mismo tiempo.

2. Define la velocidad por sesión

Especifica los tokens por segundo que quieres sostener por sesión durante la generación.

3. Añade el rendimiento por GPU

Usa un valor de tokens por segundo por GPU obtenido de pruebas comparables.

4. Fija la utilización objetivo

Reserva margen operativo reduciendo el porcentaje de utilización efectiva.

5. Revisa las GPU requeridas

La herramienta redondea hacia arriba porque una fracción de GPU no cubre por sí sola una unidad completa de capacidad dedicada.

GPU necesarias = techo[(sesiones concurrentes × tokens/s por sesión) / (tokens/s por GPU × utilización)]

Variables:

  • Sesiones concurrentes: sesiones que requieren generación simultánea
  • Tokens/s por sesión: velocidad objetivo de generación por sesión
  • Tokens/s por GPU: rendimiento medido de una GPU para la configuración analizada
  • Utilización: porcentaje de capacidad que se considera utilizable

Supuestos: El rendimiento por GPU ya refleja el modelo, precisión, batching y contexto relevantes. Se usa una aproximación lineal de capacidad.

Qué significa el resultado

El resultado redondea hacia arriba el número de GPU necesario para cubrir la demanda de generación con la utilización objetivo.

La estimación depende directamente del benchmark de tokens por segundo que introduzcas para tu configuración real.

Datos:

  • 80 sesiones concurrentes
  • 18 tokens/s requeridos por sesión
  • 420 tokens/s por GPU
  • 80 % de utilización objetivo

Cálculo:
Demanda = 80 × 18 = 1.440 tokens/s; capacidad efectiva por GPU = 420 × 0,80 = 336 tokens/s; 1.440 / 336 = 4,29; techo = 5

Resultado: GPU necesarias = 5

Interpretación: Cuatro GPU no alcanzarían la capacidad objetivo bajo estos supuestos; el redondeo a cinco deja capacidad suficiente para la demanda indicada.

¿Qué rendimiento por GPU debo introducir?

Usa una medición con el mismo modelo, precisión, contexto y estrategia de batching que esperas en producción. Los benchmarks genéricos pueden diferir mucho de tu carga real.

¿Por qué se redondea hacia arriba?

Porque la infraestructura debe cubrir toda la demanda objetivo. Si el cociente es 4,1, cuatro GPU quedarían por debajo del supuesto de capacidad utilizado.

¿La utilización objetivo es lo mismo que la utilización observada de la GPU?

No exactamente. Aquí funciona como un factor de planificación que reduce la capacidad teórica disponible para dejar margen operativo.

¿Incluye el procesamiento de audio?

Solo si su carga ya está reflejada en el rendimiento por GPU introducido. Si ASR, TTS u otros componentes usan GPU por separado, deben dimensionarse adicionalmente.

¿Puedo usar este resultado para elegir un modelo de GPU?

Puedes comparar escenarios cambiando el rendimiento medido por GPU, pero la elección final también depende de memoria, latencia, coste, disponibilidad y compatibilidad del modelo.