- Mide la tasa de pico. Introduce las peticiones por minuto que el servicio debe atender en su tramo más exigente.
- Obtén GPU-segundos por petición. Usa benchmarks del modelo, hardware, longitud de contexto y estrategia de batching que piensas desplegar.
- Fija la utilización. Evita asumir que las GPU estarán ocupadas al 100 % de forma constante.
- Añade reserva. Incluye capacidad extra para picos, degradación, despliegues o una GPU fuera de servicio.
- Revisa las GPU equivalentes. El cálculo redondea hacia arriba la capacidad final necesaria.
Estimador de GPU para asistente de ventas con IA
Este estimador convierte la carga de un asistente de ventas en una cantidad orientativa de GPU a partir del consumo medio de GPU-segundos por petición. La métrica GPU-segundos resume cuánto tiempo efectivo de acelerador requiere una solicitud y permite mantener el cálculo independiente de un modelo o una tarjeta concretos. La utilización objetivo limita cuánto tiempo se pretende mantener ocupado el conjunto y la reserva añade capacidad para incidencias o picos.
El resultado sirve para comparar escenarios de autoscaling o decidir cuántas GPU equivalentes hacen falta durante la hora punta. No modela memoria VRAM, tensor parallelism, batching ni diferencias de rendimiento entre modelos y hardware; por eso debe utilizarse como estimación de capacidad computacional y validarse con benchmarks del stack real.
Carga de acelerador
El producto de peticiones por minuto y GPU-segundos por petición expresa la carga computacional por minuto. Dividir entre 60 la convierte en GPU equivalentes a ocupación completa; después se ajusta por utilización y reserva.
La fórmula no comprueba VRAM ni si el modelo cabe en una sola GPU. Si el despliegue exige varias GPU por réplica, ese requisito debe aplicarse además del resultado de carga.
Qué significa el resultado
El resultado representa GPU equivalentes de capacidad para la tasa de tráfico y el coste computacional medio indicados, incluyendo la reserva elegida.
Utiliza GPU-segundos medidos en el mismo tipo de hardware que pretendes desplegar para evitar comparaciones engañosas.
Datos: 240 peticiones/min, 0,85 GPU-s por petición, 75 % de utilización y 15 % de reserva.
Cálculo: carga = 240 × 0,85 ÷ 60 = 3,4 GPU. Ajustada por utilización = 3,4 ÷ 0,75 = 4,53. Con reserva = 4,53 × 1,15 = 5,21.
Resultado: se redondea a 6 GPU equivalentes.
¿Qué son los GPU-segundos por petición?
Es el tiempo acumulado de GPU consumido por una solicitud. Una petición que utiliza una GPU durante 0,8 segundos equivale a 0,8 GPU-s; dos GPU durante 0,4 segundos también suman 0,8 GPU-s.
¿El cálculo tiene en cuenta la memoria de la GPU?
No. Debes comprobar por separado que el modelo, la caché KV y el tamaño de lote caben en la VRAM disponible.
¿Cómo afecta el batching?
El batching puede reducir los GPU-segundos por petición al compartir trabajo, pero también puede modificar la latencia. Usa una medición obtenida con una configuración de batching similar a la de producción.
¿Por qué se añade una reserva si ya existe una utilización objetivo?
La utilización deja holgura operativa durante el servicio. La reserva puede cubrir además fallos, despliegues o picos que quieras soportar sin recalcular el pool base.
¿Puedo comparar GPU de modelos distintos con este resultado?
Solo si los GPU-segundos se han medido en condiciones comparables. Cambiar de hardware, cuantización o modelo puede alterar mucho el tiempo de acelerador por petición.