- Usa la demanda de pico. Introduce peticiones por minuto durante el intervalo que realmente quieras soportar, no solo el promedio diario.
- Mide la latencia completa. Incluye generación, búsqueda, llamadas a CRM y otros pasos que mantengan ocupada la solicitud.
- Elige una utilización objetivo. Un valor inferior al 100 % deja capacidad libre para variabilidad y picos cortos.
- Lee la concurrencia calculada. El resultado indica cuántas solicitudes deberían poder estar en curso a la vez con esos supuestos.
- Prueba escenarios. Cambia latencia o demanda para ver qué componente tiene mayor impacto en la capacidad.
Estimador de capacidad de latencia para asistente de ventas con IA
Este estimador traduce la demanda máxima de un asistente de ventas en la concurrencia que debe mantenerse para que las solicitudes no se acumulen por encima del ritmo de llegada. Combina peticiones por minuto, latencia media de extremo a extremo y una utilización objetivo, dejando margen para variaciones de tráfico, llamadas a herramientas o respuestas más largas.
El resultado no es un SLA ni una predicción de la latencia de un proveedor; es una capacidad mínima de solicitudes simultáneas bajo los supuestos introducidos. Puede servir para dimensionar réplicas, límites de concurrencia o colas antes de una campaña comercial, y para comprobar cómo cambia la capacidad necesaria cuando el asistente incorpora CRM, búsqueda o generación más extensa.
Demanda y tiempo de respuesta
La concurrencia teórica sigue la relación entre tasa de llegada y tiempo medio de servicio. Dividir por la utilización objetivo añade margen operativo; el resultado final se redondea hacia arriba porque no se puede aprovisionar una fracción de solicitud concurrente.
La aproximación presupone un flujo relativamente estable. Colas con ráfagas pronunciadas, límites externos o distribuciones de latencia muy asimétricas requieren validación adicional.
Qué significa el resultado
El valor principal es la concurrencia mínima orientativa necesaria para absorber la tasa de llegada indicada sin trabajar de forma sostenida por encima de la utilización objetivo.
Para objetivos de percentil p95 o p99, usa una latencia representativa de ese nivel o valida el diseño con pruebas de carga.
Datos: 180 peticiones/min, 4,2 s de latencia media y 70 % de utilización objetivo.
Cálculo: concurrencia teórica = 180 × 4,2 ÷ 60 = 12,6. Ajustada por utilización = 12,6 ÷ 0,70 = 18.
Resultado: se necesitan aproximadamente 18 solicitudes concurrentes de capacidad.
¿Debo introducir latencia media o p95?
Depende del objetivo. Para una estimación de capacidad promedio usa una media representativa; si quieres proteger una experiencia p95, conviene probar también con una latencia cercana a ese percentil.
¿Por qué no usar una utilización del 100 %?
Trabajar al 100 % deja muy poco margen para variaciones de demanda y servicio. En sistemas con colas, pequeños picos pueden hacer crecer rápidamente el tiempo de espera.
¿La cifra indica cuántas GPU necesito?
No. Indica concurrencia de solicitudes; la traducción a GPU depende del modelo, batching, memoria, hardware y GPU-segundos consumidos por petición.
¿Qué pasa si las llamadas al CRM son el cuello de botella?
Incluye su tiempo dentro de la latencia si bloquean la solicitud. También debes respetar por separado los límites de concurrencia o tasa de ese servicio externo.
¿Cómo trato picos muy breves de tráfico?
Introduce una tasa de llegada correspondiente al pico que quieras absorber y añade un margen de utilización razonable. Para ráfagas extremas, combina esta estimación con una cola y pruebas de carga.