- Indica la concurrencia disponible. Usa el límite real de solicitudes que pueden estar procesándose de forma simultánea.
- Introduce la latencia media. Mide el tiempo completo de una solicitud representativa.
- Estima la utilización efectiva. Reduce el 100 % para reflejar huecos, variabilidad, mantenimiento o limitaciones del scheduler.
- Consulta el rendimiento. El resultado principal muestra peticiones por minuto y el desglose añade segundo y hora.
- Compara cambios. Prueba una latencia inferior o mayor concurrencia para cuantificar el efecto de una optimización.
Estimador de rendimiento para asistente de ventas con IA
Este estimador calcula el rendimiento máximo aproximado de un asistente de ventas a partir de las solicitudes que puede mantener en paralelo, la latencia media y la utilización efectiva. En lugar de partir de la demanda para calcular capacidad, responde a la pregunta inversa: cuántas peticiones por minuto y por hora puede completar una configuración existente.
Resulta útil para validar límites de concurrencia antes de una campaña, comparar dos arquitecturas con distinta latencia o estimar cuándo será necesario escalar. La cifra supone que las solicitudes ocupan capacidad durante toda la latencia indicada y que el sistema puede mantener una utilización relativamente estable. Ráfagas, límites de API externos y colas de prioridad pueden reducir el rendimiento observable.
Capacidad disponible
Cada plaza concurrente completa aproximadamente 1 ÷ latencia peticiones por segundo. Multiplicar por la concurrencia y la utilización efectiva obtiene la tasa agregada; el factor 60 la expresa por minuto.
La fórmula no añade tiempo de cola. Si el sistema alcanza el límite y las nuevas solicitudes esperan antes de empezar, la experiencia del usuario puede degradarse aunque el rendimiento agregado se mantenga.
Qué significa el resultado
El resultado estima cuántas peticiones puede completar por minuto la capacidad concurrente introducida bajo la latencia y utilización seleccionadas.
El rendimiento real puede estar limitado por tokens por segundo, rate limits, herramientas externas o recursos compartidos no representados aquí.
Datos: 24 solicitudes concurrentes, 3,6 s de latencia y 72 % de utilización efectiva.
Cálculo: 24 ÷ 3,6 = 6,667 peticiones/s a ocupación completa. × 0,72 = 4,8 peticiones/s. × 60 = 288 peticiones/min.
Resultado: aproximadamente 288 peticiones por minuto, equivalentes a 17.280 por hora.
¿Mayor concurrencia siempre aumenta el rendimiento?
Solo mientras no aparezca otro cuello de botella. Memoria, tokens por segundo, conexiones a CRM o límites del proveedor pueden impedir que el rendimiento crezca linealmente.
¿Qué latencia debo usar si las respuestas varían mucho?
Empieza con una media ponderada por tráfico y prueba también un escenario más lento. Si los extremos son importantes para la experiencia, revisa percentiles además del promedio.
¿Qué representa la utilización efectiva?
Es la fracción de la capacidad concurrente que realmente está produciendo trabajo útil de forma sostenida. Permite descontar huecos, esperas y variaciones operativas.
¿El resultado incluye solicitudes que fallan o se reintentan?
No de forma explícita. Si los reintentos consumen capacidad, reduce la utilización útil o incorpora esa carga adicional al dimensionamiento.
¿Cómo sé si necesito el estimador de latencia en vez de este?
Usa este cuando ya conoces la capacidad y quieres estimar rendimiento. Usa el de capacidad de latencia cuando conoces la demanda y quieres saber cuánta concurrencia necesitas.