Estimador de rendimiento para atención al cliente con IA

Este calculador estima el número de tareas de atención al cliente que un conjunto de slots de inferencia puede completar por hora. Relaciona paralelismo, tiempo medio por tarea y utilización efectiva, lo que permite traducir una arquitectura concreta en una capacidad de servicio fácil de comparar con la demanda.

Puedes usarlo para comprobar si un despliegue cubre el tráfico previsto, estudiar el efecto de reducir latencia o valorar cuántos slots adicionales harían falta para una campaña o franja punta.

Paralelismo y velocidad

slots
s
%
Resultado
Tareas por hora
Capacidad teórica
Tareas por minuto
Utilización efectiva

1. Introduce el paralelismo. Indica cuántos workers o slots pueden procesar tareas a la vez.

2. Añade el tiempo por tarea. Usa una medición media coherente con la configuración real.

3. Ajusta la utilización efectiva. Refleja pausas, esperas y tiempo no productivo mediante este porcentaje.

4. Revisa la capacidad teórica. Comprueba el máximo que resultaría con ocupación continua.

5. Interpreta el rendimiento efectivo. Compara las tareas por hora resultantes con tu demanda o tamaño de lote.

Tareas/h = workers × 3.600 ÷ segundos por tarea × (utilización/100)

La capacidad teórica supone ocupación continua. Multiplicar por la utilización efectiva reduce esa cifra para reflejar el porcentaje de tiempo realmente productivo.

Qué significa el resultado

El resultado indica la cantidad media de tareas que la configuración descrita podría completar en una hora.

La capacidad real puede verse limitada por colas, memoria, red, APIs externas, batching o distribución desigual del trabajo.

Datos: 80 slots, 1,6 s por tarea y 72 % de utilización efectiva.

Cálculo: capacidad teórica = 80 × 3.600 / 1,6 = 180.000 tareas/h. Capacidad efectiva = 180.000 × 0,72 = 129.600 tareas/h.

Resultado: rendimiento estimado de 129.600 tareas por hora.

¿Las tareas por hora equivalen a clientes por hora?

Solo si cada cliente genera una única tarea de inferencia. Si una conversación requiere varias llamadas, convierte primero el volumen de clientes a tareas.

¿Qué valor pongo en utilización efectiva?

Usa una medición de producción o una hipótesis conservadora que refleje tiempo ocioso, batching, colas y límites operativos. No existe un valor universal.

¿Reducir la latencia aumenta el throughput de forma lineal?

En este modelo sí, manteniendo constantes los demás factores. En un sistema real puede haber otros cuellos de botella que limiten la mejora.

¿Cómo comparo el throughput con la demanda de pico?

Convierte ambos a la misma unidad temporal. Si la demanda de pico supera la capacidad efectiva, necesitarás más paralelismo, menos tiempo por tarea o una cola aceptable.

¿Este resultado contempla llamadas a CRM o búsquedas externas?

Solo si su efecto está incluido en el tiempo medio por tarea o en la utilización efectiva. Si bloquean el slot, deberían reflejarse de alguna forma.