Estimador de capacidad de latencia para detección de fraude con IA

Estima cuántas solicitudes deben poder estar en proceso simultáneamente para sostener una tasa de análisis de fraude con una latencia objetivo. Aplica una forma práctica de la ley de Little: la concurrencia necesaria depende del caudal de solicitudes y del tiempo que cada una permanece en el sistema.

Además añade un margen de capacidad y convierte la concurrencia total en un número aproximado de trabajadores o instancias según la concurrencia admitida por cada uno. Sirve para dimensionar servicios de inferencia sin confundir latencia individual con solicitudes por segundo.

Datos de cálculo

req/s
ms
%
solicitudes
Resultado
concurrencia requerida
Trabajadores estimados
Concurrencia sin margen
Capacidad con trabajadores

1. Introduce la tasa de solicitudes
Indica cuántos análisis por segundo debe atender el sistema.

2. Define la latencia objetivo
Usa una latencia representativa, por ejemplo p95, expresada en milisegundos.

3. Añade margen de capacidad
Reserva un porcentaje adicional para variabilidad y pequeños picos.

4. Indica la concurrencia por trabajador
Especifica cuántas solicitudes simultáneas puede mantener cada instancia o trabajador.

5. Revisa la capacidad
Consulta la concurrencia requerida y el número redondeado de trabajadores necesarios.

Concurrencia requerida = solicitudes/s × (latencia ms / 1.000) × (1 + margen/100)
Trabajadores = redondeo hacia arriba(concurrencia requerida / concurrencia por trabajador)

Variables:

  • solicitudes/s = caudal objetivo
  • latencia ms = tiempo medio o percentil elegido por solicitud
  • margen = capacidad adicional
  • concurrencia por trabajador = solicitudes simultáneas soportadas por una instancia

Supuestos: El modelo supone un flujo estable y usa la latencia indicada como tiempo de permanencia representativo. Picos bruscos, colas externas, límites de CPU/GPU y dependencias de red pueden exigir más capacidad.

Qué significa el resultado

Con cuatro trabajadores capaces de manejar seis solicitudes simultáneas cada uno, la capacidad nominal es 24, ligeramente por encima del objetivo con margen.

El resultado es una estimación basada en los datos y supuestos introducidos; utiliza mediciones específicas de tu caso cuando estén disponibles.

Datos:

  • 75 solicitudes/s
  • 240 ms de latencia objetivo
  • 25 % de margen
  • 6 solicitudes concurrentes por trabajador

Cálculo:
Concurrencia base: 75 × 0,240 = 18. Con margen: 18 × 1,25 = 22,5. Trabajadores: techo(22,5 / 6) = 4.

Resultado: 22,5 solicitudes concurrentes; 4 trabajadores

Interpretación: Con cuatro trabajadores capaces de manejar seis solicitudes simultáneas cada uno, la capacidad nominal es 24, ligeramente por encima del objetivo con margen.

¿Debo usar latencia media o p95?

Para capacidad conservadora suele ser más útil un percentil como p95, siempre que represente tu objetivo real. La media puede infravalorar la concurrencia si existe una cola de solicitudes lentas.

¿Por qué se multiplica caudal por latencia?

Porque una solicitud permanece ocupando capacidad durante su tiempo de servicio. A igual caudal, una latencia mayor implica más solicitudes simultáneamente en curso.

¿El margen de capacidad resuelve picos grandes?

No necesariamente. Es una reserva porcentual simple; para cargas muy variables conviene modelar picos, autoscaling y colas por separado.

¿Qué significa concurrencia por trabajador?

Es el máximo práctico de solicitudes simultáneas que una instancia puede procesar manteniendo el rendimiento esperado. Debe obtenerse de pruebas o telemetría.

¿Este estimador sustituye a una prueba de carga?

No. Es una aproximación de dimensionamiento inicial que ayuda a fijar objetivos; la capacidad final debe validarse con carga representativa.