Estimador de capacidad de latencia para RAG

Esta calculadora estima cuántas solicitudes por segundo puede sostener un flujo de generación aumentada por recuperación (RAG) cuando se conoce la concurrencia disponible y el tiempo medio que consume cada petición. Separa la latencia de búsqueda o recuperación de la latencia de generación para que sea más fácil detectar qué parte del recorrido limita la capacidad.

Es útil al dimensionar una API RAG, comparar configuraciones de índice y modelo, o revisar si un objetivo de tráfico encaja con la infraestructura actual. El resultado es una aproximación de régimen estable: no sustituye una prueba de carga y no incorpora por sí solo colas, reintentos, cachés, variabilidad por percentiles ni límites externos.

Datos de entrada

ms
ms
Resultado
solicitudes por segundo estimadas
Latencia total por solicitud
Solicitudes por minuto
Tiempo de servicio por solicitud

1. Introduce la latencia de recuperación
Usa el tiempo medio dedicado a buscar y recuperar el contexto relevante antes de llamar al modelo.

2. Añade la latencia de generación
Indica el tiempo medio que tarda el modelo en producir la respuesta una vez disponible el contexto.

3. Define la concurrencia útil
Especifica cuántas solicitudes pueden estar en proceso al mismo tiempo sin superar los límites de la aplicación o la infraestructura.

4. Interpreta la capacidad
Compara las solicitudes por segundo estimadas con tu carga objetivo y deja margen para picos y variación de latencia.

Latencia total (s) = (latencia de recuperación + latencia de generación) / 1000 Capacidad (solicitudes/s) = concurrencia / latencia total (s)

La fórmula aplica la ley básica de concurrencia en régimen estable. Asume que la concurrencia indicada puede mantenerse ocupada y que las dos latencias representan el recorrido principal por solicitud.

Qué significa el resultado

Una cifra más alta indica mayor capacidad teórica para la misma concurrencia. Si la latencia aumenta y la concurrencia no cambia, la capacidad disminuye.

Para planificación de producción conviene contrastar el resultado con percentiles p95/p99, límites de proveedor, colas y pruebas de carga reales.

Datos: recuperación de 180 ms, generación de 820 ms y 24 solicitudes simultáneas.

Cálculo: latencia total = (180 + 820) / 1000 = 1,00 s. Capacidad = 24 / 1,00 = 24 solicitudes/s.

Resultado: la capacidad teórica es de 24 solicitudes/s, equivalentes a unas 1.440 solicitudes/minuto si la carga se mantiene estable.

¿Debo usar latencia media o p95?

La media sirve para una estimación inicial de capacidad. Para objetivos de experiencia de usuario o compromisos operativos suele ser más prudente repetir el cálculo con p95 o p99.

¿La recuperación y la generación siempre se suman?

En un flujo secuencial típico, sí. Si parte del trabajo se solapa o existe procesamiento en paralelo, esta simplificación puede sobreestimar la latencia efectiva.

¿Qué significa “concurrencia” aquí?

Es el número de solicitudes que el sistema puede atender simultáneamente en el tramo que limita la capacidad. No debe confundirse con usuarios activos totales.

¿Por qué una prueba de carga puede dar menos capacidad?

Porque aparecen colas, variación de tiempos, límites de conexiones, saturación de CPU/GPU y otros costes que la fórmula simplificada no modela.

¿Cómo puedo usar el resultado para dimensionar?

Compáralo con tu tráfico objetivo y aplica un margen operativo. También puedes probar distintos valores de latencia o concurrencia para identificar la mejora con mayor impacto.