Estimador de rendimiento de RAG

Este estimador calcula el rendimiento aproximado de un sistema RAG en tareas por segundo a partir del número de trabajadores o ranuras concurrentes y del tiempo medio que tarda una tarea completa. Es una forma directa de relacionar paralelismo y duración del servicio cuando se necesita una cifra de capacidad fácil de comparar.

Puede servir para evaluar un despliegue antes de una prueba de carga, comparar dos modelos o explorar cómo cambia el throughput al reducir la latencia. La estimación supone un flujo estable y trabajadores ocupados de forma eficiente; colas, límites de red, variación en la longitud de respuesta, contención y batching pueden hacer que el rendimiento real sea distinto.

Datos de entrada

s
Resultado
tareas RAG por segundo
Tareas por minuto
Tiempo medio por tarea
Concurrencia utilizada

1. Define los trabajadores disponibles
Cuenta las ranuras que pueden procesar tareas RAG al mismo tiempo en el recurso limitante.

2. Introduce el tiempo por tarea
Usa el tiempo medio extremo a extremo o el tramo que realmente corresponda a los trabajadores definidos.

3. Consulta el throughput
La calculadora divide la concurrencia por la duración media de una tarea.

4. Contrasta con una carga real
Usa una prueba de carga para comprobar si colas y saturación reducen el rendimiento observado.

Throughput (tareas/s) = trabajadores concurrentes / tiempo medio por tarea (s) Tareas/min = throughput × 60

Se asume que cada trabajador atiende una tarea a la vez y que el tiempo introducido es representativo de la carga sostenida.

Qué significa el resultado

El throughput indica cuántas tareas completas puede terminar el sistema por unidad de tiempo bajo las condiciones introducidas.

Si existe batching dinámico, concurrencia interna del servidor o varios recursos limitantes, interpreta el resultado como una aproximación.

Datos: 32 trabajadores concurrentes y 1,6 s por tarea.

Cálculo: throughput = 32 / 1,6 = 20 tareas/s. Por minuto: 20 × 60 = 1.200 tareas.

Resultado: el sistema tendría un rendimiento teórico de 20 tareas RAG por segundo.

¿Throughput y latencia son lo mismo?

No. La latencia describe cuánto tarda una tarea; el throughput indica cuántas tareas se completan por unidad de tiempo. Un sistema puede tener latencia moderada y throughput alto si procesa muchas tareas en paralelo.

¿Qué debo contar como trabajador?

La unidad que limita el paralelismo real: procesos, ranuras de inferencia, réplicas o peticiones concurrentes permitidas. Evita contar hilos que no pueden ejecutar trabajo útil simultáneamente.

¿Puedo usar p95 como tiempo por tarea?

Sí, si quieres una estimación más conservadora ligada a tiempos altos. Para capacidad promedio suele emplearse una media representativa.

¿El batching aumenta el throughput?

Puede aumentarlo al mejorar la utilización del hardware, aunque también puede cambiar la latencia. En ese caso conviene introducir una duración medida con el tamaño de batch real.

¿Cómo relaciono este resultado con GPU?

Puedes combinar el throughput objetivo con una medición de segundos de GPU por tarea y utilizar el estimador de GPU necesarias para traducir demanda en dispositivos.