Estimador de capacidad de latencia para búsqueda vectorial

Esta calculadora estima cuántas consultas vectoriales por segundo puede sostener un servicio cuando se conoce la latencia media de cada búsqueda y el número de consultas que pueden ejecutarse simultáneamente. Convierte directamente tiempo de servicio y concurrencia en una capacidad teórica de régimen estable.

Es útil para explorar objetivos de QPS, comparar configuraciones de índice o anticipar el efecto de una mejora de latencia. El resultado no modela por separado filtrado, reranking, red, colas ni variación entre consultas; si esos componentes forman parte de la latencia medida, quedan incluidos de manera agregada.

Datos de entrada

ms
Resultado
consultas por segundo estimadas
Consultas por minuto
Tiempo por consulta
Concurrencia

1. Mide la latencia de búsqueda
Introduce el tiempo medio desde que se envía la consulta hasta que se obtiene el conjunto de resultados que deseas considerar.

2. Indica la concurrencia disponible
Especifica cuántas búsquedas pueden permanecer activas simultáneamente en el servicio limitante.

3. Consulta la capacidad
La calculadora transforma la latencia a segundos y divide la concurrencia por ese tiempo.

4. Añade margen operativo
No diseñes una carga crítica únicamente con la cifra teórica; contrástala con percentiles y pruebas de carga.

Latencia (s) = latencia (ms) / 1000 Capacidad (QPS) = concurrencia / latencia (s)

La fórmula supone una carga estable y que las consultas concurrentes pueden avanzar en paralelo sin una degradación adicional de latencia.

Qué significa el resultado

El resultado es una aproximación del número de consultas vectoriales completadas por segundo bajo los valores introducidos.

A alta concurrencia, la propia latencia puede crecer. Repite el cálculo con latencias observadas en el nivel de carga que te interese.

Datos: latencia media de 45 ms y 20 consultas simultáneas.

Cálculo: 45 ms = 0,045 s. Capacidad = 20 / 0,045 = 444,44 QPS.

Resultado: aproximadamente 444 consultas por segundo, o 26.667 por minuto en condiciones ideales.

¿Debo medir solo el tiempo del índice?

Depende del objetivo. Si quieres capacidad extremo a extremo, incluye red, filtros y posprocesado; si dimensionas únicamente el motor de búsqueda, usa la latencia de ese tramo.

¿Por qué la capacidad puede caer al subir la concurrencia?

Porque CPU, GPU, memoria, disco o conexiones pueden saturarse, elevando la latencia. La fórmula no incorpora automáticamente esa degradación.

¿QPS significa consultas recibidas o completadas?

Aquí representa consultas completadas por segundo en régimen estable. En una cola creciente, la tasa recibida puede ser mayor temporalmente que la tasa completada.

¿Puedo usar latencia p95?

Sí. Un p95 produce una estimación más conservadora para consultas lentas que usar únicamente la media.

¿Cómo comparo dos configuraciones de índice?

Mantén la misma concurrencia y usa la latencia medida de cada configuración. Después compara capacidad junto con calidad de recuperación, memoria y coste, no solo QPS.