Estimador de rendimiento de búsqueda vectorial

Este estimador calcula el throughput de una carga de búsqueda vectorial a partir del número de trabajadores concurrentes y del tiempo medio que tarda cada consulta. Expresa el resultado en consultas por segundo y por minuto para facilitar la comparación con objetivos de tráfico.

La herramienta es práctica cuando se dispone de una latencia o tiempo de servicio medido por trabajador y se quiere explorar el efecto de aumentar el paralelismo. La cifra representa un escenario estable y simplificado: no incorpora por sí misma colas, pérdida de eficiencia por contención, límites de conexiones ni cambios de latencia provocados por una mayor concurrencia.

Datos de entrada

s
Resultado
consultas por segundo
Consultas por minuto
Consultas por hora
Tiempo por consulta

1. Cuenta las ranuras de procesamiento
Introduce el número de trabajadores que pueden ejecutar búsquedas simultáneamente.

2. Añade el tiempo medio por consulta
Usa segundos y toma una medición compatible con la carga y el índice que quieres evaluar.

3. Observa el throughput
El resultado muestra cuántas consultas terminarían por segundo si los trabajadores se mantuvieran ocupados.

4. Valida la escalabilidad
Comprueba con mediciones reales si duplicar trabajadores mantiene la misma latencia o introduce contención.

Throughput (QPS) = trabajadores concurrentes / tiempo medio por consulta (s) Consultas/min = QPS × 60

Se supone que cada trabajador procesa una consulta a la vez y que el tiempo de servicio no empeora al aumentar la concurrencia.

Qué significa el resultado

El resultado refleja el ritmo teórico de consultas completadas cuando todos los trabajadores están ocupados de forma continua.

Si el motor agrupa consultas en batch o comparte recursos entre trabajadores, utiliza mediciones realizadas con esa configuración.

Datos: 16 trabajadores y 0,032 s por consulta.

Cálculo: QPS = 16 / 0,032 = 500. Consultas/min = 500 × 60 = 30.000.

Resultado: el throughput teórico es de 500 consultas por segundo.

¿En qué se diferencia de la calculadora de capacidad por latencia?

Las dos parten de una relación similar entre concurrencia y tiempo. Esta página está enfocada al rendimiento operativo expresado como throughput, mientras que la de capacidad parte explícitamente de la latencia del servicio.

¿Qué ocurre si cada trabajador atiende varias consultas?

Entonces el concepto de trabajador debe ajustarse a ranuras efectivas de concurrencia. Usa el número real de operaciones que pueden progresar simultáneamente.

¿Debo incluir tiempo de red?

Inclúyelo si quieres throughput extremo a extremo. Exclúyelo si estás midiendo únicamente la capacidad interna del motor de búsqueda.

¿El resultado considera fallos o reintentos?

No. Los reintentos consumen capacidad adicional y pueden reducir el throughput útil de consultas exitosas.

¿Cómo detecto que el modelo teórico ya no escala?

Mide la latencia al aumentar trabajadores. Si el tiempo por consulta sube de forma significativa, recalcula con esa nueva latencia en lugar de asumir escalado lineal.