Estimador de throughput con caché de prompts

Este estimador convierte el rendimiento agregado de varias GPU en solicitudes por segundo para un flujo con caché de prompts. Primero calcula cuántos tokens efectivos debe procesar cada solicitud después de descontar la parte cacheada del prompt y mantener los tokens de salida; después divide la capacidad total de tokens entre esa carga unitaria.

Sirve para comparar configuraciones de hardware o para medir el efecto de una mayor reutilización del contexto. El resultado es especialmente útil como cifra de planificación antes de ejecutar pruebas de carga, ya que muestra qué variable limita más el volumen: tamaño del prompt, salida, hit rate o rendimiento de las GPU.

Datos de entrada

GPU
tokens/s
tokens
tokens
%
Resultado
solicitudes por segundo estimadas
Throughput agregado
Tokens efectivos por solicitud
Solicitudes por minuto

1. Introduce las GPU
Indica cuántas GPU participan en el servicio.

2. Añade el rendimiento unitario
Usa tokens por segundo medidos por GPU en condiciones comparables.

3. Describe una solicitud media
Indica tokens de prompt y de salida.

4. Marca la parte reutilizada
Introduce el porcentaje del prompt atendido desde caché.

5. Lee el throughput
El resultado principal muestra solicitudes por segundo y el desglose incluye solicitudes por minuto.

Throughput total = N·G
Tokens efectivos = P·(1 − h) + O
Solicitudes/s = Throughput total / Tokens efectivos

N es el número de GPU, G su rendimiento efectivo, P el prompt, O la salida y h la fracción cacheada.

Qué significa el resultado

El valor indica cuántas solicitudes medias podrían procesarse por segundo si el throughput agregado se reparte de forma uniforme y los tamaños introducidos representan bien el tráfico real.

La latencia, la memoria, los límites del runtime y la eficiencia del batching pueden reducir el throughput observado respecto a esta estimación.

Datos: 4 GPU a 18.000 tokens/s cada una, 2.500 tokens de prompt, 300 de salida y 70 % de caché.

Cálculo: throughput total = 72.000 tokens/s. Tokens efectivos = 2.500×0,30 + 300 = 1.050. Solicitudes/s = 72.000/1.050 = 68,57.

Resultado: unas 68,57 solicitudes/s, equivalentes a 4.114 solicitudes/min.

¿Este throughput es de tokens reales o de tokens efectivos?

La capacidad de GPU se expresa en tokens/s, pero la solicitud se reduce a una carga efectiva al descontar la parte cacheada del prompt.

¿Puedo usar una media de tamaños de prompt?

Sí, si representa razonablemente el tráfico. Para cargas muy variables conviene calcular varios percentiles o escenarios.

¿Qué ocurre si la salida es muy larga?

La ventaja relativa de cachear el prompt disminuye porque la generación de salida sigue ocupando una parte mayor del trabajo.

¿Se supone escalado lineal entre GPU?

Sí. El modelo multiplica el rendimiento unitario por el número de GPU, por lo que no incluye pérdidas de coordinación o comunicación.

¿Cómo relaciono este resultado con las GPU necesarias?

Este estimador parte del hardware disponible y calcula capacidad; el estimador de GPU hace el recorrido inverso desde una demanda objetivo.