Estimador de GPU para caché de prompts

Este estimador aproxima cuántas GPU hacen falta para sostener una tasa objetivo de solicitudes cuando una parte del prompt se resuelve mediante caché. Convierte cada solicitud en una carga efectiva de tokens: los tokens de entrada cacheados dejan de contarse como trabajo normal, mientras que los tokens de salida permanecen en la carga.

Es una herramienta de planificación inicial para comparar escenarios de hit rate, tamaños de prompt y rendimiento por GPU. No pretende sustituir un benchmark del modelo concreto, pero permite ver rápidamente cuánto cambia el dimensionamiento cuando aumenta o disminuye el porcentaje de tokens reutilizados.

Datos de entrada

sol./s
tokens
tokens
%
tokens/s
Resultado
GPU necesarias (redondeadas hacia arriba)
Tokens efectivos por solicitud
Carga efectiva total
Reducción frente a no usar caché

1. Fija el objetivo de tráfico
Introduce las solicitudes por segundo que quieres sostener.

2. Añade entrada y salida
Indica los tokens medios de prompt y de respuesta por solicitud.

3. Introduce el porcentaje cacheado
Usa la proporción del prompt que puede reutilizarse.

4. Mide el rendimiento por GPU
Introduce un valor de benchmark representativo para tu modelo, precisión y hardware.

5. Comprueba el redondeo
El resultado se redondea al entero superior porque una fracción de GPU no cubre una instancia completa.

Tokens efectivos/solicitud = P·(1 − h) + O
GPU = techo(R·Tokens efectivos / G)

P es el prompt, O la salida, h la fracción de prompt cacheada, R las solicitudes/s y G los tokens/s efectivos por GPU. El modelo supone reparto perfecto de carga y no reserva capacidad adicional para picos.

Qué significa el resultado

El entero obtenido es la cantidad mínima teórica de GPU para que el rendimiento agregado iguale o supere la carga efectiva indicada.

En producción suele añadirse margen por variabilidad, fallos, lotes pequeños, memoria y límites de concurrencia. Verifica el resultado con pruebas del modelo y del runtime reales.

Datos: 25 sol./s, 2.500 tokens de prompt, 300 de salida, 70 % cacheado y 18.000 tokens/s por GPU.

Cálculo: tokens efectivos = 2.500×0,30 + 300 = 1.050. Carga = 25×1.050 = 26.250 tokens/s. GPU = techo(26.250/18.000) = 2.

Resultado: se estiman 2 GPU como mínimo teórico.

¿Por qué los tokens de salida no se reducen con el porcentaje de caché?

La caché de prompts reutiliza entrada ya procesada; la respuesta todavía debe generarse. Por eso la salida se mantiene como carga efectiva en este modelo.

¿Qué valor de tokens por segundo por GPU debo usar?

El obtenido en una prueba con el mismo modelo, cuantización, tamaño de lote y longitud de secuencia que esperas en producción.

¿El resultado incluye redundancia?

No. Es una capacidad mínima teórica y no incorpora GPU de reserva, mantenimiento ni tolerancia a fallos.

¿Qué pasa con una caché del 100 %?

El prompt deja de contribuir a la carga efectiva de este modelo, pero los tokens de salida siguen consumiendo capacidad.

¿Es equivalente a un cálculo de memoria de GPU?

No. Aquí se dimensiona por throughput de cómputo; la memoria necesaria para pesos, KV cache y lotes debe comprobarse por separado.