Estimador de capacidad de latencia con caché de prompts

Este estimador calcula cuántas solicitudes por segundo puede sostener un servicio de modelos de lenguaje cuando una parte de los tokens del prompt se reutiliza mediante caché. Separa los tokens que deben procesarse de forma normal de los que pueden atenderse a una velocidad efectiva mayor, y combina ambos tiempos para obtener una duración media por solicitud.

Resulta útil al dimensionar endpoints con prefijos de sistema repetidos, agentes con contexto estable o flujos que comparten instrucciones largas. La capacidad estimada permite comparar la demanda prevista con la concurrencia disponible y detectar si el sistema trabaja con margen o cerca de saturación.

Datos de entrada

sol./s
tokens
%
tokens/s
tokens/s
solicitudes
Resultado
capacidad estimada de solicitudes por segundo
Tiempo medio de servicio
Utilización con la demanda indicada
Margen de capacidad

1. Indica la demanda
Introduce las solicitudes por segundo que esperas recibir en el periodo de mayor carga.

2. Define el tamaño del prompt
Usa el número medio de tokens de entrada por solicitud antes de aplicar la caché.

3. Separa la parte cacheada
Indica qué porcentaje de esos tokens corresponde a un prefijo o contexto reutilizable.

4. Añade las velocidades
Especifica la velocidad efectiva para tokens normales y para tokens servidos desde caché.

5. Introduce la concurrencia
Usa el número de solicitudes que tu infraestructura puede procesar simultáneamente.

6. Revisa el margen
Compara la capacidad calculada con la demanda y presta atención a una utilización cercana o superior al 100 %.

t = T·(1 − h)/Vn + T·h/Vc
Capacidad = C/t
Utilización = Demanda/Capacidad × 100

Donde T son los tokens de prompt, h es la fracción cacheada, Vn y Vc son las velocidades efectivas de tokens normales y cacheados, y C es la concurrencia. El modelo supone tiempos medios estables y no añade latencia de red, generación de salida ni colas complejas.

Qué significa el resultado

Una capacidad mayor que la demanda indica margen teórico; si la utilización se acerca al 100 %, pequeñas variaciones de tráfico o de velocidad pueden provocar colas y elevar la latencia real.

La caché de prompts depende del proveedor, del tamaño del prefijo reutilizable y de las reglas de invalidación. Usa mediciones reales de tu entorno cuando estén disponibles.

Datos: 2.000 tokens por prompt, 60 % cacheados, 800 tokens/s sin caché, 3.200 tokens/s en caché y concurrencia 8.

Cálculo: t = 2.000×0,40/800 + 2.000×0,60/3.200 = 1 + 0,375 = 1,375 s. Capacidad = 8/1,375 = 5,82 solicitudes/s.

Resultado: con una demanda de 5 solicitudes/s, la utilización sería 85,94 % y quedarían unas 0,82 solicitudes/s de margen.

¿Qué representa la velocidad de tokens en caché?

Es una velocidad efectiva para la parte reutilizada del prompt. Puede reflejar un acceso más rápido, menor cómputo o una tarifa de procesamiento distinta según la plataforma.

¿Debo incluir los tokens de salida?

No en este modelo. Si la generación de salida consume una parte importante de la latencia, añade ese tiempo a un análisis separado o reduce la velocidad efectiva para aproximarlo.

¿Qué ocurre si la demanda supera la capacidad?

La utilización será superior al 100 % y el servicio no podrá sostener esa carga de forma continua con los parámetros introducidos. En la práctica aparecerán colas, más latencia o rechazo de solicitudes.

¿Una tasa de caché alta garantiza baja latencia?

No. También influyen la velocidad de los tokens no cacheados, la concurrencia, la red y la generación de salida.

¿Para qué sirve comparar este resultado con el estimador de throughput?

Este cálculo se centra en tiempo de servicio y concurrencia; el de throughput permite analizar la producción agregada de trabajo. Usarlos juntos ayuda a comprobar si ambas perspectivas de capacidad son coherentes.