Planificador de presupuesto de tokens con caché de prompts

Este planificador descompone el presupuesto de tokens de una solicitud que utiliza caché de prompts. A partir del tamaño total del prompt y del porcentaje que puede reutilizarse, calcula cuántos tokens son potencialmente cacheables, cuántos deben procesarse como contenido nuevo y cuánto ocupa el conjunto al añadir la reserva para la salida.

La herramienta ayuda a evaluar si una estructura de prompt tiene suficiente contenido estable para beneficiarse de caché y a visualizar la parte que seguirá cambiando en cada solicitud. No aplica tarifas de un proveedor ni garantiza un acierto de caché: la elegibilidad, los prefijos mínimos, las ventanas de retención y la facturación dependen del sistema que utilices.

Datos de entrada

tokens
%
tokens
tokens
Resultado
tokens nuevos/no cacheables por solicitud
Tokens potencialmente cacheables
Presupuesto total con salida
Margen de contexto

1. Introduce el tamaño del prompt
Cuenta todos los tokens de entrada que formarían el prompt completo antes de la generación.

2. Estima la parte estable
Indica qué porcentaje pertenece a un prefijo o contenido que podría reutilizarse entre solicitudes.

3. Reserva tokens para la salida
Añade el máximo o presupuesto de generación que quieras conservar disponible.

4. Define el límite del modelo
Introduce la ventana de contexto total para comprobar que prompt y salida caben.

5. Interpreta los tokens nuevos
La cifra principal muestra la parte del prompt que seguiría siendo no cacheable según tu porcentaje estimado.

Tokens cacheables = tokens del prompt × porcentaje cacheable / 100 Tokens nuevos = tokens del prompt − tokens cacheables Presupuesto total = tokens del prompt + reserva de salida Margen de contexto = límite − presupuesto total

El porcentaje cacheable describe elegibilidad potencial, no la tasa real de aciertos. El presupuesto de contexto sigue incluyendo el prompt completo aunque parte pueda reutilizarse computacionalmente.

Qué significa el resultado

Los tokens nuevos representan la parte del prompt que, bajo la estimación introducida, no se beneficiaría de reutilización de caché.

Consulta las reglas del proveedor para saber qué tokens son realmente cacheables y cómo se contabilizan en coste y latencia.

Datos: prompt de 6.000 tokens, 70 % potencialmente cacheable, reserva de salida de 800 y límite de 16.384 tokens.

Cálculo: cacheables = 6.000 × 0,70 = 4.200. Nuevos = 6.000 − 4.200 = 1.800. Presupuesto total = 6.000 + 800 = 6.800. Margen = 16.384 − 6.800 = 9.584.

Resultado: 1.800 tokens del prompt quedarían como nuevos/no cacheables por solicitud en este escenario.

¿Los tokens cacheados dejan de contar para la ventana de contexto?

No. El prompt completo sigue formando parte del contexto lógico de la solicitud. La caché puede reducir trabajo o coste según el proveedor, pero no elimina esos tokens del contenido que el modelo atiende.

¿Qué parte del prompt suele ser candidata a caché?

Normalmente el contenido estable y repetido entre solicitudes, como instrucciones largas o un prefijo común. La elegibilidad exacta depende de cómo implemente la caché el proveedor.

¿El porcentaje cacheable equivale a la tasa de aciertos?

No. Un bloque puede ser potencialmente cacheable y aun así no producir un acierto si cambia el prefijo, expira la entrada o no cumple las reglas de caché.

¿Por qué se incluye una reserva de salida?

Para comprobar que el prompt más la generación prevista caben dentro del límite de contexto. La reserva no modifica los tokens cacheables del prompt.

¿Puedo usar este resultado para calcular ahorro de dinero?

Como paso intermedio, sí, pero necesitas además las tarifas específicas para tokens cacheados y no cacheados, así como una tasa de aciertos realista.