Calculadora de coste por tarea con caché de prompts

Esta calculadora estima el coste directo de una tarea LLM cuando el proveedor aplica un precio distinto a los tokens de entrada reutilizados mediante caché. Divide el prompt entre parte normal y parte cacheada, calcula cada componente con su tarifa por millón de tokens y añade el coste de la salida.

Puede usarse para evaluar si merece la pena estructurar prompts con prefijos estables, comparar escenarios de hit rate o proyectar el gasto de un flujo repetitivo. El resultado por tarea también facilita multiplicar después por un volumen diario o mensual sin mezclar el efecto del tráfico con el coste unitario.

Datos de entrada

tokens
tokens
%
USD/1M
USD/1M
USD/1M
Resultado
coste estimado por tarea
Coste de entrada normal
Coste de entrada cacheada
Coste de salida

1. Introduce el uso de tokens
Añade el promedio de tokens de prompt y de salida por tarea.

2. Indica la parte cacheada
Especifica qué porcentaje del prompt puede facturarse como entrada cacheada.

3. Añade las tarifas
Introduce precios por un millón de tokens para entrada normal, entrada cacheada y salida.

4. Revisa el desglose
Comprueba cuánto aporta cada componente al coste unitario.

5. Proyecta el volumen aparte
Multiplica el coste por tarea por el número esperado de tareas si necesitas una estimación periódica.

Coste = P·(1 − h)·Cn/1.000.000 + P·h·Cc/1.000.000 + O·Co/1.000.000

P son los tokens de prompt, h la fracción cacheada, Cn y Cc las tarifas de entrada normal y cacheada, O los tokens de salida y Co su tarifa. Todas las tarifas se expresan por un millón de tokens.

Qué significa el resultado

El resultado es el coste variable estimado de una tarea individual con la mezcla de tokens y precios introducida.

No incluye cargos fijos, almacenamiento de caché, descuentos por volumen, impuestos ni otros conceptos del proveedor que no estén representados en las tarifas introducidas.

Datos: 3.000 tokens de prompt, 500 de salida, 70 % cacheado; 3 USD/1M para entrada normal, 0,30 USD/1M para entrada cacheada y 15 USD/1M para salida.

Cálculo: entrada normal = 900×3/1M = 0,0027 USD; cacheada = 2.100×0,30/1M = 0,00063 USD; salida = 500×15/1M = 0,0075 USD.

Resultado: coste total = 0,01083 USD por tarea.

¿Qué tarifa debo usar para la entrada cacheada?

La que aplique tu proveedor al mecanismo concreto de prompt caching. Si no existe descuento, usa la misma tarifa que para la entrada normal.

¿El porcentaje de caché es lo mismo que el hit rate de solicitudes?

No necesariamente. Aquí representa la proporción de tokens del prompt que se factura o procesa como cacheada dentro de una tarea media.

¿Puedo introducir cero tokens de salida?

Sí, si tu flujo no genera salida facturable o quieres aislar únicamente el coste de entrada.

¿Incluye el coste de crear la caché?

No de forma separada. Si tu plataforma cobra por escritura o almacenamiento, añade ese coste a tu análisis total.

¿Cómo comparo dos proveedores?

Introduce las tarifas y el uso de tokens de cada uno manteniendo el mismo escenario de tarea. Después compara el coste unitario y, por separado, la latencia y la calidad.