Estimador de coste de prompts para LLM

Este estimador se centra en el coste que genera un diseño de prompt cuando se ejecuta repetidamente. Permite separar los tokens de instrucciones y contexto enviados al modelo de los tokens de respuesta, y proyectar el gasto para un número concreto de ejecuciones.

Resulta útil al optimizar prompts largos, comparar versiones con más o menos contexto o estimar el impacto económico de una cadena que se ejecuta miles de veces. Como las tarifas dependen del modelo, los precios se introducen manualmente.

Datos de cálculo

ejecuciones
tokens
tokens
USD
USD
Resultado
Coste del prompt
Coste de entrada
Coste de salida
Coste por ejecución
Tokens procesados
  1. Cuenta las ejecuciones. Indica cuántas veces se enviará el prompt en el periodo analizado.
  2. Mide el prompt. Introduce sus tokens medios incluyendo instrucciones, variables y contexto añadido.
  3. Estima la respuesta. Añade los tokens de salida habituales por ejecución.
  4. Introduce las tarifas. Usa el precio de entrada y salida del LLM elegido.
  5. Compara versiones. Reduce o amplía el prompt y observa el efecto sobre el coste total y unitario.
Coste = ejecuciones × (tokens prompt × tarifa entrada + tokens salida × tarifa salida) / 1.000.000

El cálculo supone que los tamaños indicados son promedios. En cadenas con varios pasos, puedes sumar los tokens de todas las llamadas de una ejecución o calcular cada paso por separado.

Qué significa el resultado

El coste total muestra el impacto económico del prompt a la escala de uso indicada.

Optimizar tokens no debe hacerse a costa de eliminar contexto necesario para la calidad o seguridad de la tarea.

Datos: 50.000 ejecuciones, 650 tokens de prompt, 180 de salida, tarifas de 2 y 8 USD por millón.

Cálculo: entrada = 32,5 M × 2 = 65 USD; salida = 9 M × 8 = 72 USD.

Resultado: 137 USD, o unos 0,00274 USD por ejecución.

¿Debo contar el prompt del sistema?

Sí, cuando se envía y se factura como parte de la entrada. Incluye también contexto o ejemplos que acompañen de forma habitual a cada llamada.

¿Cómo estimo tokens si el prompt cambia en cada ejecución?

Usa una media de una muestra representativa o calcula varios escenarios. La variabilidad grande se entiende mejor separando casos cortos y largos.

¿Tiene sentido optimizar solo el prompt de entrada?

No siempre. Una instrucción más clara puede aumentar ligeramente la entrada y reducir salidas innecesarias o reintentos, por lo que conviene observar el coste total.

¿Puedo usarlo para una cadena de varios prompts?

Sí. Suma tokens de entrada y salida de todas las llamadas que componen una ejecución o calcula cada paso por separado.

¿En qué se diferencia del calculador de longitud de prompt?

La longitud de prompt mide tamaño; este estimador convierte ese tamaño, junto con el volumen y la salida, en un coste monetario.