Calculadora de inferencia de OpenAI

Estima cuánto cuesta ejecutar inferencias con un modelo de OpenAI a partir del volumen de solicitudes y del consumo medio de tokens. Separa entrada y salida porque normalmente se facturan a tarifas diferentes. La calculadora no fija un modelo concreto: puedes introducir el precio que corresponda a tu modelo, proveedor o modalidad actual. Además del gasto mensual, muestra el coste medio por solicitud, útil para presupuestar funciones de producto, APIs internas o cargas de evaluación.

Datos de cálculo

USD
USD
Resultado
coste mensual de inferencia
Coste medio/solicitud
Tokens de entrada
Tokens de salida
Tokens totales

1. Fija el volumen
Introduce el número de solicitudes que esperas procesar al mes.

2. Estima la entrada
Usa el promedio de tokens enviados en cada solicitud.

3. Estima la salida
Añade el promedio de tokens generados por respuesta.

4. Configura precios
Introduce las tarifas vigentes por millón de tokens.

5. Compara escenarios
Cambia volumen, longitudes o precios para evaluar alternativas.

coste mensual = solicitudes × [(tokens entrada × tarifa entrada + tokens salida × tarifa salida) / 1.000.000]

El coste medio por solicitud es el coste mensual dividido entre el número de solicitudes cuando este es mayor que cero.

Qué significa el resultado

Muestra el gasto aproximado atribuible a la inferencia de texto según el consumo y los precios que has introducido.

No incorpora cargos adicionales de herramientas, almacenamiento, búsquedas ni otras funciones facturadas aparte.

Datos: 50.000 solicitudes, 700 tokens de entrada y 180 de salida; 2,50 USD/M y 10 USD/M.

Cálculo: entrada 35 M × 2,50 = 87,50 USD; salida 9 M × 10 = 90 USD.

Resultado: 177,50 USD al mes, unos 0,00355 USD por solicitud.

¿Por qué se separan tokens de entrada y salida?

Porque pueden tener precios diferentes. Separarlos evita aplicar una tarifa única que distorsione el presupuesto.

¿Debo contar el prompt de sistema?

Sí, si forma parte de la entrada que se envía al modelo. También conviene incluir contexto, herramientas o historial que compute como tokens de entrada.

¿La caché de prompts está incluida?

No de forma específica. Si tu modalidad aplica precios de caché diferentes, calcula esos tokens como un tramo separado con su tarifa efectiva.

¿Cómo trato solicitudes fallidas o reintentos?

Inclúyelos en el volumen si generan consumo facturable. Una tasa de reintento puede modelarse aumentando el número mensual de solicitudes.

¿Puedo comparar dos modelos?

Sí. Mantén los mismos volúmenes y tokens y cambia las tarifas; después compara el coste y considera también calidad, latencia y límites.