Calculadora de chatbot con OpenAI

Estima el coste mensual de un chatbot basado en OpenAI combinando conversaciones, turnos, tokens medios por turno y tarifas de entrada y salida.

Datos de cálculo

conv.
turnos
tokens
tokens
USD
USD
Resultado
Resultado estimado
Turnos mensuales
Tokens mensuales
Coste por conversación
Parte del coste por salida

1. Estima las conversaciones
Usa tráfico mensual real o previsto, separando si es necesario temporadas con volúmenes muy distintos.

2. Define los turnos
Cuenta cuántas respuestas del asistente se producen de media en una conversación.

3. Mide tokens por turno
La entrada puede crecer si reenvías historial o contexto; usa observaciones de producción cuando dispongas de ellas.

4. Introduce tarifas
Escribe los precios actuales de entrada y salida del modelo que estés valorando.

5. Analiza coste unitario
El coste por conversación ayuda a traducir el consumo técnico a métricas operativas de soporte o producto.

turnos mensuales = conversaciones × turnos por conversación

coste = turnos × [(tokens entrada ÷ 1.000.000 × tarifa entrada) + (tokens salida ÷ 1.000.000 × tarifa salida)]

Qué significa el resultado

El total aproxima el gasto mensual de inferencia del chatbot para el patrón medio introducido.

No incluye bases de datos, RAG, moderación, herramientas externas, voz, imágenes ni infraestructura salvo que su efecto ya esté incorporado en tus tokens o tarifas.

Datos: 50.000 conversaciones, 6 turnos, 900 tokens de entrada y 250 de salida por turno, tarifas de 2 y 12 USD/M.

Cálculo: 300.000 turnos. Entrada: 270 M tokens × 2 = 540 USD. Salida: 75 M × 12 = 900 USD. Total = 1.440 USD.

Resultado: 1.440 USD al mes, unos 0,0288 USD por conversación.

¿Debo contar cada mensaje del usuario como un turno?

Esta calculadora define un turno como una respuesta del asistente con su entrada asociada. Si tu flujo usa otra unidad, ajusta el promedio para que represente llamadas reales al modelo.

¿El historial hace que aumenten los tokens de entrada?

Sí cuando se reenvía dentro del contexto. En chats largos, el promedio de entrada por turno puede ser mucho mayor que el mensaje nuevo del usuario.

¿Incluye RAG?

Solo si los fragmentos recuperados ya están incluidos en los tokens de entrada. El coste de embeddings, almacenamiento o búsqueda se calcula aparte.

¿Cómo modelo picos de tráfico?

Calcula escenarios separados para un mes normal y uno de pico. Así evitas que un único promedio oculte necesidades de presupuesto o capacidad.

¿Qué métrica debería vigilar en producción?

Además del gasto total, controla tokens por turno, turnos por conversación y coste por conversación; juntos explican la mayor parte de las variaciones del modelo.