Calculadora RAG con OpenAI

Estima el coste de un sistema RAG con OpenAI separando la indexación inicial mediante embeddings del coste recurrente de consultas y generación.

Datos de cálculo

tokens
USD
consultas
tokens
tokens
USD
USD
Resultado
Resultado estimado
Coste de indexación
Coste mensual de generación
Coste medio por consulta
Tokens de generación al mes

1. Dimensiona el corpus
Introduce los tokens que realmente se enviarán a embeddings tras limpieza, fragmentación y solapamiento.

2. Añade la tarifa de embeddings
Usa el precio actual del modelo de embeddings elegido.

3. Estima el tráfico mensual
Indica el número de preguntas o búsquedas que activarán generación de respuesta.

4. Mide el contexto por consulta
Incluye en los tokens de entrada la pregunta, instrucciones y fragmentos recuperados que se insertan en el prompt.

5. Separa indexación y operación
El desglose evita confundir un gasto inicial relativamente pequeño con un coste de inferencia que se repite en cada consulta.

coste indexación = tokens corpus ÷ 1.000.000 × tarifa embeddings

coste consultas = consultas × (tokens entrada/M × tarifa entrada + tokens salida/M × tarifa salida)

primer periodo = coste indexación + coste consultas

Qué significa el resultado

El resultado suma una indexación completa del corpus y un mes de generación con el tráfico indicado.

No incluye base vectorial, búsqueda, reranking, almacenamiento ni reindexaciones futuras. Si existen, presupuestalos como componentes adicionales.

Datos: corpus de 50 M tokens a 0,02 USD/M; 100.000 consultas/mes con 3.500 tokens de entrada y 400 de salida; tarifas de 2 y 12 USD/M.

Cálculo: indexación = 50×0,02 = 1 USD. Consultas = 100.000×(3.500/1M×2 + 400/1M×12) = 1.180 USD.

Resultado: 1.181 USD en el primer periodo: 1 USD de indexación y 1.180 USD de generación.

¿Por qué la indexación puede ser pequeña frente a las consultas?

La indexación se realiza una o varias veces, mientras que la inferencia ocurre en cada consulta. Con tráfico alto, el coste recurrente puede dominar rápidamente.

¿Los fragmentos recuperados cuentan como tokens de entrada?

Sí cuando se insertan en el contexto enviado al modelo. El número de fragmentos y su longitud afectan directamente al coste y al uso de contexto.

¿Incluye la base de datos vectorial?

No. Almacenamiento, operaciones de búsqueda, transferencia o un servicio vectorial administrado deben presupuestarse aparte.

¿Cómo añado reindexaciones periódicas?

Multiplica el coste de indexación por el número de pasadas previstas o usa la calculadora de embeddings para un escenario más detallado.

¿Cómo puedo reducir el coste sin degradar RAG?

Empieza midiendo tokens de contexto por consulta, tasa de acierto de recuperación y longitud de salida. Reducir fragmentos irrelevantes suele ahorrar contexto sin recortar información útil.