1. Dimensiona el corpus
Introduce los tokens que realmente se enviarán a embeddings tras limpieza, fragmentación y solapamiento.
2. Añade la tarifa de embeddings
Usa el precio actual del modelo de embeddings elegido.
3. Estima el tráfico mensual
Indica el número de preguntas o búsquedas que activarán generación de respuesta.
4. Mide el contexto por consulta
Incluye en los tokens de entrada la pregunta, instrucciones y fragmentos recuperados que se insertan en el prompt.
5. Separa indexación y operación
El desglose evita confundir un gasto inicial relativamente pequeño con un coste de inferencia que se repite en cada consulta.