Planificador de presupuesto de tokens para RAG

Este planificador distribuye el límite de contexto de una aplicación con generación aumentada por recuperación (RAG) entre instrucciones, historial, fragmentos recuperados y respuesta. Ayuda a detectar si una configuración cabe en la ventana disponible antes de enviar la solicitud al modelo.

La estimación usa conteos de tokens ya conocidos o aproximados. El tokenizado exacto depende del modelo y del contenido, por lo que conviene medir con el tokenizador real cuando el límite esté muy ajustado.

Ventana de contexto y consumo

tokens
tokens
tokens
fragmentos
tokens
tokens
Resultado
Tokens disponibles restantes
Tokens presupuestados
Tokens de recuperación
Uso de la ventana

1. Introduce Introduce el límite de contexto del modelo o del endpoint que vas a utilizar.

2. Reserva Reserva tokens para instrucciones del sistema y para el historial que viajará en cada petición.

3. Indica Indica cuántos fragmentos recuperas y el tamaño medio de cada fragmento en tokens.

4. Reserva Reserva el máximo de salida que quieres permitir al modelo.

5. Comprueba Comprueba el margen restante; si es negativo, reduce contexto, historial o salida antes de ejecutar la petición.

Tokens RAG = Fragmentos × Tokens por fragmento
Tokens usados = Sistema + Historial + Tokens RAG + Salida reservada
Margen = Ventana − Tokens usados

Se asume que todos los componentes comparten la misma ventana de contexto. No se incluyen posibles tokens adicionales de formato o herramientas salvo que los incorpores en las entradas.

Qué significa el resultado

Un margen positivo indica cuánto espacio queda sin asignar dentro de la ventana configurada; un valor negativo señala sobrepresupuesto.

Añade un colchón operativo cuando el tokenizado de consultas, metadatos o plantillas pueda variar entre solicitudes.

Datos: ventana de 128.000 tokens; 1.200 de sistema; 4.000 de historial; 8 fragmentos de 700 tokens; y 2.000 reservados para salida.

Cálculo: recuperación = 8 × 700 = 5.600. Total usado = 1.200 + 4.000 + 5.600 + 2.000 = 12.800. Margen = 128.000 − 12.800 = 115.200.

Resultado: quedan 115.200 tokens sin asignar y el presupuesto ocupa el 10 % de la ventana.

¿Un token equivale a una palabra?

No. La relación varía según idioma, modelo y texto. Usa conteos reales cuando la precisión sea importante.

¿Debo reservar la salida dentro de la misma ventana?

En muchos modelos el contexto de entrada y la salida comparten un límite total o restricciones relacionadas. Usa la especificación concreta del modelo como referencia.

¿Qué tamaño de fragmento es mejor para RAG?

No existe uno universal. Depende del tipo de documento, recuperación, modelo y granularidad necesaria para responder.

¿Por qué conviene dejar margen libre?

Porque consultas, metadatos, separadores y tokenización pueden variar. Un colchón reduce errores por exceder el contexto.

¿Más contexto recuperado siempre mejora la respuesta?

No. Contexto irrelevante puede aumentar coste y diluir la señal. La calidad de recuperación importa tanto como el volumen.