Planificador de presupuesto de tokens para búsqueda vectorial

Este planificador calcula cuántos tokens ocupa una interacción que incorpora resultados de búsqueda vectorial antes de enviarlos a un modelo de lenguaje. Suma los tokens de la consulta, el contenido recuperado, la sobrecarga del prompt y una reserva para la salida, y compara ese total con la ventana de contexto disponible.

Sirve para decidir cuántos fragmentos recuperar, qué tamaño de chunk utilizar o cuánto espacio reservar para la respuesta sin rebasar el límite del modelo. El cálculo es deliberadamente transparente: no estima tokens a partir de caracteres, sino que parte de cantidades de tokens que puedes obtener con el tokenizador correspondiente o con mediciones de tu aplicación.

Datos de entrada

tokens
tokens
tokens
tokens
tokens
Resultado
tokens totales presupuestados
Tokens de contexto recuperado
Margen restante
Uso de la ventana de contexto

1. Cuenta los tokens de la consulta
Introduce el tamaño tokenizado de la pregunta o instrucción del usuario.

2. Define el contexto recuperado
Indica cuántos fragmentos se insertan y cuántos tokens contiene cada uno de media.

3. Añade la sobrecarga
Incluye instrucciones de sistema, plantillas, metadatos y separadores que también consumen contexto.

4. Reserva espacio para la respuesta
Aparta tokens para la generación esperada en lugar de consumir toda la ventana con entrada.

5. Comprueba el margen
Si el total supera el límite, reduce fragmentos, tamaño de chunk, sobrecarga o reserva.

Tokens recuperados = número de fragmentos × tokens por fragmento Presupuesto total = consulta + tokens recuperados + sobrecarga + reserva de salida Margen = límite de contexto − presupuesto total

El cálculo supone que todas las cantidades usan el mismo tokenizador que el modelo de destino.

Qué significa el resultado

Un margen positivo indica que el presupuesto cabe dentro de la ventana de contexto indicada; un margen negativo señala un exceso.

Los tokenizadores difieren entre modelos. Mide los tokens con el modelo real cuando necesites un control preciso del límite.

Datos: consulta de 120 tokens, 6 fragmentos de 350 tokens, 500 tokens de sobrecarga, 900 de reserva y límite de 8.192.

Cálculo: contexto recuperado = 6 × 350 = 2.100 tokens. Total = 120 + 2.100 + 500 + 900 = 3.620 tokens. Margen = 8.192 − 3.620 = 4.572 tokens.

Resultado: se utiliza aproximadamente el 44,2 % de la ventana y quedan 4.572 tokens de margen.

¿Por qué reservar tokens para la salida?

Porque la generación también ocupa la ventana de contexto en muchos modelos. Reservar espacio evita llenar toda la capacidad con el prompt y dejar una respuesta truncada.

¿Debo usar el tamaño máximo o el promedio de los fragmentos?

Para planificación conservadora puedes usar un percentil alto o un máximo razonable. El promedio es útil para estimar uso típico, pero puede ocultar consultas con fragmentos mucho más largos.

¿Qué ocurre si el margen es negativo?

El presupuesto supera el límite indicado. Reduce el número o tamaño de fragmentos, recorta instrucciones o disminuye la reserva de salida según las necesidades de la aplicación.

¿Los metadatos de los documentos cuentan como tokens?

Sí, si se insertan en el prompt. Títulos, URLs, etiquetas, separadores y citas deben incluirse dentro de la sobrecarga o del tamaño de cada fragmento.

¿Este planificador calcula automáticamente tokens desde texto?

No. Trabaja con cantidades de tokens ya estimadas o medidas para no asumir un tokenizador concreto.