1. Cuenta los tokens de la consulta
Introduce el tamaño tokenizado de la pregunta o instrucción del usuario.
2. Define el contexto recuperado
Indica cuántos fragmentos se insertan y cuántos tokens contiene cada uno de media.
3. Añade la sobrecarga
Incluye instrucciones de sistema, plantillas, metadatos y separadores que también consumen contexto.
4. Reserva espacio para la respuesta
Aparta tokens para la generación esperada en lugar de consumir toda la ventana con entrada.
5. Comprueba el margen
Si el total supera el límite, reduce fragmentos, tamaño de chunk, sobrecarga o reserva.