1. Introduce Introduce el límite de contexto del modelo o del endpoint que vas a utilizar.
2. Reserva Reserva tokens para instrucciones del sistema y para el historial que viajará en cada petición.
3. Indica Indica cuántos fragmentos recuperas y el tamaño medio de cada fragmento en tokens.
4. Reserva Reserva el máximo de salida que quieres permitir al modelo.
5. Comprueba Comprueba el margen restante; si es negativo, reduce contexto, historial o salida antes de ejecutar la petición.