1. Introduce el tamaño del prompt
Cuenta todos los tokens de entrada que formarían el prompt completo antes de la generación.
2. Estima la parte estable
Indica qué porcentaje pertenece a un prefijo o contenido que podría reutilizarse entre solicitudes.
3. Reserva tokens para la salida
Añade el máximo o presupuesto de generación que quieras conservar disponible.
4. Define el límite del modelo
Introduce la ventana de contexto total para comprobar que prompt y salida caben.
5. Interpreta los tokens nuevos
La cifra principal muestra la parte del prompt que seguiría siendo no cacheable según tu porcentaje estimado.