Planificador de presupuesto de tokens para inferencia LLM

Calcula cuántos tokens debes reservar para una carga de inferencia LLM a partir del tamaño medio del prompt, la salida esperada, el número de solicitudes y un margen operativo. Es útil al preparar límites de contexto, cuotas internas, pruebas de carga o previsiones de consumo.

El resultado principal muestra el presupuesto total de tokens del periodo. El desglose separa el consumo por solicitud, la parte de entrada y salida y el margen añadido, de modo que puedas revisar si tus supuestos son coherentes antes de asignar capacidad o estimar costes.

Datos de entrada

tokens
tokens
solicitudes
%
Resultado
tokens presupuestados en total
Tokens base por solicitud
Tokens base totales
Tokens de margen
  1. Introduce los tokens de entrada. Usa el promedio previsto del prompt completo, incluyendo instrucciones del sistema y contexto recuperado.
  2. Indica la salida esperada. Introduce los tokens que el modelo generará de media por solicitud.
  3. Define el volumen. Especifica cuántas solicitudes esperas durante el periodo que quieres planificar.
  4. Añade un margen. Reserva capacidad para variaciones de longitud, reintentos o picos de uso sin inflar los datos base.
  5. Revisa el total. Compara el presupuesto con límites de contexto, cuotas y capacidad disponible.
Tokens por solicitud = tokens de entrada + tokens de salida Tokens base totales = tokens por solicitud × solicitudes Presupuesto total = tokens base totales × (1 + margen / 100)

El margen se aplica al consumo total previsto. Este modelo usa valores medios; si la distribución de longitudes es muy desigual, conviene planificar también percentiles altos.

Qué significa el resultado

Es la cantidad de tokens que conviene reservar para atender el volumen introducido bajo los supuestos seleccionados.

No representa un límite de contexto por sí solo: el límite por solicitud debe comprobarse con la suma de entrada y salida de cada petición.

Datos: 1.200 tokens de entrada, 350 de salida, 10.000 solicitudes y 15 % de margen.

Cálculo: 1.200 + 350 = 1.550 tokens/solicitud. 1.550 × 10.000 = 15.500.000 tokens base. Con margen: 15.500.000 × 1,15 = 17.825.000 tokens.

Resultado: presupuesto total de 17.825.000 tokens.

¿Debo usar la media o el máximo de tokens?

Para presupuestar consumo suele ser útil una media representativa con margen. Para verificar límites de contexto, en cambio, debes considerar los casos máximos o percentiles altos.

¿Los tokens de entrada incluyen el mensaje del sistema?

Sí. Incluye todo lo que se envía al modelo: sistema, historial, contexto recuperado, herramientas serializadas y mensaje del usuario cuando corresponda.

¿El margen cubre reintentos?

Puede usarse para absorber reintentos y variabilidad, pero si los reintentos son frecuentes es mejor modelarlos explícitamente en el número de solicitudes.

¿Qué ocurre si la salida real varía mucho?

El promedio puede ocultar colas largas. En ese caso, crea escenarios con una salida media y otra de percentil alto para comparar capacidad.

¿Este presupuesto sirve para calcular coste?

Sirve como base, pero para coste necesitas además las tarifas o costes efectivos de tokens de entrada y salida, que pueden ser distintos.