Planificador de presupuesto de tokens para procesamiento por lotes LLM

Planifica el volumen de tokens que consumirá un trabajo por lotes LLM antes de lanzarlo. Combina el número de tareas con los tokens medios de entrada y salida y permite reservar un margen para reintentos, registros atípicos o variaciones de longitud.

A diferencia de una carga interactiva, aquí el foco está en el tamaño total del lote. El presupuesto resultante puede utilizarse para comprobar cuotas, estimar duración con un throughput conocido o convertir después el volumen en coste.

Datos de entrada

tareas
tokens
tokens
%
Resultado
tokens presupuestados para el lote
Tokens por tarea
Tokens base del lote
Margen añadido
  1. Cuenta las tareas. Introduce el número de registros o trabajos que procesará el lote.
  2. Estima entrada y salida. Usa valores medios representativos por tarea.
  3. Reserva margen. Añade cobertura para reintentos, excepciones o colas de longitud.
  4. Comprueba el total. Usa el presupuesto para cuotas, coste y planificación temporal.
Tokens por tarea = entrada + salida Tokens base del lote = tareas × tokens por tarea Presupuesto = tokens base × (1 + margen / 100)

El margen se aplica al lote completo. Si conoces una tasa de reintento explícita, puedes incorporarla directamente al número efectivo de tareas.

Qué significa el resultado

Es el volumen total de tokens que conviene reservar para completar el lote bajo los supuestos indicados.

Los promedios pueden ocultar documentos muy largos; valida que cada tarea individual también respete el contexto máximo del modelo.

Datos: 50.000 tareas, 900 tokens de entrada, 220 de salida y 10 % de margen.

Cálculo: 1.120 tokens/tarea. Base = 50.000 × 1.120 = 56.000.000 tokens. Presupuesto = 56.000.000 × 1,10 = 61.600.000.

Resultado: 61.600.000 tokens presupuestados.

¿Una tarea equivale siempre a una solicitud?

En este cálculo sí: cada unidad del lote se trata como una tarea con un consumo medio. Si una tarea genera varias llamadas al modelo, usa el consumo agregado de todas ellas.

¿Cómo estimo tokens de documentos de tamaños distintos?

Puedes usar una muestra representativa y calcular un promedio, o crear escenarios separados por grupos de tamaño para evitar que los documentos largos distorsionen el presupuesto.

¿El margen debe incluir tareas fallidas?

Sí, si esperas reintentos. Cuando conoces su frecuencia, modelarlos como tareas adicionales suele ser más transparente.

¿Puedo usar este total para estimar duración?

Sí, si conoces el throughput efectivo del sistema en tokens/s. Divide el volumen pertinente por ese throughput, teniendo en cuenta que prefill y generación pueden comportarse de forma distinta.

¿El presupuesto es lo mismo que el límite de contexto?

No. El presupuesto es agregado para todo el lote; el límite de contexto se aplica a cada tarea individual.