Planificador de presupuesto de tokens para agentes de IA

Este planificador estima cuántos tokens puede consumir una carga de trabajo de un agente de IA antes de ponerla en producción. Combina el número de tareas con los tokens medios de entrada y salida, las pasadas que realiza el agente y un margen adicional para variaciones.

Resulta útil al dimensionar límites, cuotas o presupuestos internos cuando un agente itera varias veces sobre una misma tarea. El resultado sirve como referencia de capacidad; el consumo real dependerá del modelo, del historial que se reinyecte en cada llamada, del uso de herramientas y de la longitud efectiva de las respuestas.

Datos de entrada

tareas
tokens
tokens
pasadas
%
Resultado
Presupuesto total de tokens
Tokens base
Tokens de margen
Tokens presupuestados por tarea

1. Define la carga
Introduce cuántas tareas quieres presupuestar en el periodo que estés planificando.

2. Estima el contexto
Indica los tokens medios de entrada que recibe el agente en cada pasada, incluyendo instrucciones y contexto relevante.

3. Estima la respuesta
Añade los tokens de salida previstos por pasada. Usa una media representativa de tus registros si ya tienes tráfico real.

4. Cuenta las iteraciones
Indica cuántas pasadas o llamadas al modelo realiza normalmente una tarea completa.

5. Añade holgura
Introduce un margen para cubrir respuestas largas, reintentos y variación del contexto.

6. Revisa el total
Compara el presupuesto total y el valor por tarea con la cuota o límite que quieras reservar.

Tokens base = tareas × (tokens de entrada + tokens de salida) × pasadas
Presupuesto total = tokens base × (1 + margen / 100)

Variables:

  • tareas: número de tareas del periodo
  • tokens de entrada: tokens enviados al modelo por pasada
  • tokens de salida: tokens generados por pasada
  • pasadas: llamadas o iteraciones por tarea
  • margen: porcentaje adicional de seguridad

Supuesto: El cálculo usa medias por pasada y aplica el mismo perfil a todas las tareas. No modela por separado caché, llamadas auxiliares ni variaciones entre modelos.

Qué significa el resultado

El resultado es una estimación operativa basada en los valores introducidos. Úsalo para comparar escenarios y dimensionar capacidad, no como sustituto de mediciones en producción.

Si la carga tiene mucha variabilidad, repite el cálculo con valores medios y conservadores para entender el rango posible.

Datos:

  • 100 tareas
  • 1.800 tokens de entrada por pasada
  • 600 tokens de salida por pasada
  • 3 pasadas por tarea
  • 15 % de margen

Cálculo:
Tokens base = 100 × (1.800 + 600) × 3 = 720.000. Margen = 720.000 × 15 % = 108.000. Total = 828.000 tokens.

Resultado: 828.000 tokens

Interpretación: Reservar unos 828.000 tokens cubre la carga media descrita más un 15 % de holgura.

¿Debo incluir los tokens del prompt del sistema?

Sí. Si el prompt del sistema se envía en cada llamada, forma parte de los tokens de entrada y debe estar incluido en la media.

¿Cómo trato los reintentos por errores?

Puedes reflejarlos aumentando las pasadas medias por tarea o usando el margen de seguridad. Si los reintentos son frecuentes, es mejor medirlos de forma explícita.

¿El presupuesto equivale al coste económico?

No. El presupuesto está expresado en tokens. Para convertirlo en coste necesitas aplicar la tarifa del modelo y distinguir, cuando corresponda, entre entrada y salida.

¿Qué ocurre si unas tareas son mucho más largas que otras?

Una sola media puede ocultar picos. Para cargas heterogéneas conviene calcular varios perfiles o usar percentiles de consumo observados.

¿Sirve para agentes que usan herramientas?

Sí como aproximación, siempre que los tokens derivados de resultados de herramientas y nuevas iteraciones estén reflejados en la entrada y en el número de pasadas.