Planificador de presupuesto de tokens para transcripción con IA

Estima el presupuesto de tokens necesario para una tarea de transcripción con IA cuando el transcript, las instrucciones y la salida posterior comparten una ventana de contexto o un límite de consumo. Sirve para dimensionar solicitudes de resumen, extracción o análisis que parten de audio convertido a texto.

El cálculo transforma minutos de voz en una estimación de palabras y después en tokens, añade el contexto fijo y una reserva de salida, y aplica un margen de seguridad. Así puedes detectar con antelación si una sesión larga exige segmentación o un modelo con mayor contexto.

Datos de entrada

min
pal/min
tok/pal
tokens
tokens
%
Resultado
tokens de presupuesto recomendados
Tokens del transcript
Presupuesto base
Reserva por margen
  1. Introduce la duración. Usa los minutos de audio que terminarán representados en el transcript.
  2. Estima la velocidad de habla. Ajusta las palabras por minuto al tipo de conversación.
  3. Define la relación tokens/palabra. Usa una media observada para el idioma y el tokenizador del modelo.
  4. Añade instrucciones y salida. Reserva tokens para prompts, metadatos, resumen o respuesta estructurada.
  5. Aplica un margen. Compensa variaciones de velocidad de habla, puntuación o tokenización.
Tokens transcript = minutos × palabras/min × tokens/palabra Presupuesto = (tokens transcript + prompt + reserva salida) × (1 + margen/100)

Es una estimación de capacidad, no un recuento exacto del tokenizador. Si conoces el transcript real, sustituye la aproximación por su recuento medido.

Qué significa el resultado

El resultado aproxima cuántos tokens conviene presupuestar para procesar la sesión completa con el margen indicado.

Idiomas, nombres propios, números, código y formatos estructurados pueden cambiar de forma significativa la relación entre palabras y tokens.

Datos: 60 min, 150 palabras/min, 1,3 tokens/palabra, 800 tokens de prompt, 1.500 de salida y margen del 20 %.

Cálculo: transcript = 60×150×1,3 = 11.700 tokens. Base = 11.700+800+1.500 = 14.000. Con margen: 14.000×1,20 = 16.800.

Resultado: conviene presupuestar aproximadamente 16.800 tokens.

¿Por qué se usa palabras por minuto?

Permite estimar la longitud del transcript cuando aún no existe el texto. Si ya tienes el transcript, un recuento real de tokens será más preciso.

¿Qué margen de seguridad conviene usar?

Depende de la variabilidad de tus audios y de lo cerca que estés del límite de contexto. Usa datos históricos cuando sea posible en lugar de un porcentaje fijo universal.

¿La reserva de salida cuenta si solo quiero transcribir?

Si no habrá una etapa de generación posterior, puedes ponerla a cero. Es útil cuando el mismo flujo también resume, etiqueta o extrae información.

¿Los silencios aumentan los tokens?

No directamente en el transcript textual, aunque sí aumentan la duración del audio. Si hay mucho silencio, ajustar la velocidad efectiva de habla evita sobreestimar.

¿Presupuesto de tokens y duración máxima de audio son lo mismo?

No. El presupuesto controla texto/contexto; la duración máxima también puede estar limitada por el servicio de audio, tamaño de archivo o tiempo de proceso.