Estimador de rendimiento para traducción con IA

Estima cuántas traducciones por hora y por día puede procesar una infraestructura de IA a partir del número de GPU, el rendimiento en tokens por segundo, los tokens medios por traducción y la utilización efectiva. Esta conversión ayuda a traducir benchmarks de generación a una métrica operativa comprensible para planificación de capacidad. También permite comprobar rápidamente cómo cambian los volúmenes si mejoras el rendimiento del modelo, reduces la longitud media o añades GPU.

Rendimiento de traducción

GPU
tokens/s
tokens
%
h/día
Resultado
Traducciones estimadas por hora
Traducciones por segundo
Traducciones por día
Tokens procesados por hora
Traducciones/h por GPU

1. Cuenta las GPU. Introduce las unidades que estarán disponibles para la carga de traducción.

2. Indica tokens por segundo. Usa un rendimiento efectivo por GPU medido con tu configuración.

3. Estima tokens por traducción. Incluye el trabajo medio de entrada y salida que corresponda al benchmark.

4. Aplica utilización. Reduce la capacidad teórica para reflejar tiempos ociosos y margen operativo.

5. Convierte a volumen. Revisa traducciones por segundo, hora y día y compáralas con la demanda esperada.

La relación principal utilizada es:

Traducciones/h = GPU × tokens/s/GPU × utilización × 3600 ÷ tokens/traducción

GPU: número de unidades de procesamiento.

tokens/s/GPU: rendimiento efectivo por GPU.

utilización: fracción productiva del tiempo.

tokens/traducción: carga media total por una traducción.

Supuesto: Se asume que el rendimiento en tokens por segundo es representativo de la mezcla de longitudes y que la carga puede repartirse entre GPU sin pérdidas importantes.

Qué significa el resultado

La cifra principal es el número aproximado de traducciones que el conjunto de GPU puede completar en una hora sostenida.

El throughput real puede variar por batching, longitud de contexto, idioma, decodificación, memoria y límites de servicio.

Datos: 6 GPU, 6.000 tokens/s por GPU, 900 tokens por traducción, 75 % de utilización y 20 h/día.

Cálculo: tokens/s efectivos = 6 × 6.000 × 0,75 = 27.000. Traducciones/s = 27.000/900 = 30. Por hora = 108.000.

Resultado: unas 108.000 traducciones/h y 2.160.000 en 20 horas.

¿Tokens por traducción significa solo salida?

No necesariamente. Debe ser coherente con el rendimiento usado. Si tu benchmark de tokens/s se refiere solo a salida, utiliza tokens de salida; si modela trabajo combinado, usa una carga combinada.

¿Más batching siempre aumenta el rendimiento?

Puede mejorar utilización hasta cierto punto, pero también consumir más memoria o aumentar latencia. Mide el rendimiento con el batch que realmente puedas sostener.

¿Cómo reflejo GPU heterogéneas?

Calcula el rendimiento de cada grupo por separado y suma los tokens por segundo efectivos antes de convertirlos a traducciones.

¿Por qué limitar las horas diarias?

Permite representar ventanas de servicio, mantenimiento o cargas que solo se ejecutan parte del día.

¿Qué diferencia hay con el estimador de GPU?

Este parte de recursos disponibles para calcular capacidad. El estimador de GPU parte de una demanda objetivo para calcular cuántos recursos serían necesarios.