Estimador de GPU necesarias para traducción con IA

Estima cuántas GPU se necesitan para atender una carga de traducción con IA cuando conoces la demanda de textos por hora, los tokens procesados por texto y el rendimiento efectivo de una GPU en tokens por segundo. También incorpora utilización objetivo y reserva de capacidad, dos parámetros importantes para evitar dimensionar el sistema al límite teórico. El resultado permite pasar de métricas de benchmark a una cantidad de GPU aproximada para producción.

Demanda y GPU

tareas/h
tokens
tokens/s
%
%
Resultado
GPU necesarias
GPU teóricas
Tokens/h con reserva
Tokens/h por GPU
Traducciones/h por GPU

1. Introduce traducciones por hora. Usa la demanda que necesitas cubrir, preferiblemente en periodo pico.

2. Estima tokens totales. Suma entrada y salida medias por traducción para reflejar trabajo procesado.

3. Mide tokens por segundo. Usa un benchmark por GPU con el mismo modelo, precisión y estrategia de batching.

4. Fija utilización y reserva. Añade holgura tanto a la carga por GPU como a la demanda cubierta.

5. Comprueba el entero final. Revisa las GPU teóricas y el redondeo hacia arriba usado para el despliegue.

La relación principal utilizada es:

GPU = ceil([tareas/h × tokens/tarea × (1 + reserva)] ÷ [tokens/s/GPU × 3600 × utilización])

tareas/h: traducciones requeridas cada hora.

tokens/tarea: tokens totales procesados por traducción.

tokens/s/GPU: rendimiento efectivo medido por GPU.

utilización: porcentaje productivo objetivo.

reserva: capacidad adicional sobre la demanda.

Supuesto: El cálculo simplifica entrada y salida como carga total de tokens. En arquitecturas donde prefilling y generación tienen rendimientos muy distintos, puede ser necesario modelarlas por separado.

Qué significa el resultado

El resultado redondeado indica una cantidad aproximada de GPU capaz de cubrir la carga ajustada bajo el rendimiento y utilización especificados.

Valida memoria, longitud de contexto, batching, redundancia y cuellos de botella de CPU/red antes de convertir la cifra en un diseño final.

Datos: 24.000 traducciones/h, 800 tokens por traducción, 8.000 tokens/s por GPU, 75 % de utilización y 25 % de reserva.

Cálculo: demanda ajustada = 24.000 × 800 × 1,25 = 24.000.000 tokens/h. Capacidad por GPU = 8.000 × 3.600 × 0,75 = 21.600.000 tokens/h. GPU teóricas = 1,111.

Resultado: se necesitan 2 GPU al redondear hacia arriba.

¿Debo sumar tokens de entrada y salida?

Para una aproximación simple de trabajo total, sí. Si el hardware procesa ambas fases con velocidades muy distintas, conviene separarlas en un modelo más detallado.

¿De dónde saco tokens por segundo por GPU?

De un benchmark representativo con el mismo modelo, hardware, precisión, batch y longitudes de contexto que esperas en producción.

¿Por qué añadir reserva si ya uso 70 % de utilización?

La utilización protege la capacidad de cada GPU; la reserva cubre crecimiento o picos de demanda. Ajusta ambos según tu política para no sobredimensionar.

¿La memoria de GPU está incluida?

No. La fórmula calcula capacidad de cómputo, pero memoria de pesos, KV cache y batching puede imponer un mínimo mayor.

¿Puedo usar GPU fraccionarias de la nube?

Si el proveedor ofrece particiones con rendimiento medible, puedes convertirlas a equivalentes. El resultado principal se redondea a unidades enteras por simplicidad.