Estimador de GPU necesarias para fine-tuning

Este estimador calcula el número mínimo teórico de GPU necesario para terminar un fine-tuning dentro de una duración objetivo. Convierte el dataset y las épocas en tokens totales, calcula cuántos tokens por segundo exige el plazo y divide esa demanda entre el throughput efectivo de una GPU.

Es útil cuando el tiempo de entrega está fijado y el hardware es la variable que puede ajustarse. Permite ensayar rápidamente distintos benchmarks por GPU y niveles de eficiencia, y muestra además la duración aproximada que resultaría después de redondear el número de GPU al entero superior.

Datos de entrada

tokens
épocas
h
tokens/s
%
Resultado
GPU necesarias (redondeadas hacia arriba)
Tokens totales
Throughput requerido
Duración con las GPU redondeadas

1. Define el volumen
Introduce tokens del dataset y número de épocas.

2. Fija el plazo
Indica en cuántas horas quieres completar el entrenamiento.

3. Añade el benchmark
Usa el throughput por GPU de una configuración comparable.

4. Ajusta la eficiencia
Representa pérdidas del sistema con un porcentaje inferior al 100 % cuando corresponda.

5. Revisa la duración resultante
El redondeo hacia arriba suele producir una duración ligeramente menor que el objetivo.

Tokens totales = D·E
Throughput requerido = Tokens totales/(H·3.600)
GPU = techo(Throughput requerido/(V·η))

D son los tokens del dataset, E las épocas, H las horas objetivo, V el throughput por GPU y η la eficiencia.

Qué significa el resultado

El resultado indica el número entero mínimo de GPU que, bajo los supuestos introducidos, supera el throughput necesario para cumplir el plazo.

También debes comprobar que cada GPU tenga memoria suficiente y que el sistema pueda escalar con la eficiencia indicada. El cálculo no dimensiona memoria.

Datos: 200 millones de tokens, 3 épocas, objetivo 8 h, 2.500 tokens/s por GPU y 80 % de eficiencia.

Cálculo: 600 millones de tokens totales. Throughput requerido = 600.000.000/(8×3.600) = 20.833,33 tokens/s. Capacidad efectiva por GPU = 2.000 tokens/s. GPU = techo(10,4167) = 11.

Resultado: 11 GPU; la duración estimada sería aproximadamente 7,58 h.

¿Por qué se redondea hacia arriba?

Porque el objetivo temporal exige al menos la capacidad calculada y normalmente no se puede asignar una fracción de GPU como recurso independiente.

¿Puedo introducir un throughput teórico del fabricante?

Es preferible usar un benchmark del modelo y configuración reales, ya que el throughput de entrenamiento depende de muchos factores además del hardware.

¿Qué ocurre si reduzco las épocas?

Disminuyen los tokens totales y, por tanto, las GPU necesarias para el mismo plazo. La decisión sobre épocas debe basarse también en calidad y convergencia.

¿La memoria de GPU está incluida?

No. Una configuración puede tener throughput suficiente pero no memoria suficiente para el modelo, optimizador, activaciones y batch.

¿Cómo verifico el resultado antes de reservar un clúster grande?

Ejecuta una prueba corta con una o pocas GPU para medir throughput y eficiencia reales, y vuelve a introducir esos valores.