Estimador de throughput para fine-tuning

Este estimador calcula el throughput efectivo de un clúster dedicado a fine-tuning y lo traduce tanto a tokens por segundo como a ejemplos por segundo. Multiplica el rendimiento de una GPU por el número de GPU, aplica un factor de eficiencia y divide después por la longitud media de cada ejemplo.

La conversión a ejemplos por segundo facilita comparar datasets con formatos diferentes y proyectar cuánto trabajo puede avanzar el entrenamiento. También permite observar el impacto de ejemplos más largos: aunque la capacidad de tokens permanezca igual, la cantidad de ejemplos procesados por unidad de tiempo disminuye.

Datos de entrada

GPU
tokens/s
%
tokens
Resultado
ejemplos procesados por segundo
Throughput efectivo total
Ejemplos por minuto
Tokens por minuto

1. Indica el tamaño del clúster
Introduce el número de GPU empleadas en paralelo.

2. Añade el benchmark por GPU
Usa un rendimiento medido en tokens/s para una configuración semejante.

3. Ajusta la eficiencia
Introduce el porcentaje de rendimiento útil respecto al escalado ideal.

4. Describe la longitud media
Suma entrada y salida u otros tokens que realmente recorra cada ejemplo.

5. Interpreta ambas unidades
Usa tokens/s para capacidad de cómputo y ejemplos/s para proyectar el avance del dataset.

Throughput efectivo = G·V·η
Ejemplos/s = Throughput efectivo / T

G es el número de GPU, V el throughput por GPU, η la eficiencia y T los tokens medios procesados por ejemplo.

Qué significa el resultado

El resultado principal indica cuántos ejemplos medios puede procesar el clúster por segundo con el throughput efectivo introducido.

La media de tokens por ejemplo puede ocultar colas de longitud muy distintas. Para datasets heterogéneos, compara varios escenarios o usa percentiles.

Datos: 8 GPU, 2.500 tokens/s por GPU, 82 % de eficiencia y 900 tokens por ejemplo.

Cálculo: throughput efectivo = 8×2.500×0,82 = 16.400 tokens/s. Ejemplos/s = 16.400/900 = 18,22.

Resultado: unas 18,22 muestras/s, equivalentes a 1.093,33 ejemplos/min.

¿Qué incluye la eficiencia?

Puede resumir pérdidas por comunicación, sincronización, I/O, evaluación y utilización imperfecta de las GPU.

¿Los tokens por ejemplo deben incluir padding?

Si el padding consume cómputo en tu pipeline, conviene reflejarlo en la longitud efectiva usada para el benchmark o en la eficiencia.

¿El throughput cambia con el batch size?

Sí. Por eso el rendimiento por GPU debería medirse con un batch y una secuencia representativos.

¿Puedo comparar dos modelos con este cálculo?

Sí, pero introduce para cada uno su propio throughput y longitud efectiva de ejemplo. Modelos distintos pueden tener perfiles de memoria y escalado diferentes.

¿Cómo convierto este throughput en duración total?

Usa el estimador de capacidad de latencia para fine-tuning, que añade dataset y épocas para obtener tiempo total.