Estimador de capacidad de latencia para fine-tuning

Este estimador aproxima la duración de un trabajo de fine-tuning a partir del volumen de tokens que debe procesarse y de la capacidad agregada de las GPU. Multiplica el dataset por las épocas, ajusta el throughput nominal mediante una eficiencia efectiva y convierte el tiempo total a horas.

Resulta útil para planificar ventanas de entrenamiento, comparar tamaños de clúster o comprobar si un objetivo temporal es razonable antes de reservar recursos. La eficiencia permite representar pérdidas debidas a comunicación, preparación de lotes, evaluación u otras pausas que impiden utilizar el throughput nominal de forma continua.

Datos de entrada

tokens
épocas
GPU
tokens/s
%
Resultado
horas estimadas de entrenamiento
Tokens totales procesados
Throughput efectivo agregado
Duración en minutos

1. Introduce el dataset
Usa los tokens que realmente participarán en entrenamiento, después de separar validación si corresponde.

2. Añade las épocas
Indica cuántas veces se recorrerá el dataset.

3. Define el hardware
Introduce el número de GPU y el throughput medido o previsto por GPU.

4. Ajusta la eficiencia
Reduce el 100 % si esperas pérdidas por coordinación, I/O, evaluación o lotes poco eficientes.

5. Comprueba la duración
El resultado muestra horas y el desglose permite revisar throughput y volumen total.

Tokens totales = D·E
Throughput efectivo = G·V·η
Tiempo (h) = Tokens totales / Throughput efectivo / 3.600

D son los tokens del dataset, E las épocas, G las GPU, V los tokens/s por GPU y η la eficiencia como fracción.

Qué significa el resultado

La cifra principal es la duración aproximada para procesar el volumen indicado con la capacidad efectiva calculada.

No incluye explícitamente tiempo de arranque, guardado de checkpoints, evaluación externa ni fallos. Puedes reflejar parte de esas pérdidas reduciendo la eficiencia.

Datos: 9 millones de tokens, 3 épocas, 4 GPU, 2.500 tokens/s por GPU y 80 % de eficiencia.

Cálculo: tokens totales = 27.000.000. Throughput efectivo = 4×2.500×0,80 = 8.000 tokens/s. Tiempo = 27.000.000/8.000/3.600 = 0,9375 h.

Resultado: unas 0,94 horas, es decir, 56,25 minutos.

¿Qué tokens debo usar como tamaño del dataset?

Los tokens de las muestras que realmente entrenan el modelo. Si ya has separado validación, no la incluyas salvo que quieras modelar también ese procesamiento.

¿Cómo estimo la eficiencia?

Parte de mediciones de utilización o de la relación entre throughput observado y throughput ideal. Si no tienes datos, prueba varios escenarios en vez de asumir un valor exacto.

¿Más GPU siempre reduce el tiempo de forma lineal?

El modelo sí lo supone, pero los sistemas reales suelen perder eficiencia al escalar por comunicación y sincronización.

¿Se incluye el tiempo de evaluación?

No de manera específica. Puedes reducir la eficiencia o añadir ese tiempo posteriormente.

¿Qué relación tiene con el estimador de GPU?

Aquí eliges las GPU y obtienes duración; el estimador de GPU parte de una duración objetivo y calcula cuántas GPU serían necesarias.