1. Fija la concurrencia
Introduce el máximo de ejecuciones del agente que esperas mantener simultáneamente.
2. Estima la VRAM incremental
Indica la memoria adicional que una ejecución concurrente añade al servicio. No dupliques pesos compartidos si ya están incluidos en la base.
3. Añade sobrecarga
Reserva memoria para runtime, fragmentación, cachés u otros componentes no reflejados en la cifra por ejecución.
4. Define la memoria útil
Especifica cuánta VRAM de cada GPU consideras realmente utilizable por el servicio.
5. Revisa el redondeo
El resultado se redondea hacia arriba porque una fracción de GPU adicional requiere otra GPU completa bajo este modelo.