1. Cuenta instancias simultáneas
Suma las instancias de agente que pueden estar activas al mismo tiempo en todos los flujos.
2. Mide la memoria incremental
Indica la VRAM adicional media que aporta cada instancia con la configuración de contexto prevista.
3. Modela el pico
Añade un porcentaje sobre la concurrencia media para absorber ráfagas o solapamientos.
4. Introduce la GPU
Especifica la VRAM física de una GPU de la clase que planeas usar.
5. Reserva margen de utilización
Fija qué porcentaje de esa VRAM quieres ocupar como máximo de forma sostenida.
6. Revisa el número entero
La estimación final se redondea hacia arriba a GPU completas.