Estimador de requisitos de GPU para flujos multiagente

Este estimador calcula una necesidad aproximada de GPU para un sistema multiagente a partir de las instancias de agente activas y su consumo incremental de VRAM. Añade un factor de pico para momentos en los que la concurrencia supera la media y limita la memoria utilizable de cada GPU mediante un objetivo de utilización.

El resultado es apropiado para planificación preliminar de memoria, no para decidir una topología concreta. Cuando varios agentes comparten el mismo modelo, los pesos pueden cargarse una sola vez; cuando usan modelos distintos o se distribuyen con paralelismo de modelo, la colocación real puede exigir más GPU que una simple suma de VRAM.

Datos de entrada

instancias
GB
%
GB
%
Resultado
GPU para el pico previsto
VRAM requerida en pico
VRAM utilizable por GPU
GPU equivalentes

1. Cuenta instancias simultáneas
Suma las instancias de agente que pueden estar activas al mismo tiempo en todos los flujos.

2. Mide la memoria incremental
Indica la VRAM adicional media que aporta cada instancia con la configuración de contexto prevista.

3. Modela el pico
Añade un porcentaje sobre la concurrencia media para absorber ráfagas o solapamientos.

4. Introduce la GPU
Especifica la VRAM física de una GPU de la clase que planeas usar.

5. Reserva margen de utilización
Fija qué porcentaje de esa VRAM quieres ocupar como máximo de forma sostenida.

6. Revisa el número entero
La estimación final se redondea hacia arriba a GPU completas.

VRAM de pico = instancias × VRAM por instancia × (1 + pico / 100)
VRAM utilizable/GPU = VRAM física × utilización objetivo / 100
GPU necesarias = techo(VRAM de pico / VRAM utilizable/GPU)

Variables:

  • instancias: agentes simultáneos en todos los flujos
  • VRAM por instancia: GB incrementales por agente
  • pico: porcentaje adicional de concurrencia/memoria
  • VRAM física: capacidad nominal por GPU
  • utilización objetivo: porcentaje máximo de VRAM que se desea ocupar

Supuesto: Se agregan necesidades de memoria como si pudieran distribuirse libremente. Restricciones por modelo, nodo o comunicación pueden aumentar el número físico necesario.

Qué significa el resultado

El resultado es una estimación operativa basada en los valores introducidos. Úsalo para comparar escenarios y dimensionar capacidad, no como sustituto de mediciones en producción.

Si la carga tiene mucha variabilidad, repite el cálculo con valores medios y conservadores para entender el rango posible.

Datos:

  • 40 instancias simultáneas
  • 1,2 GB por instancia
  • 25 % de pico
  • 80 GB por GPU
  • 85 % de utilización objetivo

Cálculo:
VRAM de pico = 40 × 1,2 × 1,25 = 60 GB. VRAM utilizable/GPU = 80 × 0,85 = 68 GB. GPU equivalentes = 60 / 68 = 0,8824; redondeo = 1 GPU.

Resultado: 1 GPU

Interpretación: La carga de pico estimada cabe dentro de los 68 GB que se han decidido utilizar de una GPU de 80 GB.

¿Instancias significa lo mismo que agentes definidos en el sistema?

No. Una definición de agente puede tener varias ejecuciones simultáneas. Introduce las instancias activas al mismo tiempo, que son las que presionan la memoria.

¿Qué representa el factor de pico?

Es un margen sobre la concurrencia media para periodos de mayor solapamiento. Si ya introduces la concurrencia máxima medida, puedes dejarlo en cero.

¿Por qué limitar la utilización de VRAM?

Dejar margen puede reducir fallos por picos, fragmentación o componentes no contabilizados. El porcentaje adecuado depende del runtime y de tus pruebas.

¿Cómo afecta usar modelos distintos por agente?

Puede aumentar mucho la memoria base porque quizá no puedan compartir pesos. En ese caso, separa las familias de modelos y dimensiona cada grupo.

¿Este cálculo determina también la potencia de cómputo necesaria?

No. Solo aproxima capacidad de memoria. Un despliegue puede tener VRAM suficiente y aun así no alcanzar la latencia o throughput objetivo por falta de cómputo.