Estimador de requisitos de GPU para agentes de IA

Este estimador aproxima el número de GPU necesario cuando cada ejecución concurrente de un agente consume una cantidad de VRAM atribuible. Suma la memoria requerida por las ejecuciones simultáneas, aplica una sobrecarga operativa y la compara con la VRAM disponible por GPU.

Está pensado para una primera planificación de capacidad, especialmente en despliegues en los que la memoria es el recurso limitante. No sustituye una prueba del modelo real: pesos compartidos, KV cache, batching, precisión, longitud de contexto y particionado entre GPU pueden cambiar de forma importante la memoria efectiva.

Datos de entrada

sesiones
GB
%
GB
Resultado
GPU necesarias
VRAM total requerida
GPU equivalentes antes de redondear
VRAM libre en la capacidad asignada

1. Fija la concurrencia
Introduce el máximo de ejecuciones del agente que esperas mantener simultáneamente.

2. Estima la VRAM incremental
Indica la memoria adicional que una ejecución concurrente añade al servicio. No dupliques pesos compartidos si ya están incluidos en la base.

3. Añade sobrecarga
Reserva memoria para runtime, fragmentación, cachés u otros componentes no reflejados en la cifra por ejecución.

4. Define la memoria útil
Especifica cuánta VRAM de cada GPU consideras realmente utilizable por el servicio.

5. Revisa el redondeo
El resultado se redondea hacia arriba porque una fracción de GPU adicional requiere otra GPU completa bajo este modelo.

VRAM requerida = ejecuciones × VRAM por ejecución × (1 + sobrecarga / 100)
GPU necesarias = techo(VRAM requerida / VRAM utilizable por GPU)

Variables:

  • ejecuciones: número de sesiones concurrentes
  • VRAM por ejecución: GB incrementales por sesión
  • sobrecarga: porcentaje adicional de memoria
  • VRAM utilizable por GPU: GB que pueden destinarse a la carga en cada GPU

Supuesto: El modelo supone que la VRAM escala aproximadamente con la concurrencia y que la memoria indicada puede repartirse entre GPU. No modela restricciones de particionado o comunicación.

Qué significa el resultado

El resultado es una estimación operativa basada en los valores introducidos. Úsalo para comparar escenarios y dimensionar capacidad, no como sustituto de mediciones en producción.

Si la carga tiene mucha variabilidad, repite el cálculo con valores medios y conservadores para entender el rango posible.

Datos:

  • 24 ejecuciones concurrentes
  • 1,6 GB incrementales por ejecución
  • 20 % de sobrecarga
  • 48 GB utilizables por GPU

Cálculo:
VRAM requerida = 24 × 1,6 × 1,20 = 46,08 GB. GPU equivalentes = 46,08 / 48 = 0,96. Al redondear hacia arriba, se necesita 1 GPU.

Resultado: 1 GPU

Interpretación: La capacidad de 48 GB cubre los 46,08 GB estimados y deja 1,92 GB de margen según este modelo simplificado.

¿Debo incluir el tamaño completo del modelo en la VRAM por ejecución?

No si los pesos se cargan una sola vez y se comparten entre ejecuciones. Incluye únicamente la parte que realmente crece por sesión, o adapta el cálculo sumando por separado la memoria base.

¿Qué valor uso para la VRAM utilizable?

Usa una cifra inferior a la memoria física si el sistema, el runtime o la estrategia de despliegue necesitan reservar espacio. Lo importante es que represente la memoria realmente disponible para esta carga.

¿El resultado sirve para modelos repartidos entre varias GPU?

Solo como aproximación de memoria total. El paralelismo tensorial o de pipeline impone restricciones adicionales que esta suma de VRAM no captura.

¿Cómo afecta una longitud de contexto mayor?

Normalmente aumenta la memoria asociada a cachés y activaciones. Si tu VRAM por ejecución se midió con contextos cortos, vuelve a medirla con el contexto previsto.

¿Por qué se redondea siempre hacia arriba?

Porque el cálculo devuelve capacidad física completa. Si la necesidad es 1,2 GPU, en un despliegue dedicado necesitarías al menos 2 unidades para disponer de memoria suficiente.