#683 · Herramienta de IA y tecnología

Calculadora de GPU necesarias para inferencia LLM

Estima el número de GPU requerido para servir un modelo de lenguaje según el tamaño de los pesos, la precisión, la memoria adicional y la demanda de inferencia. Combina una restricción de memoria con otra de caudal y devuelve el mayor requisito, para evitar un dimensionamiento que quepa en memoria pero no soporte el tráfico esperado.

Calculadora

Modelo, memoria y carga
mil M
Tamaño nominal del modelo en miles de millones.
bits
Bits por parámetro después de cuantización.
%
KV cache, buffers, runtime y fragmentación.
GB
Memoria efectiva disponible, no solo la nominal.
sol./s
Caudal agregado que debe soportar el sistema.
sol./s
Rendimiento sostenible medido con tu carga.

Cómo usar esta calculadora

  1. Introduce valores representativos de tu carga real.
  2. Revisa unidades, tarifas y porcentajes antes de calcular.
  3. Pulsa «Calcular» para actualizar el resultado y las métricas secundarias.
  4. Compara el resultado con tu límite, plazo o presupuesto y ajusta los supuestos.

Fórmula

Memoria = parámetros (mil millones) × bits ÷ 8 × (1 + sobrecarga)

GPU requeridas = máximo entre techo(memoria ÷ memoria por GPU) y techo(demanda ÷ caudal por GPU).

Qué significa el resultado

El resultado integra dos cuellos de botella. El requisito de memoria garantiza que pesos y reserva entren; el de caudal garantiza que el conjunto pueda procesar la tasa objetivo.

No sustituye una prueba del runtime. Paralelismo tensorial, duplicación de pesos, longitud de contexto y tamaño de lote pueden cambiar la memoria efectiva y el rendimiento.

Ejemplo de cálculo

Un modelo de 70 mil millones de parámetros a 16 bits ocupa unos 140 GB de pesos. Con 25 % de sobrecarga son 175 GB: 3 GPU de 72 GB. Si la demanda es 12 solicitudes/s y cada GPU sostiene 3,5, el caudal exige 4 GPU; por tanto, el resultado es 4.

Consejos para obtener mejores resultados

  • Introduce memoria utilizable después de reservar espacio al sistema.
  • Mide el caudal con la misma longitud de contexto y salida.
  • Añade redundancia fuera del resultado mínimo si necesitas alta disponibilidad.
  • Comprueba si el runtime replica o fragmenta la KV cache.
  • Repite el cálculo al cambiar cuantización o tamaño de lote.

Preguntas frecuentes

¿La memoria de los pesos se calcula en GB decimales?

Sí, la estimación usa gigabytes decimales para una comparación sencilla. El runtime puede informar GiB y producir una pequeña diferencia.

¿Por qué una cuantización menor reduce las GPU por memoria?

Porque cada parámetro ocupa menos bits, aunque puede existir metadato adicional y no todo el ahorro teórico se materializa.

¿La calculadora contempla paralelismo tensorial?

No de forma explícita. El número mínimo indica capacidad agregada; debes validar que la topología y el runtime soporten el reparto elegido.

¿Qué caudal por GPU debo introducir?

Usa un valor sostenible obtenido con el modelo, la precisión, el contexto, el lote y el hardware que planeas desplegar.

¿Debo añadir GPU de reserva?

Sí cuando necesites tolerancia a fallos, mantenimiento sin interrupción o margen para picos; la cifra mostrada es un mínimo técnico.

Resumen de variables

ElementoUso
EntradasDefinen la carga y la capacidad disponible.
Resultado principalResume la decisión operativa más importante.
Métricas secundariasAyudan a comprobar margen, volumen y eficiencia.

Explora las categorías de calculadoras

22 categorías