#688 · Herramienta de IA y tecnología

Calculadora de GPU necesarias para procesamiento por lotes LLM

Dimensiona GPU para completar un lote LLM dentro de un plazo. A partir de registros, tokens por registro, rendimiento por GPU, horas disponibles, utilización y reserva de capacidad, calcula el mínimo de aceleradores, las GPU-hora requeridas y la duración con la configuración seleccionada.

Calculadora

Carga de tokens, plazo y capacidad GPU
registros
Cantidad total que debe procesarse.
tokens
Suma de entrada y salida por registro.
tok/s
Tasa sostenible extremo a extremo.
h
Tiempo máximo para terminar el lote.
%
Fracción de la tasa nominal aprovechada.
%
Margen adicional frente a fallos y variación.

Cómo usar esta calculadora

  1. Introduce valores representativos de tu carga real.
  2. Revisa unidades, tarifas y porcentajes antes de calcular.
  3. Pulsa «Calcular» para actualizar el resultado y las métricas secundarias.
  4. Compara el resultado con tu límite, plazo o presupuesto y ajusta los supuestos.

Fórmula

GPU-hora = tokens totales ÷ rendimiento efectivo por GPU ÷ 3.600

GPU = techo(GPU-hora ÷ plazo), donde el rendimiento efectivo aplica utilización y reserva.

Qué significa el resultado

Las GPU-hora cuantifican el trabajo agregado. Dividirlas por el plazo convierte ese volumen en aceleradores paralelos mínimos bajo las eficiencias introducidas.

La fórmula supone escalado lineal. Comunicación, lectura de datos, límites de I/O y paralelismo del modelo pueden reducir la eficiencia al añadir GPU.

Ejemplo de cálculo

Diez millones de registros a 900 tokens suman 9.000 millones de tokens. Una GPU a 2.500 tok/s, 80 % de utilización y 15 % de reserva entrega 1.700 tok/s efectivos: 1.470,59 GPU-hora. Para 24 horas se necesitan 62 GPU.

Consejos para obtener mejores resultados

  • Usa rendimiento extremo a extremo con lectura y escritura.
  • Evita asumir escalado perfecto en clústeres grandes.
  • Incluye reserva para nodos fallidos o lotes atípicos.
  • Comprueba que el modelo cabe en cada grupo de GPU.
  • Divide el trabajo si existe un límite de concurrencia.

Preguntas frecuentes

¿GPU-hora significa una GPU durante una hora?

Sí. Es una unidad de trabajo agregado; diez GPU-hora pueden ser una GPU durante diez horas o diez GPU durante una hora, si el escalado fuese lineal.

¿La reserva aumenta el número de GPU?

Sí, reduce el rendimiento utilizable por GPU para dejar capacidad frente a variaciones, fallos o trabajo adicional.

¿Cómo incluyo varias pasadas por registro?

Multiplica los tokens por registro por el número de pasadas o calcula cada etapa por separado.

¿Qué ocurre si el modelo necesita varias GPU por réplica?

Redondea el resultado a un múltiplo del tamaño de la réplica y valida el paralelismo del runtime.

¿El cálculo incluye tiempo de carga del modelo?

No de forma separada. Redúcelo del plazo disponible o incorpóralo mediante una utilización efectiva menor.

Resumen de variables

ElementoUso
EntradasDefinen la carga y la capacidad disponible.
Resultado principalResume la decisión operativa más importante.
Métricas secundariasAyudan a comprobar margen, volumen y eficiencia.

Explora las categorías de calculadoras

22 categorías