Fórmula
Memoria = parámetros (mil millones) × bits ÷ 8 × (1 + sobrecarga)
GPU requeridas = máximo entre techo(memoria ÷ memoria por GPU) y techo(demanda ÷ caudal por GPU).
Qué significa el resultado
El resultado integra dos cuellos de botella. El requisito de memoria garantiza que pesos y reserva entren; el de caudal garantiza que el conjunto pueda procesar la tasa objetivo.
No sustituye una prueba del runtime. Paralelismo tensorial, duplicación de pesos, longitud de contexto y tamaño de lote pueden cambiar la memoria efectiva y el rendimiento.