Formel
Gesamttokens = Aufgaben × Tokens/Aufgabe
Erforderliche Tokens/s = Gesamttokens ÷ Zeitfenster in Sekunden
GPUs = Aufrunden((erforderliche Tokens/s ÷ (GPU-Durchsatz × Auslastung)) × (1 + Reserve))
Was das Ergebnis bedeutet
Das Hauptresultat ist die GPU-Anzahl, die das Batchvolumen innerhalb des angegebenen Fensters rechnerisch bewältigen kann. Die Reserve erhöht den Bedarf vor der Ganzzahlrundung.
Prüfe zusätzlich Modell-VRAM, Tensor-Parallelität, Datenzugriff und tatsächliche Batch-Effizienz. Der Rechner dimensioniert primär nach Token-Durchsatz.