Formel
Benötigte Tokens/s = Anfragen/s × (Eingabetokens + Ausgabetokens)
Nutzbare Tokens/s je GPU = GPU-Durchsatz × Zielauslastung
GPU-Bedarf = Aufrunden((Benötigte Tokens/s ÷ Nutzbare Tokens/s je GPU) × (1 + Redundanz))
Was das Ergebnis bedeutet
Das Hauptresultat ist die ganzzahlige GPU-Anzahl inklusive Redundanz. Der Basiswert zeigt, wie viele GPUs ohne zusätzlichen Ausfall- oder Wachstumspuffer nötig wären.
Die Formel verwendet einen effektiven, gemessenen Durchsatz je GPU. Speicherbedarf, Modellreplikation, Tensor-Parallelität und Multi-GPU-Abhängigkeiten müssen zusätzlich geprüft werden.