Formel
Nutzbare Tokenkapazität = GPUs × Tokens/s je GPU × Auslastung
Aufgaben/s = nutzbare Tokenkapazität / (Ø Eingabe-Tokens + Ø Ausgabe-Tokens)
Was das Ergebnis bedeutet
Das Hauptergebnis übersetzt eine Tokenrate in Aufgaben pro Sekunde. Es ist besonders nützlich, wenn deine Serving-Benchmarks Token-Durchsatz liefern, das Produktteam aber mit Requests oder Aufgaben plant.
Die Rechnung setzt einen durchschnittlichen Tokenverbrauch je Aufgabe voraus. Starke Streuung in Prompt- oder Ausgabelängen kann die reale Queueing- und Latenzsituation verändern.