Formel
Nutzbarer Durchsatz je GPU = gemessener Durchsatz × Effizienz
Produktive GPUs = Aufrunden(Zieldurchsatz / nutzbarer GPU-Durchsatz)
Gesamt-GPUs = produktive GPUs + Redundanz
Was das Ergebnis bedeutet
Die Hauptzahl enthält sowohl die für die Ziel-Tokenrate benötigten GPUs als auch die manuell definierte Redundanz. Der Rechner setzt voraus, dass der gemessene Durchsatz pro GPU bei deiner Modell- und Serving-Konfiguration repräsentativ ist.
Speicherbedarf, Modellparallelismus, Interconnect und Batch-Latenz sind nicht automatisch aus der Tokenrate ableitbar und müssen separat validiert werden.