Formel
Gesamtlast = gleichzeitige Gespräche × Inferenzanfragen je Gespräch und Sekunde
Planlast = Gesamtlast × (1 + Reserve/100)
Effektive GPU-Kapazität = gemessene Req./s × Zielauslastung
GPU-Bedarf = aufrunden(Planlast ÷ effektive GPU-Kapazität)
Was das Ergebnis bedeutet
Die berechnete GPU-Zahl ist eine Kapazitätsgröße auf Basis deines eigenen Benchmarks. Sie berücksichtigt bewusst eine Zielauslastung und zusätzliche Reserve, damit eine GPU nicht dauerhaft an ihrem theoretischen Maximum betrieben werden muss.
GPU-Durchsatz hängt von Modell, Quantisierung, Batch-Größe, Sequenzlänge, Hardware, Runtime und Latenzziel ab. Verwende einen Benchmark, der deinem produktiven Setup möglichst nahekommt.