Formel
Erforderliche Tokenrate = Dokumente/h × Tokens/Dokument ÷ 3.600
Nutzbare GPU-Leistung = gemessene Token/s × Zielauslastung
GPU-Anzahl = Aufrunden[(erforderliche Tokenrate ÷ nutzbare GPU-Leistung) × (1 + Redundanz)]
Was das Ergebnis bedeutet
Die GPU-Anzahl ist eine Kapazitätsschätzung auf Basis gemessener Tokenleistung. Sie ersetzt keinen Benchmark mit dem konkreten Modell, Quantisierungsgrad, Batch-Setup und Dokumentmix.
GPU-Tokenraten sind stark modell- und hardwareabhängig. Verwende eigene Lasttests statt Hersteller-Spitzenwerte, wenn Produktionsplanung oder Beschaffung davon abhängen.