Formel
Tokenbedarf/s = Anfragen/s × Token je Antwort
Effektive GPU-Leistung = GPU-Token/s × Zielauslastung
GPU-Anzahl = Aufrunden((Tokenbedarf ÷ effektive Leistung) × Redundanzfaktor)
Was das Ergebnis bedeutet
Die Hauptzahl ist die minimale ganzzahlige GPU-Anzahl unter deinen Annahmen. Die Reserve zeigt, wie viel zusätzliche effektive Tokenkapazität nach der Rundung verbleibt.
Retrieval selbst kann CPU-, RAM- oder separate GPU-Ressourcen benötigen. Dieser Rechner dimensioniert primär die Generierungsseite.