Formel
Effektive Tokens/s = Aufgaben/s × Prompt-Tokens × [(1 − Trefferquote) + Trefferquote × Rechenanteil bei Treffer]
GPUs = Aufrunden(Effektive Tokens/s / (GPU-Durchsatz × Zielauslastung))
Was das Ergebnis bedeutet
Die Hauptzahl ist die kleinste ganze GPU-Anzahl, die die geschätzte effektive Prompt-Last bei der gewählten Zielauslastung tragen kann. Der tatsächliche Bedarf hängt vom Modell, Batch-Verhalten, Speicherbedarf und Provider-Stack ab.
Nutze für den GPU-Durchsatz möglichst Benchmarks deines konkreten Modells und deiner Hardware. Prompt Caching kann Rechenarbeit reduzieren, beseitigt aber nicht jede Verarbeitung.