#799 · Rechner für KI & Technologie

Fine-Tuning-Durchsatzrechner

Dieser Rechner wandelt den gemessenen Token-Durchsatz eines feinabgestimmten Modells in eine für Produktplanung verständliche Aufgabenrate um. Aus GPU-Anzahl, Token-Durchsatz je GPU, nutzbarer Auslastung sowie durchschnittlichen Eingabe- und Ausgabe-Tokens je Aufgabe entstehen eine maximale Aufgabenrate, die gesamte Tokenkapazität und die ungefähre benötigte Parallelität für ein vorgegebenes Lastziel.

Rechner

Eingaben
GPUs
Tokens/s
%
Tokens
Tokens
Aufgaben/s

So verwendest du diesen Rechner

  1. Trage gemessene oder realistisch geplante Ausgangswerte ein.
  2. Prüfe Einheiten, Preise und Prozentwerte sorgfältig.
  3. Klicke auf „Berechnen“ und lies Hauptwert sowie Nebenkennzahlen gemeinsam.
  4. Verändere einen Parameter nach dem anderen, um Szenarien sauber zu vergleichen.

Formel

Nutzbare Tokenkapazität = GPUs × Tokens/s je GPU × Auslastung

Aufgaben/s = nutzbare Tokenkapazität / (Ø Eingabe-Tokens + Ø Ausgabe-Tokens)

Was das Ergebnis bedeutet

Das Hauptergebnis übersetzt eine Tokenrate in Aufgaben pro Sekunde. Es ist besonders nützlich, wenn deine Serving-Benchmarks Token-Durchsatz liefern, das Produktteam aber mit Requests oder Aufgaben plant.

Die Rechnung setzt einen durchschnittlichen Tokenverbrauch je Aufgabe voraus. Starke Streuung in Prompt- oder Ausgabelängen kann die reale Queueing- und Latenzsituation verändern.

Beispielrechnung

4 GPUs × 70.000 Tokens/s × 75 % ergeben 210.000 nutzbare Tokens/s. Bei 900 Eingabe- und 300 Ausgabe-Tokens je Aufgabe entspricht das 175 Aufgaben/s. Eine Zielrate von 150 Aufgaben/s nutzt rund 85,7 % dieser Kapazität.

Tipps für bessere Ergebnisse

  • Verwende Tokenlängen aus realen Produktionsanfragen.
  • Plane separate Szenarien für kurze und lange Aufgaben.
  • Nutze konservative Auslastungswerte für latenzkritische Anwendungen.
  • Validiere den errechneten Durchsatz mit einem End-to-End-Lasttest.

Häufig gestellte Fragen

Wie rechne ich GPU-Token-Durchsatz in Aufgaben pro Sekunde um?

Teile die nutzbare Tokenkapazität aller GPUs durch die durchschnittliche Summe aus Eingabe- und Ausgabe-Tokens je Aufgabe.

Welche Auslastung sollte ich für einen Fine-Tuning-Durchsatzrechner ansetzen?

Verwende eine dauerhaft realistische Auslastung aus deinen Lasttests und lasse bei latenzkritischen Systemen ausreichend Reserve unter 100 %.

Warum beeinflussen längere Ausgaben den Aufgaben-Durchsatz so stark?

Mehr Ausgabe-Tokens erhöhen die Tokenmenge pro Aufgabe und reduzieren bei unveränderter Tokenkapazität die Zahl der möglichen Aufgaben pro Sekunde.

Was bedeutet eine Zielauslastung über 100 % im Ergebnis?

Die geplante Aufgabenrate ist höher als die berechnete nutzbare Kapazität und kann ohne zusätzliche Ressourcen nicht stabil getragen werden.

Kann ich Prompt Caching im Fine-Tuning-Durchsatz berücksichtigen?

Indirekt ja, indem du die effektiv verarbeiteten Eingabe-Tokens oder einen entsprechend gemessenen GPU-Token-Durchsatz verwendest.

Durchsatzgrößen

GrößeBedeutung
TokenkapazitätNutzbare Tokens pro Sekunde über alle GPUs
Tokens je AufgabeDurchschnittliche Eingabe plus Ausgabe
AufgabenrateTokenkapazität geteilt durch Tokens je Aufgabe

Rechner-Kategorien entdecken

22 Kategorien