#684 · Rechner für KI & Technologie

LLM-Inferenz-Durchsatz-Rechner

Ermittle, welchen nachhaltigen Inferenzdurchsatz eine vorhandene GPU-Flotte liefern kann. Aus GPU-Anzahl, effektivem Token-Durchsatz je GPU und Zielauslastung berechnet das Tool die nutzbaren Tokens pro Sekunde und übersetzt sie über die durchschnittliche Tokenmenge je Anfrage in Aufgaben pro Sekunde, Minute und Stunde.

Rechner

Vorhandene Kapazität und Aufgabenprofil
GPUs
Tokens/s
%
Tokens
Tokens

So verwendest du diesen Rechner

  1. Trage die verfügbare GPU-Anzahl ein.
  2. Nutze einen gemessenen Token-Durchsatz je GPU.
  3. Setze eine nachhaltige Auslastung.
  4. Schätze die durchschnittlichen Eingabe- und Ausgabetokens.
  5. Vergleiche Aufgaben/s, /min und /h mit deinem Nachfrageprofil.

Formel

Nutzbare Tokens/s = GPUs × Tokens/s je GPU × Auslastung
Aufgaben/s = Nutzbare Tokens/s ÷ (Eingabetokens + Ausgabetokens)

Was das Ergebnis bedeutet

Das Hauptresultat zeigt den nachhaltigen Aufgabendurchsatz der angegebenen Infrastruktur unter den gewählten Annahmen. Es ist kein Latenzversprechen für einzelne Anfragen.

Bei interaktiver Inferenz können höhere Batchgrößen den Gesamtdurchsatz steigern und gleichzeitig die Einzellatenz verändern. Miss beide Größen separat.

Beispielrechnung

Vier GPUs mit jeweils 20.000 Tokens/s liefern bei 75 % nachhaltiger Auslastung 60.000 Tokens/s. Bei 1.250 Tokens je Aufgabe entspricht das 48 Aufgaben/s, 2.880 Aufgaben/min oder 172.800 Aufgaben/h.

Tipps für bessere Ergebnisse

  • Nutze effektive Messwerte inklusive Serving-Overhead.
  • Berechne getrennte Szenarien für kurze und lange Antworten.
  • Halte die Zielauslastung unter der instabilen Sättigungszone deiner Infrastruktur.
  • Vergleiche Durchsatz mit Spitzenlast statt nur Tagesdurchschnitt.
  • Prüfe zusätzlich P95/P99-Latenz, wenn der Workload interaktiv ist.

Häufig gestellte Fragen

Wie berechne ich LLM-Aufgaben pro Sekunde aus Tokens pro Sekunde?

Teile den nachhaltigen Token-Durchsatz durch die durchschnittliche Summe aus Eingabe- und Ausgabetokens je Aufgabe.

Warum sollte ich den GPU-Spitzendurchsatz nicht direkt verwenden?

Spitzenwerte lassen oft keinen Puffer für Lastschwankungen, Queueing oder konkurrierende Systemarbeit. Eine nachhaltige Auslastung ist für Planung meist geeigneter.

Kann mehr Batching den LLM-Durchsatz erhöhen?

Ja, häufig steigt der Gesamtdurchsatz durch besseres Hardware-Ausnutzen. Die Auswirkung auf Einzellatenz muss jedoch separat gemessen werden.

Wie wirken längere LLM-Antworten auf den Aufgabendurchsatz?

Wenn die Tokenkapazität gleich bleibt, senken mehr Tokens je Aufgabe die Anzahl Aufgaben pro Sekunde näherungsweise proportional.

Ist der berechnete Durchsatz ein SLA-Wert?

Nein. Er ist eine Kapazitätsschätzung. Für SLA-Aussagen sind Lasttests mit Queueing, Latenzverteilung und realem Traffic notwendig.

Planungsübersicht

DimensionVerwendung
Primärer WertKapazitäts- oder Kostenentscheidung
SekundärwertePlausibilitätsprüfung und Skalierung
AnnahmenMit Produktionsmesswerten regelmäßig aktualisieren

Rechner-Kategorien entdecken

22 Kategorien