#925 · Rechner für KI & Technologie

KI-Sprachagent: GPU-Bedarfsrechner

Dieser Rechner schätzt die Anzahl benötigter GPUs für einen KI-Sprachagenten aus gleichzeitigen Gesprächen, Inferenzanfragen pro Gespräch, gemessener GPU-Kapazität, Zielauslastung und zusätzlicher Reserve. Er eignet sich für erste Self-Hosting- und Skalierungsplanungen, weil er Last und nutzbare Kapazität explizit trennt. Das Ergebnis zeigt GPU-Anzahl, erwartete Gesamtlast, effektive Kapazität je GPU sowie die verbleibende Reserve nach Aufrundung.

Rechner

Eingaben
Req./s
Req./s
%
%

So verwendest du diesen Rechner

  1. Ermittle die maximale Zahl gleichzeitiger Gespräche.
  2. Miss, wie viele Inferenzanfragen ein Gespräch pro Sekunde erzeugt.
  3. Benchmarke die GPU mit deinem Modell und Latenzziel.
  4. Setze Zielauslastung und Reserve und berechne die benötigte GPU-Anzahl.

Formel

Gesamtlast = gleichzeitige Gespräche × Inferenzanfragen je Gespräch und Sekunde
Planlast = Gesamtlast × (1 + Reserve/100)
Effektive GPU-Kapazität = gemessene Req./s × Zielauslastung
GPU-Bedarf = aufrunden(Planlast ÷ effektive GPU-Kapazität)

Was das Ergebnis bedeutet

Die berechnete GPU-Zahl ist eine Kapazitätsgröße auf Basis deines eigenen Benchmarks. Sie berücksichtigt bewusst eine Zielauslastung und zusätzliche Reserve, damit eine GPU nicht dauerhaft an ihrem theoretischen Maximum betrieben werden muss.

GPU-Durchsatz hängt von Modell, Quantisierung, Batch-Größe, Sequenzlänge, Hardware, Runtime und Latenzziel ab. Verwende einen Benchmark, der deinem produktiven Setup möglichst nahekommt.

Beispielrechnung

300 Gespräche × 0,12 Req./s = 36 Req./s Grundlast
Mit 20 % Reserve: 43,2 Req./s Planlast
18 Req./s × 70 % = 12,6 Req./s effektive Kapazität je GPU
43,2/12,6 = 3,43 → 4 GPUs.

Tipps für bessere Ergebnisse

  • Benchmarke auf derselben Modellversion und Runtime wie in Produktion.
  • Plane Failover oder Wartung zusätzlich, wenn N+1-Redundanz erforderlich ist.
  • Verwende Spitzenlast statt Tagesdurchschnitt für Echtzeit-Sprache.
  • Überprüfe, ob Batch-Größe den Durchsatz erhöht, ohne die Latenz unzulässig zu verschlechtern.

Häufig gestellte Fragen

Wie benchmarke ich die GPU-Kapazität für einen KI-Sprachagenten?

Miss den nachhaltigen Request-Durchsatz mit deinem Modell, deiner Sequenzlänge und einem Latenzziel, das der Produktion entspricht.

Warum wird die GPU-Kapazität mit einer Zielauslastung reduziert?

Damit Reserve für Schwankungen, Queueing und System-Overhead bleibt und die Hardware nicht dauerhaft am theoretischen Maximum läuft.

Wie viel GPU-Reserve sollte ich für Voice-Agent-Spitzenlast einplanen?

Es gibt keinen universellen Wert. Nutze beobachtete Peak-to-Average-Verhältnisse und betriebliche Redundanzanforderungen.

Kann ich verschiedene GPU-Typen mit diesem Rechner vergleichen?

Ja. Setze für jeden GPU-Typ den gemessenen Durchsatz ein und vergleiche anschließend GPU-Anzahl und Kosten separat.

Berücksichtigt der Rechner N+1-Redundanz bei GPU-Ausfall?

Nur wenn du die zusätzliche Kapazität über die Reserve abbildest. Für strikte N+1-Planung solltest du nach der Berechnung gegebenenfalls eine weitere GPU hinzufügen.

Kennzahlen im Überblick

KennzahlBedeutung
GPU-BedarfAufgerundete GPU-Anzahl für die Planlast.
GesamtlastAnfragen pro Sekunde ohne zusätzliche Reserve.
Effektive Kapazität/GPUBenchmark-Durchsatz nach Zielauslastung.
HeadroomVerbleibende Kapazitätsreserve nach Aufrundung.

Rechner-Kategorien entdecken

22 Kategorien