#926 · Rechner für KI & Technologie

KI-Sprachagent: Durchsatzrechner

Der Durchsatzrechner schätzt, wie viele vollständige Sprachagent-Gespräche ein Inferenz-Cluster pro Stunde verarbeiten kann. Er verbindet GPU-Anzahl und effektiven Request-Durchsatz mit der durchschnittlichen Gesprächsdauer und den Inferenzanfragen pro Gesprächsminute. Zusätzlich zeigt er die unterstützbare Gleichzeitigkeit und die Gesamt-Request-Kapazität. So kannst du prüfen, ob ein Cluster zu deinem erwarteten Gesprächsvolumen passt.

Rechner

Eingaben
Req./s
Req./Min.
Min.

So verwendest du diesen Rechner

  1. Trage die Zahl der verfügbaren GPUs oder Worker ein.
  2. Nutze deren effektiven, bereits konservativen Request-Durchsatz.
  3. Gib die Inferenzanfragen je Gesprächsminute und die mittlere Gesprächsdauer an.
  4. Vergleiche Gespräche pro Stunde und Gleichzeitigkeit mit deiner Lastprognose.

Formel

Cluster-Req./s = Anzahl Einheiten × effektive Req./s je Einheit
Requests/Gespräch = Requests/Min. × Gesprächsminuten
Gespräche/Stunde = Cluster-Req./s × 3.600 ÷ Requests/Gespräch
Gleichzeitige Gespräche = Cluster-Req./s × 60 ÷ Requests/Min.

Was das Ergebnis bedeutet

Der maximale rechnerische Durchsatz setzt voraus, dass der verfügbare Request-Durchsatz vollständig für die betrachteten Gespräche genutzt werden kann. Die unterstützte Gleichzeitigkeit ist eine Kapazitätsgröße und kein Garant für ein bestimmtes Latenz-Perzentil.

Berücksichtige für Produktionsplanung zusätzlich Sicherheitsreserve, Lastspitzen, Fehlversuche, Audioverarbeitung und gewünschte Latenz.

Beispielrechnung

4 Einheiten × 12,6 Req./s = 50,4 Req./s
7,2 Req./Min. × 4,5 Min. = 32,4 Requests/Gespräch
50,4 × 3.600 ÷ 32,4 = 5.600 Gespräche/Stunde
Gleichzeitigkeit: 50,4 × 60 ÷ 7,2 = 420 Gespräche.

Tipps für bessere Ergebnisse

  • Nutze effektiven statt theoretischen Spitzen-Durchsatz.
  • Plane Retries und Tool-Aufrufe in der Request-Rate pro Minute ein.
  • Prüfe den Durchsatz zusätzlich unter deinem p95-Latenzziel.
  • Segmentiere Anruftypen, wenn kurze und lange Gespräche stark unterschiedliche Request-Muster haben.

Häufig gestellte Fragen

Wie berechne ich Gespräche pro Stunde aus GPU-Requests pro Sekunde?

Multipliziere die Cluster-Requests pro Sekunde mit 3.600 und teile durch die durchschnittlichen Requests je vollständigem Gespräch.

Was bedeutet unterstützte Gleichzeitigkeit bei einem KI-Sprachagenten?

Sie schätzt, wie viele Gespräche bei der eingegebenen Request-Rate gleichzeitig bedient werden könnten.

Warum kann hoher Request-Durchsatz trotzdem zu schlechter Sprachlatenz führen?

Durchsatz und Latenz sind unterschiedliche Größen. Queueing, lange Einzelanfragen oder Audio-Pipelines können die Antwortzeit trotz hoher Gesamtkapazität erhöhen.

Soll ich Tool-Aufrufe in Requests pro Gesprächsminute einbeziehen?

Ja, wenn diese Aufrufe die gleiche limitierende Inferenz- oder Worker-Kapazität beanspruchen.

Wie vergleiche ich den berechneten Voice-Agent-Durchsatz mit meinem Peak-Volumen?

Vergleiche Gespräche pro Stunde und unterstützte Gleichzeitigkeit mit deinen erwarteten Spitzenwerten und behalte eine zusätzliche Betriebsreserve.

Kennzahlen im Überblick

KennzahlBedeutung
Gespräche/StundeRechnerischer vollständiger Gesprächsdurchsatz.
Cluster-Req./sSumme des effektiven Durchsatzes aller Einheiten.
GleichzeitigkeitRechnerisch unterstützbare parallele Gespräche.
Requests/GesprächDurchschnittliche Inferenzanfragen je vollständigem Gespräch.

Rechner-Kategorien entdecken

22 Kategorien