Formel
Requests/s = gleichzeitige Sitzungen × Turns/Min. ÷ 60
Effektive Worker-Kapazität = 1.000 ÷ Servicezeit(ms) × Zielauslastung
Erforderliche Worker = aufrunden(Requests/s ÷ Worker-Kapazität)
Restliches Latenzbudget = Ziel-Latenz − Servicezeit
Was das Ergebnis bedeutet
Die Worker-Zahl ist eine Kapazitätsschätzung unter der Annahme, dass Anfragen gleichmäßig verteilt werden und die angegebene Servicezeit repräsentativ ist. Das restliche Latenzbudget zeigt, wie viel Zeit für Netzwerk, Queueing, Speech-to-Text, Text-to-Speech und Orchestrierung verbleibt.
Reale Warteschlangen verhalten sich bei Spitzenlast und schwankenden Servicezeiten komplexer. Validieren solltest du die Planung mit Lasttests und Perzentil-Latenzen wie p95 oder p99.