Formel
Basis-Latenz = Retrieval + Generierung + Overhead
Sichere Parallelität = geplante Parallelität × (Ziel-Latenz × (1 − Reserve)) ÷ Basis-Latenz
Was das Ergebnis bedeutet
Die sichere Parallelität ist eine Kapazitätsschätzung unter deinem Latenzziel. Werte über der geplanten Last bedeuten Reserve; niedrigere Werte weisen auf ein wahrscheinliches Latenzproblem hin.
Die Rechnung bildet Warteschlangen, Cache-Treffer, Netzwerkspitzen und Modell-Batching nicht vollständig ab. Nutze Messwerte aus deiner eigenen Produktionsumgebung.