Formel
L̄ = Trefferquote × Latenz Treffer + (1 − Trefferquote) × Latenz Miss
Kapazität = Parallelität × 1.000 / L̄
Was das Ergebnis bedeutet
Die Hauptzahl ist die theoretische Aufgabenrate unter der angegebenen Parallelität. Sie ist eine Kapazitätsschätzung und keine Garantie für reale Produktionslast, da Netzwerk, Queueing, Ausgabe-Tokens und Provider-Limits zusätzlich wirken.
Prompt Caching beschleunigt typischerweise nur wiederverwendbare Prompt-Anteile. Die gemessene End-to-End-Latenz sollte daher aus deiner realen Umgebung stammen.