#791 · Rechner für KI & Technologie

Prompt-Caching-Latenzkapazitätsrechner

Dieser Rechner schätzt, wie stark Prompt Caching die effektive Antwortlatenz und die Verarbeitungskapazität eines KI-Dienstes verbessert. Du gibst die Latenz ohne Cache, die Latenz bei einem Cache-Treffer, die Trefferquote und die verfügbare Parallelität an. Daraus entstehen eine gewichtete Durchschnittslatenz, eine theoretische Aufgabenrate und der Kapazitätsgewinn gegenüber einer vollständig ungecacheten Verarbeitung.

Rechner

Eingaben
ms
End-to-End-Latenz bei einem Cache-Miss.
ms
End-to-End-Latenz bei wiederverwendetem Prompt-Präfix.
%
Anteil der Anfragen, bei denen der relevante Prompt-Teil aus dem Cache kommt.
Slots
Gleichzeitig bearbeitbare Anfragen oder Worker-Slots.

So verwendest du diesen Rechner

  1. Trage gemessene oder realistisch geplante Ausgangswerte ein.
  2. Prüfe Einheiten, Preise und Prozentwerte sorgfältig.
  3. Klicke auf „Berechnen“ und lies Hauptwert sowie Nebenkennzahlen gemeinsam.
  4. Verändere einen Parameter nach dem anderen, um Szenarien sauber zu vergleichen.

Formel

L̄ = Trefferquote × Latenz Treffer + (1 − Trefferquote) × Latenz Miss

Kapazität = Parallelität × 1.000 / L̄

Was das Ergebnis bedeutet

Die Hauptzahl ist die theoretische Aufgabenrate unter der angegebenen Parallelität. Sie ist eine Kapazitätsschätzung und keine Garantie für reale Produktionslast, da Netzwerk, Queueing, Ausgabe-Tokens und Provider-Limits zusätzlich wirken.

Prompt Caching beschleunigt typischerweise nur wiederverwendbare Prompt-Anteile. Die gemessene End-to-End-Latenz sollte daher aus deiner realen Umgebung stammen.

Beispielrechnung

Beispiel: 900 ms ohne Cache, 250 ms bei Treffer, 70 % Trefferquote und 20 parallele Slots. Die gewichtete Latenz beträgt 445 ms. Daraus ergeben sich rund 44,94 Aufgaben/s statt 22,22 Aufgaben/s ohne Cache.

Tipps für bessere Ergebnisse

  • Messe Treffer- und Miss-Latenz getrennt unter vergleichbarer Last.
  • Beobachte die Trefferquote über mehrere typische Prompt-Muster.
  • Trenne Prompt-Verarbeitung von Ausgabe-Generierung, wenn dein Anbieter entsprechende Messwerte liefert.
  • Plane Reserve für Lastspitzen und Queueing ein.

Häufig gestellte Fragen

Wie beeinflusst eine Cache-Trefferquote von 80 % die mittlere Prompt-Latenz?

Der Rechner gewichtet die Treffer- und Miss-Latenz mit 80 % beziehungsweise 20 % und leitet daraus die mittlere Latenz ab.

Warum steigt die reale Anfragerate nicht immer so stark wie die berechnete Cache-Kapazität?

Netzwerkzeiten, Ausgabe-Generierung, Rate-Limits, Warteschlangen und andere Engpässe können den theoretischen Kapazitätsgewinn begrenzen.

Welche Latenz soll ich für einen Prompt-Cache-Treffer eintragen?

Verwende möglichst eine gemessene End-to-End-Latenz für Anfragen, bei denen das relevante Prompt-Präfix tatsächlich aus dem Cache bedient wurde.

Kann ich mit dem Rechner unterschiedliche Parallelitätsstufen vergleichen?

Ja. Ändere die Parallelität und vergleiche die resultierende Aufgabenrate, solange die zugrunde liegenden Latenzen unter dieser Last realistisch bleiben.

Was passiert bei einer Prompt-Cache-Trefferquote von 0 %?

Dann entspricht die gewichtete Latenz vollständig der Miss-Latenz und es entsteht kein rechnerischer Kapazitätsgewinn durch Caching.

Kapazitätskennzahlen

KennzahlBedeutung
Gewichtete LatenzMittlere End-to-End-Latenz aus Treffern und Misses
Aufgaben/sTheoretische Rate bei gegebener Parallelität
KapazitätsgewinnRelative Steigerung gegenüber 0 % Cache-Treffern

Rechner-Kategorien entdecken

22 Kategorien