Formel
Ungecachte Promptlast = cachefähige + variable Token
Cache-Trefferlast = cachefähige Token × verbleibender Anteil + variable Token
Erwartete Promptlast = ungecacht × (1 − Trefferquote) + Cache-Trefferlast × Trefferquote
Was das Ergebnis bedeutet
Die gesparten Token zeigen die erwartete Reduktion gegenüber einer vollständig ungecachten Promptverarbeitung. Der Kontextspielraum berücksichtigt zusätzlich deine Antwortreserve.
Caching-Regeln und Abrechnungsmodelle unterscheiden sich je Plattform. Der „verbleibende Tokenlast“-Anteil ist deshalb bewusst als Eingabewert modelliert.