#745 · Rechner für KI & Technologie

RAG-Tokenbudget-Rechner

Plane das Tokenbudget für Retrieval-Augmented-Generation-Anfragen. Gib Kontextfenster, System- und Nutzerprompt, gewünschte Antwortlänge, Anzahl abgerufener Chunks und Tokens je Chunk ein. Der Rechner zeigt verfügbares Retrieval-Budget, genutzte Tokens und die maximal passende Chunk-Anzahl.

Rechner

Eingaben
Tokens
Tokens
Tokens
Tokens
Tokens

So verwendest du diesen Rechner

  1. Trage deine aktuellen Werte in die Eingabefelder ein.
  2. Prüfe, dass alle Werte denselben Zeitraum und dieselben Einheiten verwenden.
  3. Klicke auf Berechnen und prüfe Haupt- sowie Nebenresultate.
  4. Ändere einzelne Annahmen, um alternative Szenarien zu vergleichen.

Formel

Retrieval-Budget = Kontextfenster − Systemtokens − Nutzertokens − reservierte Antworttokens. Max. Chunks = floor(Retrieval-Budget ÷ Tokens je Chunk).

Was das Ergebnis bedeutet

Das verfügbare Retrieval-Budget ist der Teil des Kontextfensters, der nach festen Prompt- und Antwortanteilen für abgerufene Dokumentsegmente verbleibt.

Tokenisierung unterscheidet sich je Modell und Sprache. Verwende möglichst gemessene Tokenzahlen aus deinem tatsächlichen Stack.

Beispielrechnung

Bei 128.000 Tokens Kontext, 1.200 Systemtokens, 1.800 Nutzertokens und 3.000 Antworttokens bleiben 122.000 Tokens für Retrieval. Bei 700 Tokens je Chunk passen maximal 174 Chunks.

Tipps für bessere Ergebnisse

  • Reserviere Antworttokens vor dem Retrieval.
  • Nutze reale Tokenmessungen statt Zeichen-Schätzungen.
  • Begrenze Chunks nach Relevanz und nicht nur nach Kapazität.
  • Plane zusätzlichen Puffer für Metadaten und Formatierung ein.

Häufig gestellte Fragen

Wie berechne ich das RAG-Tokenbudget für abgerufene Dokumente?

Ziehe Systemprompt, Nutzerverlauf und die reservierte Antwortlänge vom Kontextfenster des Modells ab.

Wie viele RAG-Chunks passen in ein 128k-Kontextfenster?

Das hängt von Prompt-, Verlaufs- und Antworttokens sowie der durchschnittlichen Chunkgröße ab; der Rechner bestimmt die maximale Anzahl aus diesen Werten.

Soll ich für die RAG-Antwort Tokens reservieren?

Ja. Ohne Antwortreserve kann der Retrieval-Kontext das Fenster so weit füllen, dass nicht genügend Platz für die generierte Antwort bleibt.

Warum stimmen Zeichen und Tokens bei RAG nicht überein?

Tokenisierung zerlegt Text modellabhängig; Wörter, Satzzeichen und unterschiedliche Sprachen können verschieden viele Tokens erzeugen.

Was passiert, wenn mein Retrieval das Kontextfenster überschreitet?

Dann müssen Chunks reduziert, gekürzt oder priorisiert werden, damit Prompt, Retrieval und Antwort gemeinsam in das Modellfenster passen.

Kennzahlen im Überblick

KennzahlNutzen
Verfügbares Retrieval-BudgetWird direkt aus deinen Eingaben berechnet und unterstützt die Ergebnisinterpretation.
Retrieval-TokensWird direkt aus deinen Eingaben berechnet und unterstützt die Ergebnisinterpretation.
Freie TokensWird direkt aus deinen Eingaben berechnet und unterstützt die Ergebnisinterpretation.
Maximal passende ChunksWird direkt aus deinen Eingaben berechnet und unterstützt die Ergebnisinterpretation.

Rechner-Kategorien entdecken

22 Kategorien