#470 · Rechner für KI & Technologie

OpenAI-RAG-Rechner

Der OpenAI-RAG-Rechner kombiniert die wichtigsten variablen Kosten eines Retrieval-Augmented-Generation-Workflows: Retrieval-Kontext im Prompt, Antworttokens und optionale Embedding-Updates. Du legst Abfragevolumen, Chunks pro Abfrage, Tokenmengen und deine aktuellen Preise selbst fest. So kannst du Kontextbreite gegen Kosten abwägen.

Rechner

Eigene Annahmen
Abfragen
Chunks
Tokens
Tokens
Tokens
€/1 Mio.
€/1 Mio.
Tokens
€/1 Mio.

So verwendest du diesen Rechner

  1. Erfasse Abfragevolumen sowie Chunks und Tokens je Chunk.
  2. Gib zusätzliche Prompttokens und geplante Ausgabetokens an.
  3. Trage aktuelle Ein-, Ausgabe- und Embedding-Preise ein.
  4. Füge neu einzubettende Tokens für Aktualisierungen hinzu.

Formel

Retrieval-Tokens = Chunks × Tokens je Chunk; Generierungskosten = Abfragen × [(Retrieval + sonstige Eingabe) × Eingabepreis + Ausgabe × Ausgabepreis] je 1 Mio.; Gesamtkosten = Generierung + Embedding

Was das Ergebnis bedeutet

Das Hauptergebnis zeigt die kombinierten variablen Kosten. Der Retrieval-Tokenwert macht sichtbar, wie stark eine größere Top-k-Auswahl die Promptkosten erhöht.

Vektordatenbank, Suche, Reranking, Speicher, Netzwerk und Infrastruktur sind nicht automatisch enthalten.

Beispielrechnung

100.000 Abfragen mit fünf Chunks à 300 Tokens erzeugen 1.500 Retrieval-Tokens je Abfrage. Zusammen mit 500 weiteren Eingabe- und 250 Ausgabetokens ergeben sich bei 2,50/10,00 € rund 750,00 € Generierungskosten. 5 Mio. neu eingebettete Tokens zu 0,10 € je Million erhöhen die Summe um 0,50 € auf etwa 750,50 €.

Tipps für bessere Ergebnisse

  • Teste, ob weniger Chunks dieselbe Antwortqualität erreichen.
  • Kürze Chunks auf relevante Passage statt ganze Dokumentteile.
  • Trenne Erstindexierung und laufende Updates bei Embeddings.
  • Miss Retrieval-Qualität gemeinsam mit Kosten, nicht isoliert.

Häufig gestellte Fragen

Wie beeinflusst die Anzahl der RAG-Chunks meine OpenAI-Kosten?

Mehr Chunks erhöhen die Retrieval-Tokens im Prompt. Bei sonst gleichen Bedingungen steigen damit die Eingabekosten je Abfrage.

Wie berechne ich Retrieval-Tokens pro RAG-Abfrage?

Multipliziere die Zahl der abgerufenen Chunks mit der durchschnittlichen Tokenmenge je Chunk.

Soll ich Embedding-Kosten bei jeder RAG-Abfrage einrechnen?

Normalerweise werden Dokument-Embeddings beim Indexieren oder Aktualisieren erzeugt. Deshalb erfasst der Rechner neu eingebettete Tokens separat von den laufenden Abfragen.

Wie kann ich RAG-Kosten senken, ohne die Antwortqualität stark zu verschlechtern?

Teste weniger oder kürzere Chunks, bessere Retrieval-Filter und gegebenenfalls Reranking. Entscheidend ist ein eigener Qualitätsvergleich.

Welche RAG-Kosten fehlen in diesem Rechner?

Nicht automatisch enthalten sind beispielsweise Vektordatenbank, Suchinfrastruktur, Reranking, Speicher, Netzwerk und operative Plattformkosten.

Berechnungsübersicht

BausteinVerwendung
EingabenDeine Nutzungs- und Preisannahmen
BerechnungThemenspezifische Mengen- und Kostenlogik
AusgabeHauptergebnis plus Planungskennzahlen

Rechner-Kategorien entdecken

22 Kategorien