#685 · Rechner für KI & Technologie

LLM-Inferenz-Kosten-pro-Aufgabe-Rechner

Schätze die variablen Modellkosten einer einzelnen LLM-Inferenzaufgabe, ohne aktuelle Anbieterpreise fest zu hinterlegen. Du trägst Eingabe- und Ausgabetokens sowie deine Preise pro Million Tokens selbst ein. Zusätzlich lässt sich ein tägliches Aufgabenvolumen hinterlegen, damit aus dem Einzelpreis direkt ein Tages- und Monatsbudget entsteht.

Rechner

Tokenpreise und Aufgabenvolumen
Tokens
Tokens
Aufgaben

So verwendest du diesen Rechner

  1. Ermittle typische Eingabe- und Ausgabetokens je Aufgabe.
  2. Trage deine aktuellen Preise je Million Eingabe- und Ausgabetokens ein.
  3. Setze das erwartete tägliche Aufgabenvolumen.
  4. Vergleiche Einzel-, Tausender-, Tages- und Monatskosten.
  5. Teste Alternativen mit kürzeren Prompts, Ausgaben oder anderen Preisannahmen.

Formel

Kosten/Aufgabe = Eingabetokens ÷ 1.000.000 × Eingabepreis + Ausgabetokens ÷ 1.000.000 × Ausgabepreis

Was das Ergebnis bedeutet

Das Hauptresultat zeigt die reinen Tokenpreise pro Aufgabe. Tages- und Monatswerte skalieren diesen Betrag linear mit dem angegebenen Aufgabenvolumen.

Zusätzliche Infrastruktur-, Netzwerk-, Speicher-, Retrieval-, Tool- oder Beobachtungskosten sind nicht enthalten. Trage immer deine tatsächlich gültigen Preisannahmen ein.

Beispielrechnung

Bei 1.200 Eingabetokens zu 1,50 € je Million und 300 Ausgabetokens zu 6,00 € je Million kostet eine Aufgabe 0,0036 €. 10.000 Aufgaben pro Tag ergeben 36,00 € pro Tag und 1.080,00 € in 30 Tagen.

Tipps für bessere Ergebnisse

  • Nutze reale Tokenstatistiken aus Produktionslogs.
  • Aktualisiere Preisannahmen bei Modell- oder Tarifwechseln.
  • Reduziere unnötig lange Systemprompts und Kontextfenster.
  • Begrenze Ausgabelängen, wenn längere Antworten keinen Mehrwert liefern.
  • Führe separate Kalkulationen für Modelle mit unterschiedlichen Preisstrukturen.

Häufig gestellte Fragen

Wie berechne ich die Kosten einer einzelnen LLM-Anfrage?

Multipliziere Eingabe- und Ausgabetokens jeweils mit dem zugehörigen Preis pro Million Tokens und addiere beide Teilkosten.

Warum muss ich die Tokenpreise selbst eintragen?

Modell- und Anbieterpreise können sich ändern und unterscheiden sich nach Tarif. Eigene Eingaben vermeiden veraltete fest verdrahtete Preise.

Sind Prompt-Caching-Rabatte in den LLM-Kosten enthalten?

Nein. Wenn dein Anbieter Cache-Treffer anders bepreist, solltest du die effektiven durchschnittlichen Eingabekosten als eigene Preisannahme verwenden oder separat modellieren.

Welche Kosten fehlen bei einer selbst gehosteten LLM-Inferenz?

Bei Self-Hosting kommen typischerweise GPU-Zeit, Strom, Orchestrierung, Netzwerk, Storage und Betrieb hinzu; dieser Rechner modelliert nur eingegebene Tokenpreise.

Wie kann ich LLM-Kosten pro Aufgabe senken?

Die stärksten Hebel sind oft weniger Eingabekontext, kürzere Ausgaben, geeignetere Modelle, höhere Cache-Nutzung oder preisgünstigere Ausführungswege bei gleicher Qualitätsanforderung.

Planungsübersicht

DimensionVerwendung
Primärer WertKapazitäts- oder Kostenentscheidung
SekundärwertePlausibilitätsprüfung und Skalierung
AnnahmenMit Produktionsmesswerten regelmäßig aktualisieren

Rechner-Kategorien entdecken

22 Kategorien