Cached-Input-Preise: So zahlen Sie für wiederholte Eingaben nur einen Bruchteil

2 Min. LesezeitStand 08.10.2026Mit KI erstellt · redaktionell geprüft

Cached-Input-Preise sind der reduzierte Preis, den KI-Anbieter für Eingabe-Tokens verlangen, die sie aus einem Zwischenspeicher wiederverwenden. Der Rabatt ist erheblich: Bei vielen aktuellen Modellen kostet ein gecachtes Token nur ein Zehntel des normalen Eingabepreises, bei manchen noch weniger. Wie Caching technisch funktioniert, erklärt Prompt-Caching erklärt. Hier geht es um die Preise und die praktische Umsetzung.

Was gecachte Tokens kosten

Ein Blick auf die Listenpreise einiger Modelle, je Million Tokens:

  • Claude Opus 5.5: Eingabe rund 4 Dollar, gecacht rund 0,20 Dollar (ein Zwanzigstel)
  • Claude Sonnet 5.5: Eingabe rund 2 Dollar, gecacht rund 0,20 Dollar (ein Zehntel)
  • GPT-5.5: Eingabe rund 5 Dollar, gecacht rund 0,50 Dollar (ein Zehntel)
  • GPT-6.1 Sol: Eingabe rund 2 Dollar, gecacht rund 0,10 Dollar (ein Zwanzigstel)
  • DeepSeek V4 Pro: Eingabe rund 1,32 Dollar, gecacht rund 0,044 Dollar (ein Dreißigstel)

Die Cache-Preise aller Modelle stehen auf den jeweiligen Modellseiten. Bei Anthropic kommt beim ersten Schreiben in den Cache ein Aufschlag auf den Eingabepreis hinzu; bei OpenAI und den neueren Gemini-Modellen geschieht das Caching automatisch ohne Aufschlag.

Wann sich der Cache bezahlt macht

Gecacht wird nur der Anfang eines Prompts, der sich nicht ändert. Rabatt gibt es, wenn derselbe Anfang innerhalb der Haltedauer erneut geschickt wird; die Haltedauer liegt je nach Anbieter und Einstellung bei einigen Minuten bis zu einer Stunde. Typische Fälle:

  • Chatbots mit langer Systemanweisung und vielen Gesprächen
  • Agenten, die bei jedem Schritt dieselben Werkzeugbeschreibungen mitschicken
  • mehrere Fragen zum selben langen Dokument
  • wachsende Chatverläufe, bei denen der ältere Teil gleich bleibt

Bei seltenen Anfragen läuft der Cache ab, bevor er genutzt wird. Bei Anthropic kann sich das Caching dann sogar verteuern, weil der Schreibaufschlag ohne spätere Treffer anfällt.

Prompts für hohe Trefferquoten aufbauen

  1. Feste Teile nach vorn: Systemanweisung, Regeln, Beispiele, Werkzeugdefinitionen, Dokumente.
  2. Veränderliche Teile nach hinten: Nutzerfrage, aktuelle Daten, Datum und Uhrzeit.
  3. Nichts Veränderliches im Anfang: Ein Zeitstempel oder eine Nutzer-ID in der ersten Zeile macht den Cache für alles danach wertlos.
  4. Reihenfolge stabil halten: Werkzeuge und Beispiele immer in derselben Reihenfolge schicken.
  5. Mindestlänge beachten: Sehr kurze Prompts werden nicht gecacht. Die Grenze nennt die Dokumentation des Anbieters.

Trefferquote messen

Die API-Antwort weist gecachte Tokens getrennt aus. Teilen Sie die gecachten Eingabe-Tokens durch alle Eingabe-Tokens, dann haben Sie die Trefferquote. Fällt sie nach einer Änderung, hat sich vermutlich der Anfang des Prompts verschoben. Weitere Kennzahlen beschreibt KI-Kosten überwachen.

Was es spart

Bei einem Chatbot mit 4.000 Tokens Systemanweisung und kurzen Fragen besteht der größte Teil jeder Anfrage aus dem gleichbleibenden Anfang. Mit hoher Trefferquote sinken die Eingabekosten damit um einen großen Teil. Wie viel genau, rechnet der Spar-Rechner mit Ihren Zahlen, auch in Kombination mit Batch.

Häufige Fehler

Ein Datum oder eine Sitzungs-ID in der Systemanweisung, wechselnde Reihenfolge von Werkzeugen und zu kurze Prompts sind die häufigsten Gründe, warum der Cache nicht greift und die erwartete Ersparnis ausbleibt.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Spar-RechnerWie viel Prompt-Caching und Batch-Verarbeitung bei Ihrer Anwendung im Monat sparen.
Öffnen

Auch hilfreich: Systemprompt-Kostenrechner · KI-Preiskalkulation

Weiterlesen

Weitere Artikel

  1. Batch-API-Rabatt nutzen: Rechnung, Anbieter und GrenzenBatch-API-Rabatt richtig nutzen: was OpenAI, Anthropic, Google und Mistral gewähren, welche Aufgaben passen, wie Sie die Ersparnis rechnen und Fehler vermeiden.
  2. KI-Abo steuerlich absetzen: Was für ChatGPT, Claude und Co. allgemein giltKI-Abo steuerlich absetzen: allgemeiner Überblick zu Betriebsausgaben, Werbungskosten, privater Mitnutzung und Reverse Charge. Keine Steuerberatung.
  3. ChatGPT Business Kosten: Was der Team-Tarif von OpenAI kostet und bietetChatGPT Business Kosten: wie der frühere Team-Tarif abgerechnet wird, was er gegenüber Plus bietet, welche Folgekosten entstehen und wann Enterprise passt.