Prompt-Caching erklärt: Bis zu 90 % weniger Kosten für wiederholte Eingaben

2 Min. LesezeitStand 07.10.2026Mit KI erstellt · redaktionell geprüft

Prompt-Caching ist der größte einzelne Sparhebel bei KI-APIs, der die Qualität nicht verändert. Wiederholte Teile eines Prompts, etwa eine lange Systemanweisung oder ein Dokument, werden beim Anbieter zwischengespeichert und bei der nächsten Anfrage zu einem Bruchteil des Preises berechnet.

Wie Prompt-Caching funktioniert

Ein Modell verarbeitet den Prompt von vorn nach hinten. Ist der Anfang einer neuen Anfrage identisch mit dem einer Anfrage von vor wenigen Minuten, kann der Anbieter das Zwischenergebnis wiederverwenden. Dafür berechnet er statt des vollen Eingabepreises nur einen kleinen Teil, oft ein Zehntel. Entscheidend ist das Wort „Anfang“: Schon ein geändertes Zeichen in der Mitte macht alles danach ungültig.

Was die Anbieter berechnen

  • Anthropic (Claude): Caching wird ausdrücklich angefordert. Das erstmalige Schreiben kostet 25 Prozent Aufschlag (bei einer Stunde Haltbarkeit das Doppelte), jeder Cache-Treffer meist ein Zehntel des Eingabepreises, bei einigen neuen Modellen noch weniger.
  • OpenAI: Längere Prompts werden automatisch gecacht; gecachte Eingabe-Tokens kosten je nach Modell einen Bruchteil des Normalpreises.
  • Google (Gemini): Neuere Modelle cachen automatisch; zusätzlich gibt es ausdrückliches Caching mit Speichergebühr.

Die genauen Cache-Preise je Modell stehen auf den Modellseiten. Die Bedingungen ändern sich gelegentlich; prüfen Sie vor dem Einsatz die Dokumentation des Anbieters.

Wann sich Caching lohnt

Caching lohnt sich, wenn ein langer, gleichbleibender Anfang innerhalb weniger Minuten mehrfach verwendet wird:

  • Chatbots mit langer Systemanweisung und vielen Nutzern
  • mehrere Fragen zu demselben Dokument
  • Agenten, deren Werkzeugbeschreibungen bei jedem Schritt mitgehen
  • lange Gespräche, bei denen der Verlauf wächst

Bei kurzen Prompts unter etwa 1.000 Tokens greift Caching meist gar nicht; bei seltenen Anfragen läuft der Cache ab, bevor er genutzt wird.

Prompts richtig aufbauen

Die Regel ist einfach: Was sich nie ändert, gehört nach vorn, was sich ändert, nach hinten. Also zuerst Systemanweisung und Werkzeuge, dann feste Dokumente, dann der Gesprächsverlauf und ganz am Ende die neue Frage. Ein Zeitstempel oder eine Nutzer-ID in der Systemanweisung zerstört den Cache bei jeder Anfrage; solche Angaben gehören ans Ende.

Was es bringt

Bei einem Chatbot mit 6.000 Tokens fester Anweisung, 800 Tokens wechselnder Eingabe und 90 Prozent Cache-Treffern sinken die Eingabekosten typischerweise um mehr als die Hälfte. Rechnen Sie Ihr Szenario mit dem Spar-Rechner durch; im KI-Kostenrechner lässt sich der Cache-Anteil ebenfalls einstellen.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Spar-RechnerWie viel Prompt-Caching und Batch-Verarbeitung bei Ihrer Anwendung im Monat sparen.
Öffnen

Auch hilfreich: Systemprompt-Kostenrechner · KI-Preiskalkulation

Weiterlesen

Weitere Artikel

  1. KI-Agenten: Was sie können und was sie kostenKI-Agenten erklärt: wie sie in Schritten arbeiten, wofür sie sich eignen, warum ihre Kosten schnell wachsen und wie man sie mit Caching und Grenzen im Griff behält.
  2. Batch-Verarbeitung: Halber Preis für KI-Anfragen ohne EileBatch-Verarbeitung bei OpenAI, Anthropic und Google: 50 % Rabatt auf API-Anfragen, die nicht sofort fertig sein müssen. So funktioniert es, mit Beispielen und Tipps.
  3. Open-Weight-Modelle oder API: Was ist günstiger?Open-Weight-Modelle selbst betreiben oder per API nutzen? Kosten für Grafikkarten, Strom und Betrieb im Vergleich zu API-Preisen, mit Faustregeln für die Entscheidung.