Semantisches Caching: Ähnliche KI-Anfragen nur einmal bezahlen

2 Min. LesezeitStand 08.10.2026Mit KI erstellt · redaktionell geprüft

Semantisches Caching speichert Antworten eines Sprachmodells und liefert sie erneut aus, wenn eine neue Frage einer früheren in der Bedeutung ähnelt. Anders als ein klassischer Cache braucht es dafür keine wortgleiche Anfrage: „Wie lange habe ich Rückgaberecht?“ und „Wie viele Tage kann ich zurückschicken?“ können dieselbe gespeicherte Antwort bekommen.

Abgrenzung zum Prompt Caching

Die Begriffe werden oft verwechselt. Prompt Caching ist eine Funktion der Modellanbieter: Ein gleichbleibender Anfang des Prompts wird beim Anbieter zwischengespeichert und günstiger berechnet, das Modell erzeugt aber jedes Mal eine neue Antwort (Prompt Caching erklärt). Beim semantischen Caching entfällt der Modellaufruf ganz, weil Ihre Anwendung eine fertige Antwort aus dem eigenen Speicher holt.

So funktioniert es

  1. Eine neue Frage wird in ein Embedding übersetzt.
  2. Der Cache sucht die ähnlichste frühere Frage.
  3. Liegt die Ähnlichkeit über einem Schwellenwert, wird die gespeicherte Antwort ausgeliefert.
  4. Sonst wird das Modell gefragt und Frage, Embedding und Antwort werden gespeichert.

Wie Ähnlichkeit zwischen Vektoren berechnet wird, lässt sich mit dem Werkzeug Kosinus-Ähnlichkeit ausprobieren.

Wann es sich lohnt

  • Viele wiederkehrende Fragen: Kundenservice, interne FAQ, Produktfragen.
  • Antworten ändern sich selten: Regeln, Öffnungszeiten, Anleitungen.
  • Antworten hängen nicht von der Person ab: keine Kontodaten, kein Gesprächsverlauf.

Gespart wird doppelt: Der Modellaufruf entfällt, und die Antwort ist fast sofort da. Was Einsparungen in Ihrem Fall ausmachen, schätzt der Spar-Rechner.

Die Risiken

Die größte Gefahr sind falsche Treffer: Zwei Fragen sind sich sprachlich ähnlich, verlangen aber unterschiedliche Antworten. „Kann ich mein Abo kündigen?“ und „Kann ich mein Abo pausieren?“ liegen im Vektorraum nah beieinander. Weitere Risiken:

  • Veraltete Antworten: Ändern sich Preise oder Regeln, liefert der Cache die alte Version.
  • Personenbezug: Eine Antwort für eine Person darf nie bei einer anderen landen.
  • Kontextabhängigkeit: „Und wie ist das bei Premium?“ ergibt ohne Gesprächsverlauf keinen Sinn.

Schutzmaßnahmen

  1. Schwellenwert eher streng wählen und mit echten Frage-Paaren testen.
  2. Cache-Einträge mit Ablaufdatum versehen und bei Änderungen der Wissensbasis leeren.
  3. Nur Antworten cachen, die keine personenbezogenen Daten enthalten.
  4. Getrennte Caches je Sprache, Mandant oder Produktvariante.
  5. Nur die erste Frage eines Gesprächs cachen, nicht Folgefragen.
  6. Treffer protokollieren und stichprobenartig prüfen; siehe LLM-Observability.

Eine sichere Variante für den Anfang: Statt beliebige frühere Antworten zu speichern, legen Sie eine Liste geprüfter Standardantworten an, etwa für die 50 häufigsten Fragen. Der semantische Vergleich ordnet neue Fragen nur diesen freigegebenen Antworten zu. So kann keine fehlerhafte Modellantwort in den Cache gelangen.

Kosten des Caches selbst

Für jede Anfrage fällt ein Embedding an, dazu Speicher und Suche. Das ist meist deutlich günstiger als ein Modellaufruf, aber nicht kostenlos. Bei geringer Trefferquote kann der Cache mehr kosten als er spart. Messen Sie daher die Trefferquote nach einigen Wochen. Weitere Sparhebel sammelt der Ratgeber KI-Kosten senken; eine Ergänzung ist Modell-Routing, bei dem einfache Fragen an günstigere Modelle gehen.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Spar-RechnerWie viel Prompt-Caching und Batch-Verarbeitung bei Ihrer Anwendung im Monat sparen.
Öffnen

Auch hilfreich: Systemprompt-Kostenrechner · KI-Preiskalkulation

Weiterlesen

Weitere Artikel

  1. Modell-Routing: Anfragen automatisch auf passende KI-Modelle verteilenModell-Routing erklärt: einfache Anfragen an günstige, schwierige an starke KI-Modelle schicken. Welche Router-Arten es gibt und wie Sie die Qualität sichern.
  2. Mehrsprachige KI-Anwendungen: Chatbots und Tools für viele SprachenMehrsprachige KI-Anwendungen: Antwortsprache steuern, Prompts und Wissensbasis über Sprachen hinweg nutzen, Tokenkosten je Sprache beachten und Qualität testen.
  3. Sprachassistent mit KI bauen: Von der Spracheingabe zur gesprochenen AntwortSprachassistent mit KI bauen: Spracherkennung, Sprachmodell und Sprachausgabe verbinden oder Echtzeit-Modelle nutzen. Tipps zu Latenz, Kosten und Datenschutz.