Semantisches Caching: Ähnliche KI-Anfragen nur einmal bezahlen
Semantisches Caching speichert Antworten eines Sprachmodells und liefert sie erneut aus, wenn eine neue Frage einer früheren in der Bedeutung ähnelt. Anders als ein klassischer Cache braucht es dafür keine wortgleiche Anfrage: „Wie lange habe ich Rückgaberecht?“ und „Wie viele Tage kann ich zurückschicken?“ können dieselbe gespeicherte Antwort bekommen.
Abgrenzung zum Prompt Caching
Die Begriffe werden oft verwechselt. Prompt Caching ist eine Funktion der Modellanbieter: Ein gleichbleibender Anfang des Prompts wird beim Anbieter zwischengespeichert und günstiger berechnet, das Modell erzeugt aber jedes Mal eine neue Antwort (Prompt Caching erklärt). Beim semantischen Caching entfällt der Modellaufruf ganz, weil Ihre Anwendung eine fertige Antwort aus dem eigenen Speicher holt.
So funktioniert es
- Eine neue Frage wird in ein Embedding übersetzt.
- Der Cache sucht die ähnlichste frühere Frage.
- Liegt die Ähnlichkeit über einem Schwellenwert, wird die gespeicherte Antwort ausgeliefert.
- Sonst wird das Modell gefragt und Frage, Embedding und Antwort werden gespeichert.
Wie Ähnlichkeit zwischen Vektoren berechnet wird, lässt sich mit dem Werkzeug Kosinus-Ähnlichkeit ausprobieren.
Wann es sich lohnt
- Viele wiederkehrende Fragen: Kundenservice, interne FAQ, Produktfragen.
- Antworten ändern sich selten: Regeln, Öffnungszeiten, Anleitungen.
- Antworten hängen nicht von der Person ab: keine Kontodaten, kein Gesprächsverlauf.
Gespart wird doppelt: Der Modellaufruf entfällt, und die Antwort ist fast sofort da. Was Einsparungen in Ihrem Fall ausmachen, schätzt der Spar-Rechner.
Die Risiken
Die größte Gefahr sind falsche Treffer: Zwei Fragen sind sich sprachlich ähnlich, verlangen aber unterschiedliche Antworten. „Kann ich mein Abo kündigen?“ und „Kann ich mein Abo pausieren?“ liegen im Vektorraum nah beieinander. Weitere Risiken:
- Veraltete Antworten: Ändern sich Preise oder Regeln, liefert der Cache die alte Version.
- Personenbezug: Eine Antwort für eine Person darf nie bei einer anderen landen.
- Kontextabhängigkeit: „Und wie ist das bei Premium?“ ergibt ohne Gesprächsverlauf keinen Sinn.
Schutzmaßnahmen
- Schwellenwert eher streng wählen und mit echten Frage-Paaren testen.
- Cache-Einträge mit Ablaufdatum versehen und bei Änderungen der Wissensbasis leeren.
- Nur Antworten cachen, die keine personenbezogenen Daten enthalten.
- Getrennte Caches je Sprache, Mandant oder Produktvariante.
- Nur die erste Frage eines Gesprächs cachen, nicht Folgefragen.
- Treffer protokollieren und stichprobenartig prüfen; siehe LLM-Observability.
Eine sichere Variante für den Anfang: Statt beliebige frühere Antworten zu speichern, legen Sie eine Liste geprüfter Standardantworten an, etwa für die 50 häufigsten Fragen. Der semantische Vergleich ordnet neue Fragen nur diesen freigegebenen Antworten zu. So kann keine fehlerhafte Modellantwort in den Cache gelangen.
Kosten des Caches selbst
Für jede Anfrage fällt ein Embedding an, dazu Speicher und Suche. Das ist meist deutlich günstiger als ein Modellaufruf, aber nicht kostenlos. Bei geringer Trefferquote kann der Cache mehr kosten als er spart. Messen Sie daher die Trefferquote nach einigen Wochen. Weitere Sparhebel sammelt der Ratgeber KI-Kosten senken; eine Ergänzung ist Modell-Routing, bei dem einfache Fragen an günstigere Modelle gehen.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.