Kontext-Komprimierung: Ersparnis berechnen

Kontext-Komprimierung durchrechnen: Was das Zusammenfassen eines langen Chatverlaufs an Tokens und Kosten spart, Runde für Runde und mit echten Modellpreisen.

–

 

Vergleich
Ohne KomprimierungMit Komprimierung
Kontext je Runde
RundeKontext ohneKontext mitHinweis

Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.

Warum lange Verläufe teuer werden

Bei der Kontext-Komprimierung wird ein langer Chatverlauf zusammengefasst, sobald er eine Schwelle überschreitet. Ohne Komprimierung schickt jede neue Anfrage den gesamten bisherigen Verlauf erneut an das Modell. Die Eingabe-Tokens wachsen dadurch mit jeder Runde, die Summe über alle Runden sogar quadratisch: Bei 40 Runden mit je 900 Tokens enthält die letzte Anfrage rund 35.000 Tokens Verlauf, über alle Runden zusammen sind es mehr als 700.000.

Der Rechner simuliert beide Varianten Runde für Runde. Mit Komprimierung gilt die Regel: Chatverlauf zusammenfassen, sobald er die eingestellte Grenze überschreitet. Ältere Runden gehen zusammen mit einer kurzen Anweisung (angenommen 150 Tokens) an das Modell, das eine Zusammenfassung der gewählten Länge schreibt; die letzten Runden bleiben wörtlich erhalten. Die Kosten dieser Zusammenfassungs-Aufrufe sind eingerechnet. Das Ergebnis zeigt die Token-Ersparnis, die Kosten mit den aktuellen Listenpreisen des gewählten Modells in Euro und ob das Kontextfenster ohne Komprimierung irgendwann überläuft.

Komprimierung ist nicht immer der beste Weg, Kosten zu sparen. Prompt-Caching macht wiederholte Präfixe deutlich günstiger, und ein stabiler Verlauf wird besser gecacht als einer, der sich nach jeder Zusammenfassung ändert. Tragen Sie deshalb den erwarteten Cache-Anteil ein und vergleichen Sie. Bei Aufgaben, die exakte Details aus frühen Runden brauchen, kann eine Zusammenfassung Fehler verursachen. Weitere Spartipps rechnet der Spar-Rechner, die Kosten eines Chatbots der Chat-Kostenrechner.

Anleitung: Kontext-Komprimierung in 5 Schritten

  1. Unter „Modell“ das verwendete Sprachmodell wählen, die Preise werden automatisch übernommen.
  2. „Systemprompt“, „Tokens je Nutzernachricht“, „Tokens je Antwort“ und die „Anzahl Runden“ eintragen.
  3. Bei „Zusammenfassen ab“ die Schwelle in Tokens und bei „Länge der Zusammenfassung“ das Ziel festlegen.
  4. Optional „Letzte Runden wörtlich behalten“ setzen und den Anteil aus dem Prompt-Cache angeben.
  5. Tokens und Kosten mit und ohne Komprimierung sowie den Verlauf je Runde ablesen.

Typische Anwendungsfälle

  • Chatbot-Kosten senken: Prüfen, ob sich eine automatische Zusammenfassung ab einer bestimmten Länge lohnt.
  • Agenten planen: Bei langen Tool-Verläufen abschätzen, wie schnell das Kontextfenster ohne Komprimierung voll ist.
  • Schwellwert wählen: Verschiedene Grenzen vergleichen und den besten Kompromiss aus Kosten und Detailtreue finden.
Fragen

Häufige Fragen

Ab wann lohnt sich das Zusammenfassen?

Je mehr Runden ein Gespräch hat und je länger die einzelnen Nachrichten sind, desto mehr. Bei kurzen Gesprächen mit wenigen Runden überwiegen oft die Kosten der Zusammenfassung selbst.

Wie lang sollte eine Zusammenfassung sein?

So kurz wie möglich, aber mit allen Fakten, Entscheidungen und offenen Aufgaben. Werte von 5 bis 15 Prozent des zusammengefassten Verlaufs sind ein üblicher Ausgangspunkt.

Was passiert, wenn der Kontext ohne Komprimierung überläuft?

Die API lehnt die Anfrage ab oder die Anwendung schneidet alte Nachrichten ab. Das Werkzeug warnt, wenn der Verlauf das Kontextfenster des gewählten Modells überschreitet.

Welche Preise verwendet der Rechner?

Die hinterlegten Listenpreise des gewählten Modells je Million Eingabe-, Ausgabe- und Cache-Tokens, umgerechnet in Euro. Rabatte und Batch-Preise sind nicht berücksichtigt.

Geht beim Zusammenfassen Information verloren?

Ja, Details können fehlen. Deshalb behalten viele Anwendungen die letzten Runden wörtlich und fassen nur ältere Teile zusammen. Wichtige Fakten wie Namen, Zahlen und Entscheidungen sollten in der Zusammenfassung ausdrücklich erhalten bleiben.

Verträgt sich Komprimierung mit Prompt-Caching?

Nur teilweise. Nach jeder Zusammenfassung ändert sich der Anfang des Verlaufs, der Cache muss neu aufgebaut werden. Ohne Komprimierung bleibt der Präfix stabil und wird günstig aus dem Cache gelesen.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
  2. Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
  3. Warum deutsche Texte mehr Tokens brauchen als englischeDeutsche Texte brauchen meist 20 bis 50 Prozent mehr Tokens als englische. Woran das liegt, was es kostet und was man dagegen tun kann.
Weitere Werkzeuge

Das könnte auch helfen

Alle 558 Werkzeuge