Kontext komprimieren: Lange KI-Gespräche schlank halten

2 Min. LesezeitStand 08.10.2026Mit KI erstellt · redaktionell geprüft

Kontext komprimieren wird nötig, sobald ein Gespräch oder ein Agentenlauf lang wird: Jede neue Anfrage schickt den gesamten bisherigen Verlauf erneut an das Modell. Das kostet Tokens, macht Antworten langsamer und kann irgendwann das Kontextfenster sprengen. Mit einigen Techniken bleibt der Verlauf schlank, ohne dass Wichtiges verloren geht.

Warum lange Verläufe Probleme machen

  • Kosten: Bei einem Gespräch mit 50 Runden wird die erste Nachricht 50-mal bezahlt. Die Kosten wachsen schneller als die Zahl der Runden.
  • Grenze: Irgendwann ist das Kontextfenster voll, und die Anfrage scheitert.
  • Qualität: Modelle beachten Informationen in sehr langen Kontexten nicht immer zuverlässig. Wichtiges kann zwischen viel Unwichtigem untergehen.

Wie viel Platz noch ist, zeigt der Kontextfenster-Rechner; was ein Verlauf kostet, der Chat-Kosten-Rechner.

Vier Techniken zum Komprimieren

Technik 1: Gleitendes Fenster

Nur die letzten N Runden werden mitgeschickt, ältere fallen weg. Einfach, aber riskant: Frühe Festlegungen wie Name, Ziel oder Vorgaben gehen verloren. Deshalb sollten wichtige Informationen dauerhaft im Systemprompt oder in einem eigenen Abschnitt stehen.

Technik 2: Zusammenfassen

Ab einer bestimmten Länge fasst ein Modell ältere Teile des Gesprächs zusammen. Die Zusammenfassung ersetzt die alten Nachrichten. Ein brauchbarer Auftrag:

Fasse den bisherigen Verlauf für die weitere Arbeit zusammen.
Behalte: Ziel, getroffene Entscheidungen, offene Punkte,
wichtige Zahlen, Namen und Dateipfade, Vorgaben des Nutzers.
Lass weg: Begrüßungen, verworfene Zwischenschritte, Wiederholungen.

Einige Anbieter und Agenten-Werkzeuge bieten diese Verdichtung inzwischen eingebaut an. Auch dann lohnt es sich zu prüfen, was erhalten bleibt.

Technik 3: Werkzeugergebnisse kürzen

Bei Agenten sind oft nicht die Nachrichten das Problem, sondern Werkzeugergebnisse: Dateiinhalte, Suchtreffer, Logausgaben. Nachdem der Agent sie verarbeitet hat, können ältere Ergebnisse durch einen kurzen Platzhalter ersetzt werden, etwa „Datei gelesen, relevante Stelle: Zeile 40 bis 60“. Noch besser ist es, Werkzeuge von vornherein knappe Ergebnisse liefern zu lassen.

Technik 4: Externes Gedächtnis

Statt alles im Kontext zu halten, schreibt der Agent wichtige Erkenntnisse in eine Notizdatei oder Datenbank und liest sie bei Bedarf wieder. So bleiben Zwischenstände über lange Aufgaben oder mehrere Sitzungen erhalten. Hintergründe erklärt KI-Gedächtnis erklärt.

Welche Technik passt, hängt vom Einsatz ab: Für Chatbots mit kurzen Gesprächen genügt oft das gleitende Fenster mit festen Eckdaten, für lange Beratungen die Zusammenfassung, für Agenten das Kürzen von Werkzeugergebnissen und ein externes Gedächtnis. Häufig kombiniert man mehrere Techniken.

Zusammenspiel mit Prompt Caching

Prompt Caching senkt die Kosten für gleichbleibende Anfänge des Prompts. Jede Komprimierung ändert aber den Verlauf und macht den Cache ab dieser Stelle ungültig. Komprimieren Sie deshalb lieber selten und in größeren Schritten als bei jeder Runde. Details stehen unter Prompt Caching erklärt.

Praxisregeln

  1. Dauerhaft Wichtiges in den Systemprompt oder eine feste Notiz.
  2. Komprimieren, bevor das Fenster voll ist, etwa bei zwei Dritteln.
  3. Zusammenfassungen gezielt auf Entscheidungen und offene Punkte ausrichten.
  4. Nach der Komprimierung testen, ob der Agent noch alle Vorgaben kennt.

Den größeren Rahmen beschreibt Context Engineering; wie Agenten grundsätzlich aufgebaut sind, zeigt KI-Agenten programmieren.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Kontextfenster-RechnerPasst mein Dokument ins Kontextfenster? Seiten oder Wörter eingeben, für alle Modelle prüfen.
Öffnen

Auch hilfreich: Antwortzeit-Rechner · max_tokens-Rechner

Weiterlesen

Weitere Artikel

  1. Semantisches Caching: Ähnliche KI-Anfragen nur einmal bezahlenSemantisches Caching erklärt: wie ein Cache über Embeddings ähnliche Fragen erkennt, wann das Kosten und Wartezeit spart und welche Risiken es birgt.
  2. Modell-Routing: Anfragen automatisch auf passende KI-Modelle verteilenModell-Routing erklärt: einfache Anfragen an günstige, schwierige an starke KI-Modelle schicken. Welche Router-Arten es gibt und wie Sie die Qualität sichern.
  3. Mehrsprachige KI-Anwendungen: Chatbots und Tools für viele SprachenMehrsprachige KI-Anwendungen: Antwortsprache steuern, Prompts und Wissensbasis über Sprachen hinweg nutzen, Tokenkosten je Sprache beachten und Qualität testen.