Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitet
Wenn ein Anbieter mit einem Kontextfenster von „1 Million Token“ wirbt, meint er die Menge Text, die das Modell in einer einzigen Anfrage berücksichtigen kann. Das klingt nach sehr viel, ist aber nicht grenzenlos und hat Nebenwirkungen bei Kosten und Qualität.
Was zum Kontext zählt
Das Kontextfenster umfasst alles, was das Modell bei einer Anfrage „sieht“: die Systemanweisung, den bisherigen Gesprächsverlauf, hochgeladene Dokumente, Werkzeugbeschreibungen und die eigene Antwort. In einem Chat wächst der Kontext mit jeder Nachricht, weil der gesamte Verlauf bei jeder neuen Anfrage mitgeschickt wird. Das ist auch der Grund, warum lange Chats teurer werden: Die zehnte Frage kostet das Zehnfache der ersten, wenn der Verlauf vollständig mitgeht.
Typische Größen
Die Zahlen sind in Tokens angegeben (siehe Was sind Tokens?). Zur Einordnung: Eine Seite Text sind rund 700 Tokens, ein Roman mit 300 Seiten etwa 200.000 Tokens.
- 128.000 Tokens: etwa 180 Seiten. Reicht für die meisten Dokumente und lange Gespräche.
- 200.000 Tokens: etwa 280 Seiten, ein ganzes Buch.
- 1 Million Tokens: etwa 1.400 Seiten oder eine mittelgroße Codebasis.
Welches Modell wie viel schafft, steht im Token-Zähler: Dort sehen Sie für Ihren Text direkt, wie viel Prozent des Kontextfensters er belegt.
Groß ist nicht automatisch besser
Drei Dinge sollte man wissen, bevor man ein Kontextfenster bis zum Rand füllt:
- Kosten. Jeder Token im Kontext wird als Eingabe abgerechnet, bei jeder Anfrage aufs Neue. Ein 500.000-Token-Dokument, zu dem Sie zwanzig Fragen stellen, wird zwanzigmal berechnet. Manche Anbieter bieten Caching an, mit dem wiederholte Eingaben deutlich günstiger werden; das muss aber im Programm aktiv genutzt werden.
- Aufmerksamkeit. Modelle finden Informationen in der Mitte sehr langer Kontexte schlechter als am Anfang oder Ende. Für präzise Antworten ist es oft besser, nur die relevanten Abschnitte mitzugeben.
- Geschwindigkeit. Große Eingaben verlängern die Antwortzeit spürbar, bei einer Million Tokens auf viele Sekunden bis Minuten.
Wenn der Kontext nicht reicht
Für Texte, die größer sind als das Fenster, gibt es bewährte Wege: den Text in Abschnitte teilen und einzeln verarbeiten, Zwischenergebnisse zusammenfassen und nur die Zusammenfassung weitergeben, oder vorab mit einer Suche die passenden Stellen herausfiltern (Retrieval). In Chats hilft es, ein neues Gespräch zu beginnen und den Stand in wenigen Sätzen zusammenzufassen, statt den alten Verlauf endlos weiterzuführen.
Was das für die Praxis heißt
Für den Alltag im Chat spielt das Kontextfenster selten eine Rolle, bis man es mit großen Dokumenten füllt. Für Entwickler ist es eine Kostenfrage: Je kleiner der Kontext pro Anfrage, desto günstiger und schneller. Der Kostenrechner zeigt, wie stark die Eingabegröße ins Gewicht fällt.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.