Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitet

2 Min. LesezeitStand 07.10.2026Mit KI erstellt · redaktionell geprüft

Wenn ein Anbieter mit einem Kontextfenster von „1 Million Token“ wirbt, meint er die Menge Text, die das Modell in einer einzigen Anfrage berücksichtigen kann. Das klingt nach sehr viel, ist aber nicht grenzenlos und hat Nebenwirkungen bei Kosten und Qualität.

Was zum Kontext zählt

Das Kontextfenster umfasst alles, was das Modell bei einer Anfrage „sieht“: die Systemanweisung, den bisherigen Gesprächsverlauf, hochgeladene Dokumente, Werkzeugbeschreibungen und die eigene Antwort. In einem Chat wächst der Kontext mit jeder Nachricht, weil der gesamte Verlauf bei jeder neuen Anfrage mitgeschickt wird. Das ist auch der Grund, warum lange Chats teurer werden: Die zehnte Frage kostet das Zehnfache der ersten, wenn der Verlauf vollständig mitgeht.

Typische Größen

Die Zahlen sind in Tokens angegeben (siehe Was sind Tokens?). Zur Einordnung: Eine Seite Text sind rund 700 Tokens, ein Roman mit 300 Seiten etwa 200.000 Tokens.

  • 128.000 Tokens: etwa 180 Seiten. Reicht für die meisten Dokumente und lange Gespräche.
  • 200.000 Tokens: etwa 280 Seiten, ein ganzes Buch.
  • 1 Million Tokens: etwa 1.400 Seiten oder eine mittelgroße Codebasis.

Welches Modell wie viel schafft, steht im Token-Zähler: Dort sehen Sie für Ihren Text direkt, wie viel Prozent des Kontextfensters er belegt.

Groß ist nicht automatisch besser

Drei Dinge sollte man wissen, bevor man ein Kontextfenster bis zum Rand füllt:

  1. Kosten. Jeder Token im Kontext wird als Eingabe abgerechnet, bei jeder Anfrage aufs Neue. Ein 500.000-Token-Dokument, zu dem Sie zwanzig Fragen stellen, wird zwanzigmal berechnet. Manche Anbieter bieten Caching an, mit dem wiederholte Eingaben deutlich günstiger werden; das muss aber im Programm aktiv genutzt werden.
  2. Aufmerksamkeit. Modelle finden Informationen in der Mitte sehr langer Kontexte schlechter als am Anfang oder Ende. Für präzise Antworten ist es oft besser, nur die relevanten Abschnitte mitzugeben.
  3. Geschwindigkeit. Große Eingaben verlängern die Antwortzeit spürbar, bei einer Million Tokens auf viele Sekunden bis Minuten.

Wenn der Kontext nicht reicht

Für Texte, die größer sind als das Fenster, gibt es bewährte Wege: den Text in Abschnitte teilen und einzeln verarbeiten, Zwischenergebnisse zusammenfassen und nur die Zusammenfassung weitergeben, oder vorab mit einer Suche die passenden Stellen herausfiltern (Retrieval). In Chats hilft es, ein neues Gespräch zu beginnen und den Stand in wenigen Sätzen zusammenzufassen, statt den alten Verlauf endlos weiterzuführen.

Was das für die Praxis heißt

Für den Alltag im Chat spielt das Kontextfenster selten eine Rolle, bis man es mit großen Dokumenten füllt. Für Entwickler ist es eine Kostenfrage: Je kleiner der Kontext pro Anfrage, desto günstiger und schneller. Der Kostenrechner zeigt, wie stark die Eingabegröße ins Gewicht fällt.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Kontextfenster-RechnerPasst mein Dokument ins Kontextfenster? Seiten oder Wörter eingeben, für alle Modelle prüfen.
Öffnen

Auch hilfreich: Antwortzeit-Rechner · max_tokens-Rechner

Weiterlesen

Weitere Artikel

  1. Warum deutsche Texte mehr Tokens brauchen als englischeDeutsche Texte brauchen meist 20 bis 50 Prozent mehr Tokens als englische. Woran das liegt, was es kostet und was man dagegen tun kann.
  2. Temperatur und Top-p erklärt: So steuern Sie KI-AntwortenTemperatur und Top-p erklärt: was die Einstellungen bei Sprachmodellen bewirken, welche Werte für Fakten, Texte und Ideen passen und was bei neuen Modellen gilt.
  3. Was ist ein LLM? Große Sprachmodelle einfach erklärtWas ist ein LLM? Wie große Sprachmodelle wie GPT, Claude und Gemini funktionieren, was sie gut können, wo ihre Grenzen liegen und was sie kosten.