max_tokens erklärt: Antwortlänge richtig begrenzen

1 Min. LesezeitStand 07.10.2026Mit KI erstellt · redaktionell geprüft

Mit max_tokens legen Sie fest, wie viele Tokens ein Modell höchstens als Antwort erzeugen darf. Der Parameter ist bei Anthropic Pflicht, bei OpenAI (max_completion_tokens) und Gemini (maxOutputTokens) optional, und er wird oft missverstanden.

Was max_tokens tut und was nicht

  • Es ist eine Obergrenze, kein Ziel. Das Modell schreibt nicht länger, nur weil das Limit hoch ist.
  • Wird die Grenze erreicht, endet die Antwort mitten im Satz. Der Stoppgrund lautet dann „length“, „max_tokens“ oder „MAX_TOKENS“.
  • Es zählt nur die Ausgabe, nicht die Eingabe.
  • Bezahlt werden nur tatsächlich erzeugte Tokens, nicht das Limit.

Den richtigen Wert finden

Rechnen Sie von der gewünschten Länge aus: Ein deutsches Wort entspricht etwa 1,45 Tokens, Markdown und JSON brauchen mehr. Für 500 Wörter Fließtext sind das gut 700 Tokens; mit 25 Prozent Puffer setzen Sie max_tokens auf rund 900. Der max_tokens-Rechner rechnet das für Format, Sprache und Modell.

Länge über den Prompt steuern

Wollen Sie kurze Antworten, sagen Sie es im Prompt: „höchstens drei Sätze“, „etwa 200 Wörter“. max_tokens als Längensteuerung führt nur zu abgeschnittenen Texten. Das Limit ist ein Sicherheitsnetz gegen ausufernde Antworten und unerwartete Kosten.

Reasoning-Modelle

Bei Modellen, die vor der Antwort nachdenken, zählen die Denk-Tokens je nach Anbieter mit in das Limit. Ein zu knappes max_tokens kann dann dazu führen, dass das Modell nach dem Nachdenken gar keine Antwort mehr schreibt. Planen Sie großzügig und setzen Sie den Denkaufwand separat.

Abgeschnittene Antworten behandeln

  • Stoppgrund im Code immer prüfen.
  • Bei JSON: Abschneiden führt zu ungültigem JSON (JSON-Fehler).
  • Lange Ausgaben in Teile zerlegen oder das Modell bitten, an der Abbruchstelle fortzusetzen.
  • Das maximale Ausgabelimit des Modells beachten; es ist meist deutlich kleiner als das Kontextfenster.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

max_tokens-RechnerWelches max_tokens für 500 Wörter? Ausgabelimit passend zur gewünschten Antwortlänge setzen.
Öffnen

Auch hilfreich: Antwortzeit-Rechner · Temperatur-Simulator

Weiterlesen

Weitere Artikel

  1. KI lokal ausführen: Sprachmodelle auf dem eigenen RechnerKI lokal ausführen ohne Cloud: welche Hardware Sie brauchen, wie viel Speicher ein Modell belegt, welche Programme es gibt und wann es sich lohnt.
  2. Model Context Protocol (MCP) einfach erklärtMCP einfach erklärt: Das Model Context Protocol verbindet KI-Assistenten mit Werkzeugen und Daten. So funktionieren MCP-Server, Clients und Sicherheit.
  3. KI-Agenten absichern: Rechte, Freigaben und ProtokolleKI-Agenten absichern: Mit minimalen Rechten, Freigaben durch Menschen, Schutz vor Prompt Injection und lückenlosen Protokollen bleiben Agenten kontrollierbar.