max_tokens berechnen
max_tokens berechnen: Wie hoch muss das Ausgabelimit für eine bestimmte Antwortlänge sein? Wörter in Tokens umrechnen, mit Puffer für Format und Reasoning.
| max_tokens | ergibt etwa | Normseiten |
|---|
Tokens für Wörter: das Ausgabelimit richtig setzen
Mit max_tokens (bei OpenAI max_completion_tokens, bei Gemini maxOutputTokens) legen Sie das Ausgabelimit einer Anfrage fest. Ist es zu knapp, endet die Antwort mitten im Satz: eine abgeschnittene Antwort mit dem Stoppgrund „length“ oder „max_tokens“. Bei JSON ist sie dann ungültig.
Das Limit kostet nichts, berechnet werden nur die tatsächlich erzeugten Tokens. Ein großzügiger Puffer ist deshalb günstiger als eine abgeschnittene Antwort, die wiederholt werden muss. Die gewünschte Antwortlänge steuern Sie besser im Prompt („etwa 300 Wörter“) und nicht über max_tokens. Bei Reasoning-Modellen zählen die Denk-Tokens je nach Anbieter mit in das Limit.
Häufige Fragen
Was bedeutet max_tokens?
Die Obergrenze für die Zahl der Tokens, die ein Modell in einer Antwort erzeugen darf. Sie begrenzt nur die Ausgabe, nicht die Eingabe.
Warum ist meine Antwort abgeschnitten?
Das Ausgabelimit wurde erreicht. Erkennbar am Stoppgrund „length“ (OpenAI), „max_tokens“ (Anthropic) oder „MAX_TOKENS“ (Gemini). Lösung: max_tokens erhöhen oder kürzere Antworten anfordern.
Wie viele Tokens für 1.000 Wörter?
Auf Deutsch etwa 1.450 Tokens, auf Englisch etwa 1.300. Mit Puffer sollten Sie max_tokens auf 1.800 bis 2.000 setzen.
Kostet ein hohes max_tokens mehr?
Nein, berechnet werden nur tatsächlich erzeugte Tokens. Einige Anbieter prüfen aber, ob Eingabe plus max_tokens ins Kontextfenster passt.
Zum Weiterlesen
- max_tokens erklärt: Antwortlänge richtig begrenzenmax_tokens erklärt: Was das Ausgabelimit bei OpenAI, Claude und Gemini bewirkt, wie Sie den richtigen Wert finden und warum abgeschnittene Antworten teurer sind als ein Puffer.
- Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
- Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
Das könnte auch helfen
Antwortzeit-Rechnerneu
Wie lange dauert eine KI-Antwort? Wartezeit aus Antwortlänge, Geschwindigkeit und Nachdenken.
ÖffnenTemperatur-Simulator
Sehen, wie Temperatur, Top-p und Top-k die Wortwahl eines Sprachmodells verändern.
ÖffnenModell-Finder
Welches KI-Modell passt? Aufgabe, Kontext und Budget angeben, passende Modelle nach Preis erhalten.
ÖffnenToken-Zähler
Tokens eines Textes oder einer Datei (PDF, Word, TXT) zählen, mit Kosten für alle Modelle.
ÖffnenKontextfenster-Rechner
Passt mein Dokument ins Kontextfenster? Seiten oder Wörter eingeben, für alle Modelle prüfen.
ÖffnenFormat-Vergleich
JSON, CSV, YAML oder Markdown: welches Datenformat die wenigsten Tokens kostet.
Öffnen