max_tokens berechnen

max_tokens berechnen: Wie hoch muss das Ausgabelimit für eine bestimmte Antwortlänge sein? Wörter in Tokens umrechnen, mit Puffer für Format und Reasoning.

–

 

max_tokensergibt etwaNormseiten

Tokens für Wörter: das Ausgabelimit richtig setzen

Mit max_tokens (bei OpenAI max_completion_tokens, bei Gemini maxOutputTokens) legen Sie das Ausgabelimit einer Anfrage fest. Ist es zu knapp, endet die Antwort mitten im Satz: eine abgeschnittene Antwort mit dem Stoppgrund „length“ oder „max_tokens“. Bei JSON ist sie dann ungültig.

Das Limit kostet nichts, berechnet werden nur die tatsächlich erzeugten Tokens. Ein großzügiger Puffer ist deshalb günstiger als eine abgeschnittene Antwort, die wiederholt werden muss. Die gewünschte Antwortlänge steuern Sie besser im Prompt („etwa 300 Wörter“) und nicht über max_tokens. Bei Reasoning-Modellen zählen die Denk-Tokens je nach Anbieter mit in das Limit.

Fragen

Häufige Fragen

Was bedeutet max_tokens?

Die Obergrenze für die Zahl der Tokens, die ein Modell in einer Antwort erzeugen darf. Sie begrenzt nur die Ausgabe, nicht die Eingabe.

Warum ist meine Antwort abgeschnitten?

Das Ausgabelimit wurde erreicht. Erkennbar am Stoppgrund „length“ (OpenAI), „max_tokens“ (Anthropic) oder „MAX_TOKENS“ (Gemini). Lösung: max_tokens erhöhen oder kürzere Antworten anfordern.

Wie viele Tokens für 1.000 Wörter?

Auf Deutsch etwa 1.450 Tokens, auf Englisch etwa 1.300. Mit Puffer sollten Sie max_tokens auf 1.800 bis 2.000 setzen.

Kostet ein hohes max_tokens mehr?

Nein, berechnet werden nur tatsächlich erzeugte Tokens. Einige Anbieter prüfen aber, ob Eingabe plus max_tokens ins Kontextfenster passt.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. max_tokens erklärt: Antwortlänge richtig begrenzenmax_tokens erklärt: Was das Ausgabelimit bei OpenAI, Claude und Gemini bewirkt, wie Sie den richtigen Wert finden und warum abgeschnittene Antworten teurer sind als ein Puffer.
  2. Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
  3. Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
Weitere Werkzeuge

Das könnte auch helfen

Alle 65 Werkzeuge