Temperatur und Top-p erklärt: So steuern Sie KI-Antworten

2 Min. LesezeitStand 07.10.2026Mit KI erstellt · redaktionell geprüft

Temperatur und Top-p sind die zwei bekanntesten Einstellungen, mit denen man steuert, wie vorhersehbar oder abwechslungsreich ein Sprachmodell antwortet. Wer sie versteht, bekommt für Faktenaufgaben verlässlichere und für kreative Aufgaben vielfältigere Ergebnisse.

Wie ein Modell das nächste Wort wählt

Ein Sprachmodell schreibt Token für Token. Für jedes mögliche nächste Token berechnet es eine Wahrscheinlichkeit. Nach „Der Himmel ist heute“ sind „blau“ und „bewölkt“ sehr wahrscheinlich, „grün“ sehr unwahrscheinlich. Dann wird gewürfelt, gewichtet nach diesen Wahrscheinlichkeiten. Temperatur und Top-p verändern, wie gewürfelt wird. Im Temperatur-Simulator können Sie das selbst ausprobieren.

Temperatur

Die Temperatur verschärft oder glättet die Wahrscheinlichkeiten. Bei 0 gewinnt praktisch immer das wahrscheinlichste Token, die Antwort wird gleichförmig und wiederholbar. Um 1 bleibt die Verteilung, wie das Modell sie berechnet hat. Darüber bekommen unwahrscheinliche Wörter mehr Chancen; ab etwa 1,5 entsteht schnell Unsinn.

Top-p und Top-k

Top-p (auch „Nucleus Sampling“) schneidet die unwahrscheinlichen Wörter ab: Es bleiben nur so viele der besten Kandidaten im Topf, bis ihre Wahrscheinlichkeit zusammen p ergibt, etwa 90 Prozent. Top-k begrenzt einfach auf die k besten. Beide verhindern, dass seltene Ausreißer gezogen werden, ohne die Auswahl ganz einzuengen.

Welche Werte für welche Aufgabe?

  • Fakten, Datenauslese, Klassifizieren, Code: Temperatur 0 bis 0,3
  • Normale Texte, E-Mails, Zusammenfassungen: 0,5 bis 0,8
  • Ideen, Werbetexte, Geschichten: 0,9 bis 1,2

Ändern Sie möglichst nur einen der beiden Werte, Temperatur oder Top-p. Beides gleichzeitig zu verstellen macht die Wirkung schwer vorhersehbar.

Was bei neuen Modellen gilt

Bei einigen aktuellen Modellen, besonders solchen, die vor der Antwort nachdenken, lassen sich Temperatur und Top-p nicht mehr frei einstellen; die Anbieter geben die Werte fest vor. In Chat-Oberflächen wie ChatGPT oder Claude.ai sind sie ohnehin nicht zugänglich. Dort steuern Sie das Ergebnis über den Prompt: „Antworte knapp und sachlich“ oder „Nenne zehn möglichst unterschiedliche Ideen“.

Temperatur und Halluzinationen

Eine niedrige Temperatur macht Antworten wiederholbarer, aber nicht automatisch richtig. Erfundene Fakten entstehen vor allem durch fehlendes Wissen, nicht durch Zufall. Was dagegen hilft, steht im Ratgeber Halluzinationen vermeiden.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Temperatur-SimulatorSehen, wie Temperatur, Top-p und Top-k die Wortwahl eines Sprachmodells verändern.
Öffnen

Auch hilfreich: Antwortzeit-Rechner · max_tokens-Rechner

Weiterlesen

Weitere Artikel

  1. Was ist ein LLM? Große Sprachmodelle einfach erklärtWas ist ein LLM? Wie große Sprachmodelle wie GPT, Claude und Gemini funktionieren, was sie gut können, wo ihre Grenzen liegen und was sie kosten.
  2. Wie funktioniert ChatGPT? Ein Blick unter die HaubeWie funktioniert ChatGPT? Von Tokens über das Training bis zur Antwort: verständlich erklärt, was zwischen Frage und Antwort passiert und warum Fehler entstehen.
  3. Byte Pair Encoding: So zerlegt ein Tokenizer TextByte Pair Encoding erklärt: Wie Tokenizer von GPT, Claude und Gemini Text in Tokens zerlegen, warum Deutsch mehr Tokens braucht und was das für Kosten bedeutet.