LLM-Parameter im Vergleich

LLM-Parameter im Vergleich: Die Tabelle stellt API-Parameter von OpenAI, Anthropic und Google Gemini gegenüber, von max_tokens über temperature bis tool_choice.

ParameterOpenAI Chat CompletionsOpenAI ResponsesAnthropic MessagesGoogle Gemini
Endpunkt
Grundlagen
POST /v1/chat/completionsPOST /v1/responsesPOST /v1/messagesPOST /v1beta/models/{modell}:generateContent
Authentifizierung
Grundlagen
Authorization: Bearer …Authorization: Bearer …x-api-key: … und anthropic-version: 2023-06-01x-goog-api-key: …
Modell
Grundlagen
modelmodelmodelim Pfad der URL
Systemprompt
Grundlagen
Nachricht mit role system oder developerinstructionssystem auf oberster EbenesystemInstruction
Nachrichten
Grundlagen
messagesinput (Text oder Liste von Items)messages mit Rollen user und assistantcontents mit Rollen user und model
Maximale Ausgabelänge
Ausgabe
max_completion_tokens (älter: max_tokens)max_output_tokensmax_tokens (Pflichtfeld)generationConfig.maxOutputTokens
Stoppsequenzen
Ausgabe
stop (bis zu 4)–stop_sequencesgenerationConfig.stopSequences
Mehrere Antworten
Ausgabe
n––generationConfig.candidateCount
Streaming
Ausgabe
stream: true (Server-Sent Events)stream: truestream: trueMethode streamGenerateContent mit ?alt=sse
temperature
Steuerung
temperature von 0 bis 2temperature von 0 bis 2temperature von 0 bis 1generationConfig.temperature
top_p
Steuerung
top_ptop_ptop_pgenerationConfig.topP
top_k
Steuerung
––top_kgenerationConfig.topK
Wiederholungsstrafen
Steuerung
frequency_penalty, presence_penalty (−2 bis 2)––generationConfig.frequencyPenalty, presencePenalty
Startwert
Steuerung
seed––generationConfig.seed
Reasoning
Steuerung
reasoning_effortreasoning.effortthinking, z. B. {"type": "enabled", "budget_tokens": …}generationConfig.thinkingConfig
Tool-Definition
Tools
tools: [{type: "function", function: {name, description, parameters}}]tools: [{type: "function", name, description, parameters}]tools: [{name, description, input_schema}]tools: [{functionDeclarations: [{name, description, parameters}]}]
Tool-Wahl
Tools
tool_choice: auto, none, required oder {type: "function", function: {name}}tool_choice: auto, none, required oder {type: "function", name}tool_choice: {type: "auto"}, {type: "any"}, {type: "tool", name}, {type: "none"}toolConfig.functionCallingConfig.mode: AUTO, ANY, NONE
Parallele Tool-Aufrufe
Tools
parallel_tool_callsparallel_tool_callsdisable_parallel_tool_use in tool_choice–
Aufruf in der Antwort
Tools
message.tool_calls[], function.arguments als JSON-ZeichenketteItem function_call mit call_id, arguments als ZeichenketteBlock tool_use mit id, input als ObjektTeil functionCall mit name, args als Objekt
Ergebnis zurückgeben
Tools
Nachricht mit role: "tool" und tool_call_idItem function_call_output mit call_id und outputBlock tool_result mit tool_use_id in einer user-NachrichtTeil functionResponse mit name und response
JSON-Ausgabe
Formate und Eingaben
response_format: {type: "json_schema", json_schema: {…}} oder {type: "json_object"}text.format: {type: "json_schema", …}Tool mit input_schema; strukturierte Ausgaben laut DokumentationgenerationConfig.responseMimeType: "application/json" mit responseSchema
Bilder als Eingabe
Formate und Eingaben
Teil {type: "image_url", image_url: {url}}Teil {type: "input_image", image_url}Block {type: "image", source: {type: "base64" oder "url", …}}Teil inlineData mit mimeType und data
Prompt-Caching
Formate und Eingaben
automatisch ab einer Mindestlängeautomatisch ab einer Mindestlängecache_control: {type: "ephemeral"} an Inhaltsblöckenimplizit sowie explizit über cachedContents
Antworttext
Antwort
choices[0].message.contentoutput[] mit Items vom Typ message; in den SDKs output_textcontent[] mit Blöcken vom Typ textcandidates[0].content.parts[]
Abbruchgrund
Antwort
finish_reason: stop, length, tool_calls, content_filterstatus und incomplete_details.reasonstop_reason: end_turn, max_tokens, stop_sequence, tool_usefinishReason: STOP, MAX_TOKENS, SAFETY …
Token-Verbrauch
Antwort
usage.prompt_tokens, usage.completion_tokensusage.input_tokens, usage.output_tokensusage.input_tokens, usage.output_tokensusageMetadata.promptTokenCount, candidatesTokenCount
Gecachte Tokens
Antwort
usage.prompt_tokens_details.cached_tokensusage.input_tokens_details.cached_tokenscache_read_input_tokens, cache_creation_input_tokensusageMetadata.cachedContentTokenCount
Batch-Verarbeitung
Antwort
POST /v1/batches mit JSONL-DateiPOST /v1/batches mit Endpunkt /v1/responsesPOST /v1/messages/batchesMethode batchGenerateContent
Tokens vorab zählen
Antwort
lokal mit einem Tokenizersiehe DokumentationPOST /v1/messages/count_tokensMethode countTokens

„–“ bedeutet: kein entsprechender Parameter in dieser API dokumentiert. Stand: Herbst 2026.

Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.

Gleiche Idee, andere Namen

Der LLM-Parameter im Vergleich zeigt, wie dieselbe Einstellung in den vier verbreiteten Schnittstellen heißt: OpenAI Chat Completions, OpenAI Responses API, Anthropic Messages API und Google Gemini mit generateContent. Die API-Parameter ähneln sich in der Sache, unterscheiden sich aber in Namen, Ort und Wertebereich. max_tokens ist bei Anthropic Pflicht, heißt bei der Responses API max_output_tokens und liegt bei Gemini in der Gemini generationConfig als maxOutputTokens. Auch das Paar temperature top_p gibt es überall, doch Anthropic erlaubt für die Temperatur nur Werte bis 1.

Am größten sind die Unterschiede bei Tools. Die Definition steckt bei OpenAI Chat Completions in einem Objekt function, bei der Responses API direkt im Tool, bei Anthropic mit input_schema und bei Gemini in functionDeclarations. Auch tool_choice hat verschiedene Werte: Was bei OpenAI required heißt, ist bei Anthropic any und bei Gemini der Modus ANY. Wie Aufrufe und Ergebnisse im Verlauf stehen, zeigt die Tabelle im Bereich Tools; eine fertige Anfrage übersetzen Sie mit OpenAI in Anthropic umwandeln.

Die Tabelle enthält nur Angaben, die in der öffentlichen Dokumentation der Anbieter fest beschrieben sind. Ein Strich heißt, dass es dort keinen entsprechenden Parameter gibt. Nicht jedes Modell unterstützt jeden Parameter: Reasoning-Modelle lehnen teilweise temperature ab, und neue Funktionen kommen oft zuerst als Beta. Vollständige Beispielanfragen erzeugt der API-Anfrage-Generator.

Anleitung: LLM-Parameter im Vergleich in 4 Schritten

  1. Im Suchfeld einen Parameter oder ein Thema eingeben, etwa stop oder „Bilder“.
  2. Unter „Thema“ die Tabelle auf einen Bereich wie Ausgabe, Tools oder Antwort eingrenzen.
  3. In der Zeile ablesen, wie der Parameter bei den vier APIs heißt.
  4. Mit „Zeile kopieren“ die Gegenüberstellung in Notizen oder Code-Kommentare übernehmen.

Typische Anwendungsfälle

  • Beim Wechsel des Anbieters schnell die passende Entsprechung eines Parameters finden.
  • Eine eigene Abstraktionsschicht über mehrere Modell-APIs planen.
  • Verstehen, warum eine Anfrage nach dem Umstellen mit „unknown parameter“ abgelehnt wird.
  • Unterschiede bei Wertebereichen, etwa von temperature, nachschlagen.
Fragen

Häufige Fragen

Warum gibt es zwei Spalten für OpenAI?

OpenAI bietet die ältere Chat Completions API und die neuere Responses API an. Beide sind im Einsatz und unterscheiden sich in vielen Parameternamen.

Welche temperature sollte ich wählen?

Für sachliche Aufgaben wie Extraktion oder Klassifikation niedrige Werte, für kreative Texte höhere. Viele Anbieter empfehlen, entweder temperature oder top_p zu ändern, nicht beide.

Wie heißen die Parameter in den SDKs?

Die offiziellen SDKs für Python und TypeScript verwenden die gleichen Namen wie die HTTP-API. Das Gemini-SDK für Python nutzt teilweise Unterstriche statt Binnenmajuskeln, etwa max_output_tokens.

Was ist mit Mistral, DeepSeek und anderen?

Viele weitere Anbieter bieten eine mit OpenAI Chat Completions kompatible Schnittstelle. Dann gelten die Namen der ersten Spalte, oft mit Einschränkungen.

Gelten alle Parameter für alle Modelle eines Anbieters?

Nein. Reasoning-Modelle lehnen zum Beispiel teilweise temperature oder top_p ab, und neue Parameter kommen oft nur für neue Modelle. Die Tabelle zeigt die Namen in der API, nicht die Unterstützung je Modell.

Wie aktuell ist die Tabelle?

Sie gibt den Stand der öffentlichen Dokumentation der Anbieter im Herbst 2026 wieder und enthält nur Angaben, die dort fest beschrieben sind. APIs ändern sich; prüfen Sie Details vor dem Einsatz in der Dokumentation.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. RAG einfach erklärt: KI mit eigenen Dokumenten nutzenRAG einfach erklärt: wie Retrieval-Augmented Generation funktioniert, wofür man Embeddings und Vektordatenbanken braucht und was ein RAG-System kostet.
  2. Structured Outputs: Zuverlässig JSON von KI-ModellenStructured Outputs erklärt: Wie Sie mit JSON-Schema garantiert gültiges JSON von OpenAI, Claude und Gemini bekommen, statt kaputte Antworten nachträglich zu reparieren.
  3. Prompt Injection: Wie Angriffe auf KI-Systeme funktionierenPrompt Injection erklärt: wie versteckte Anweisungen in E-Mails, Dokumenten und Websites KI-Assistenten und Agenten manipulieren und welche Schutzmaßnahmen wirken.
Weitere Werkzeuge

Das könnte auch helfen

Alle 558 Werkzeuge