Was ist Inferenz bei KI? Vom trainierten Modell zur Antwort

2 Min. LesezeitStand 08.10.2026Mit KI erstellt · redaktionell geprüft

Inferenz bei KI bezeichnet den Moment, in dem ein fertig trainiertes Modell eine Eingabe verarbeitet und eine Antwort erzeugt. Jedes Mal, wenn Sie ChatGPT, Claude oder Gemini eine Frage stellen, läuft eine Inferenz. Im Englischen heißt das Inference, wörtlich Schlussfolgerung.

Training und Inferenz: zwei Phasen

Ein Sprachmodell durchläuft zwei grundsätzlich verschiedene Phasen:

  • Training: Das Modell lernt aus riesigen Datenmengen. Seine Parameter werden dabei laufend angepasst. Das dauert Wochen bis Monate und braucht große Rechenzentren. Mehr dazu unter Wie lernen Sprachmodelle?
  • Inferenz: Die Parameter sind fest. Das Modell wendet nur noch an, was es gelernt hat. Eine einzelne Anfrage dauert Sekunden, aber sie findet millionenfach am Tag statt.

Das Modell lernt während der Inferenz nichts dazu. Wenn es sich in einem Chat an frühere Aussagen „erinnert“, liegt das daran, dass der Verlauf bei jeder Anfrage erneut mitgeschickt wird.

Was bei einer Inferenz passiert

  1. Eingabe verarbeiten: Der gesamte Prompt wird in Tokens zerlegt und in einem Durchgang verarbeitet. Diese Phase heißt Prefill.
  2. Erstes Token erzeugen: Die Zeit bis dahin nennt man Time to First Token.
  3. Token für Token weiterschreiben: Jedes neue Token erfordert einen weiteren Rechendurchgang. Zwischenergebnisse werden in einem Cache gehalten, damit nicht alles neu berechnet werden muss.
  4. Abschluss: Die Antwort endet, wenn das Modell ein Endsignal erzeugt oder die Grenze für Ausgabe-Tokens erreicht ist.

Wie lange eine Antwort je nach Länge ungefähr dauert, können Sie mit dem Antwortzeit-Rechner abschätzen.

Inferenzkosten verstehen

Für Anbieter ist die Inferenz der größte laufende Kostenblock, und sie geben diese Kosten über Tokenpreise weiter. Ausgabe-Tokens sind teurer als Eingabe-Tokens, weil sie einzeln nacheinander berechnet werden. Große Modelle kosten mehr als kleine, weil pro Token mehr Parameter beteiligt sind. Ein Vergleich aktueller Modelle:

ModellEingabe / 1 Mio.Ausgabe / 1 Mio.Kontext
Claude Haiku 4.50,89 €4,47 €200.000
Claude Sonnet 5.51,79 €8,95 €1.000.000
GPT-5.4 mini0,67 €4,03 €400.000
GPT-5.54,47 €26,84 €1.000.000
Gemini 3.5 Flash1,34 €8,05 €1.000.000
Gemini 3.1 Pro1,79 €10,74 €1.000.000

Listenpreise Stand 07.10.2026, umgerechnet zum EZB-Kurs vom 07.10.2026.

Reasoning-Modelle erzeugen vor der eigentlichen Antwort zusätzliche Denk-Tokens. Das verbessert oft die Qualität, erhöht aber die Inferenzkosten und die Wartezeit; Hintergründe im Beitrag Reasoning-Modelle.

Wo Inferenz läuft

  • In der Cloud: der Normalfall bei ChatGPT, Claude, Gemini und den APIs.
  • Auf eigenen Servern: mit offenen Modellen, etwa aus Datenschutzgründen.
  • Auf dem Gerät: kleine Modelle laufen auf Laptops und Smartphones, siehe KI lokal ausführen.

Inferenz günstiger und schneller machen

  • Für einfache Aufgaben ein kleineres Modell wählen.
  • Wiederkehrende Prompt-Teile per Prompt Caching günstiger machen.
  • Nicht eilige Aufträge über die Batch-Verarbeitung abwickeln.
  • Ausgaben begrenzen und kein unnötig langes Format verlangen.

Was eine konkrete Anwendung kostet, rechnet der Kostenrechner durch.

Inferenz und Wartezeit

Bei der Inferenz bestimmen zwei Größen, wie schnell sich eine Anwendung anfühlt: die Zeit bis zum ersten Token und die Geschwindigkeit, mit der danach Tokens folgen. Lange Eingaben verlängern vor allem die erste Wartezeit, lange Antworten die Gesamtdauer. Mit Streaming sehen Nutzer den Text schon, während er entsteht; mehr dazu im Beitrag Streaming erklärt. Für Anwendungen mit vielen gleichzeitigen Nutzern lohnt außerdem ein Blick auf den Durchsatz-Rechner.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Antwortzeit-RechnerWie lange dauert eine KI-Antwort? Wartezeit aus Antwortlänge, Geschwindigkeit und Nachdenken.
Öffnen

Auch hilfreich: max_tokens-Rechner · Temperatur-Simulator

Weiterlesen

Weitere Artikel

  1. Parameter eines Sprachmodells: Was die Milliarden-Zahlen bedeutenParameter eines Sprachmodells erklärt: Was Parameter sind, was 8B oder 70B bedeutet, wie Modellgröße Qualität, Speicherbedarf und Kosten beeinflusst.
  2. KI-Trainingsdaten: Woher das Wissen von Sprachmodellen stammtKI-Trainingsdaten erklärt: Welche Daten in Sprachmodelle fließen, wie sie aufbereitet werden, welche Rechtsfragen bestehen und wie Sie eigene Inhalte schützen.
  3. Wissensstichtag bei KI: Warum ChatGPT und Co. nicht alles Aktuelle kennenWissensstichtag bei KI erklärt: Was der Knowledge Cutoff ist, warum Modelle aktuelle Ereignisse nicht kennen und wie Websuche und eigene Quellen helfen.