Input- und Output-Tokens: Warum die Antwort teurer ist als die Frage
Input- und Output-Tokens werden bei allen großen KI-APIs getrennt abgerechnet, und Output-Tokens sind dabei immer teurer. Bei Claude kostet die Ausgabe das Fünffache der Eingabe, bei GPT-5.5 und Gemini 3.1 Pro das Sechsfache, bei DeepSeek und Mistral das Dreifache. Wer das versteht, kann gezielter sparen.
Was zur Eingabe zählt
Input-Tokens sind alles, was an das Modell geschickt wird, nicht nur die eigentliche Frage:
- die Systemanweisung
- der bisherige Gesprächsverlauf
- angehängte Dokumente, Suchergebnisse oder RAG-Abschnitte
- Beschreibungen von Werkzeugen bei Function Calling
- Bilder, die in Tokens umgerechnet werden
In vielen Anwendungen ist die Eingabe deshalb um ein Vielfaches länger als die Antwort. Den Anteil der Systemanweisung zeigt der Systemprompt-Kostenrechner.
Was zur Ausgabe zählt
Output-Tokens sind die erzeugte Antwort, bei Reasoning-Modellen zusätzlich die internen Denkschritte. Auch Funktionsaufrufe, die das Modell formuliert, und strukturierte JSON-Ausgaben zählen als Ausgabe.
Warum Output teurer ist
Der Preisunterschied hat technische Gründe. Die Eingabe kann das Modell in einem Durchgang parallel verarbeiten. Die Ausgabe entsteht dagegen Token für Token: Für jedes neue Token muss das Modell erneut rechnen und dabei auf alles Vorherige zugreifen. Das bindet die teure Hardware länger und lässt sich schlechter bündeln. Die Anbieter geben diesen höheren Aufwand über den Preis weiter. Mehr zur Technik erklärt Streaming erklärt.
Ein Rechenbeispiel
Ein Modell kostet 2 Dollar je Million Eingabe- und 10 Dollar je Million Ausgabe-Tokens. Eine Anfrage hat 3.000 Tokens Eingabe und 500 Tokens Ausgabe:
- Eingabe: 3.000 × 2 / 1.000.000 = 0,006 Dollar
- Ausgabe: 500 × 10 / 1.000.000 = 0,005 Dollar
Obwohl die Antwort nur ein Sechstel so lang ist, macht sie fast die Hälfte der Kosten aus. Bei Aufgaben mit langen Ausgaben, etwa Texterstellung oder Übersetzung, dominiert die Ausgabe. Den Preis je Token in andere Einheiten rechnet der Token-Preis-Umrechner um.
So senken Sie beide Seiten
Eingabe:
- Systemanweisung kürzen und Wiederholungen streichen
- Verlauf in langen Chats zusammenfassen statt komplett mitschicken
- gleichbleibenden Anfang per Caching günstiger abrechnen lassen
Ausgabe:
- gewünschte Länge im Prompt nennen („höchstens drei Sätze“)
- max_tokens als harte Obergrenze setzen, berechnen mit dem max_tokens-Rechner
- keine Wiederholung der Frage, keine Einleitungsfloskeln verlangen
- bei Reasoning-Modellen die Denkstufe passend wählen
Was die Änderungen insgesamt bringen, zeigt der KI-Kostenrechner mit getrennten Feldern für Eingabe und Ausgabe.
Welche Anwendungen eingabe- und welche ausgabelastig sind
Eingabelastig sind Aufgaben, bei denen viel Text gelesen und wenig geschrieben wird: Dokumente zusammenfassen, Fragen zu Handbüchern beantworten, Texte klassifizieren, Daten auslesen. Hier lohnt es sich, auf niedrige Eingabepreise und gute Cache-Rabatte zu achten. Ausgabelastig sind Aufgaben, bei denen viel Text entsteht: Artikel schreiben, übersetzen, Code erzeugen. Hier zählt vor allem der Ausgabepreis, und Anbieter mit kleinem Abstand zwischen Eingabe- und Ausgabepreis haben einen Vorteil. Bei Agenten wächst die Eingabe mit jedem Schritt, weil der bisherige Verlauf mitgeschickt wird.
Kennen Sie dieses Verhältnis für Ihre Anwendung, können Sie Anbieter gezielter vergleichen als mit einem einzigen Durchschnittspreis.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.