Gemini-API-Kosten verstehen: Pro, Flash und Flash-Lite
Gemini-API-Kosten folgen demselben Grundprinzip wie bei anderen Anbietern: Bezahlt wird je Million Eingabe- und Ausgabe-Tokens. Google hat aber einige Besonderheiten, etwa einen Aufschlag bei sehr langen Eingaben, zeitlich befristete Aktionspreise und eine kostenlose Stufe zum Ausprobieren.
Die Modellfamilien
- Gemini Pro (aktuell Gemini 3.1 Pro): das stärkste Modell, rund 2 Dollar Eingabe und 12 Dollar Ausgabe je Million Tokens.
- Gemini Flash (etwa Gemini 3.5 Flash oder Gemini 3.8 Flash): schnell und günstiger, für die meisten Alltagsaufgaben ausreichend.
- Gemini Flash-Lite: die günstigste Stufe, gedacht für hohe Mengen einfacher Anfragen.
| Modell | Eingabe / 1 Mio. | Ausgabe / 1 Mio. | Kontext |
|---|---|---|---|
| Gemini 2.5 Flash-Lite | 0,089 € | 0,36 € | 1.000.000 |
| Gemini 3.1 Flash-Lite | 0,22 € | 1,34 € | 1.000.000 |
| Gemini 3.5 Flash-Lite | 0,27 € | 2,24 € | 1.000.000 |
| Gemini 2.5 Flash | 0,27 € | 2,24 € | 1.000.000 |
| Gemini 3.8 Flash | 0,67 € | 3,36 € | 1.000.000 |
| Gemini 2.5 Pro | 1,12 € | 8,95 € | 1.000.000 |
| Gemini 3.5 Flash | 1,34 € | 8,05 € | 1.000.000 |
| Gemini 3.1 Pro | 1,79 € | 10,74 € | 1.000.000 |
Listenpreise Stand 07.10.2026, umgerechnet zum EZB-Kurs vom 07.10.2026.
Für Gemini 3.8 Flash gilt laut Google ein Aktionspreis bis zum 31. Dezember 2026. Planen Sie bei längerfristigen Projekten ein, dass der Preis danach steigen kann.
Aufschlag bei langen Eingaben
Bei den Pro-Modellen gilt der Grundpreis nur bis 200.000 Eingabe-Tokens pro Anfrage. Darüber kostet die Eingabe das Doppelte und die Ausgabe das Anderthalbfache. Das betrifft vor allem Anwendungen, die sehr lange Dokumente oder ganze Codebasen in einer Anfrage schicken. Ob Ihr Material über diese Grenze kommt, zeigt der Kontextfenster-Rechner. Oft ist es günstiger, Dokumente aufzuteilen oder nur relevante Abschnitte per RAG mitzuschicken.
Kostenlose Stufe und bezahlte Stufe
Über Google AI Studio lassen sich viele Gemini-Modelle mit einer kostenlosen Stufe testen. Die Grenzen sind dort eng, und Google behält sich vor, Eingaben der kostenlosen Stufe zur Verbesserung der Produkte zu nutzen. Für Firmendaten und personenbezogene Daten ist deshalb die bezahlte Stufe oder der Zugang über Vertex AI in Google Cloud der richtige Weg. Mehr zu den Grenzen kostenloser Angebote steht in Kostenlose KI-Tools und ihre Grenzen.
Rabatte: Caching und Batch
Neuere Gemini-Modelle cachen wiederholte Eingaben automatisch und berechnen sie günstiger. Zusätzlich gibt es ausdrückliches Caching, bei dem für die Speicherdauer eine Gebühr anfällt. Über die Batch-Schnittstelle gibt Google 50 Prozent Rabatt auf Anfragen, die nicht sofort beantwortet werden müssen. Was beide Rabatte gemeinsam bringen, rechnet der Spar-Rechner.
Thinking bei Gemini
Die aktuellen Gemini-Modelle können vor der Antwort nachdenken. Diese Denk-Tokens werden als Ausgabe berechnet. Wo es möglich ist, sollten Sie das Denkbudget passend zur Aufgabe begrenzen. Was das kostet, zeigt der Reasoning-Kostenrechner.
So schätzen Sie Ihre Kosten
- Typische Anfrage mit dem Token-Zähler messen.
- Anfragen pro Monat schätzen.
- Mit Flash beginnen und Pro nur einsetzen, wenn die Qualität nicht reicht.
- Die Monatskosten im KI-Kostenrechner mit mehreren Modellen vergleichen.
Bilder, Audio und Video
Gemini verarbeitet neben Text auch Bilder, Audio und Video. Diese Eingaben werden in Tokens umgerechnet und wie Text abgerechnet, bei manchen Modellen mit eigenen Preisen für Audio. Ein langes Video kann so schnell Hunderttausende Tokens ergeben und die Grenze für den Preisaufschlag überschreiten. Wie viele Tokens ein Bild verursacht, schätzt der Bild-Token-Rechner. Kürzen Sie Videos auf den relevanten Ausschnitt und senken Sie die Auflösung von Bildern, wenn Details nicht nötig sind.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.