Bild-Tokens berechnen
Bild-Tokens berechnen für Claude, GPT und Gemini: Bildgröße eingeben oder ein Bild auswählen, es wird nur lokal ausgelesen.
| Modell | Tokens je Bild | je Bild | alle Bilder |
|---|
Berechnung nach den veröffentlichten Formeln von Anthropic, OpenAI und Google; bei OpenAI eine Näherung. Kosten nur für die Bildeingabe, ohne Text und Antwort. DeepSeek, xAI und Mistral veröffentlichen keine Formel und fehlen deshalb.
Häufige Fragen
Wie rechnet Claude Bilder in Tokens um?
Anthropic zerlegt Bilder in Felder von 28 × 28 Pixeln; jedes Feld ist ein Token. Zu große Bilder werden vorher verkleinert: bei Claude 4.7 und neuer auf höchstens 2.576 Pixel Kantenlänge und 4.784 Tokens, bei älteren Modellen auf 1.568 Pixel und 1.568 Tokens.
Wie rechnen OpenAI-Modelle?
Neuere GPT-Modelle zerlegen Bilder in Felder von 32 × 32 Pixeln und multiplizieren die Zahl mit einem Modellfaktor. GPT-4o und die o-Serie nutzen ein Kachelverfahren mit 512-Pixel-Kacheln plus Grundbetrag. Der Rechner bildet beide Verfahren nach; die Werte sind eine Näherung für die Detailstufe „auto“.
Und Gemini?
Bilder bis 384 × 384 Pixel kosten 258 Tokens. Größere Bilder werden in Kacheln von 768 × 768 Pixeln aufgeteilt, jede Kachel kostet 258 Tokens.
Wie spare ich bei Bildern?
Verkleinern Sie Bilder vor dem Senden auf die Größe, die für die Aufgabe nötig ist. Für das Lesen von Text reicht oft eine Kantenlänge von 1.000 bis 1.500 Pixeln; für Fotos, die nur grob beschrieben werden sollen, noch weniger.
Was kostet die Vision-API?
Die Vision-API Kosten ergeben sich aus den Bild-Tokens mal Eingabepreis des Modells. Ein Full-HD-Bild kostet je nach Modell zwischen einem Bruchteil eines Cents und gut einem Cent; der Rechner zeigt es für alle Modelle.
Welche Bildauflösung ist sinnvoll?
Die Bildauflösung bestimmt die Bildkosten direkt. Für Text im Bild reichen meist 1.000 bis 1.500 Pixel Kantenlänge; größere Bilder werden von den Anbietern ohnehin verkleinert.
Zum Weiterlesen
- Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
- Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
- Warum deutsche Texte mehr Tokens brauchen als englischeDeutsche Texte brauchen meist 20 bis 50 Prozent mehr Tokens als englische. Woran das liegt, was es kostet und was man dagegen tun kann.
Das könnte auch helfen
Antwortzeit-Rechnerneu
Wie lange dauert eine KI-Antwort? Wartezeit aus Antwortlänge, Geschwindigkeit und Nachdenken.
Öffnenmax_tokens-Rechnerneu
Welches max_tokens für 500 Wörter? Ausgabelimit passend zur gewünschten Antwortlänge setzen.
ÖffnenTemperatur-Simulator
Sehen, wie Temperatur, Top-p und Top-k die Wortwahl eines Sprachmodells verändern.
ÖffnenModell-Finder
Welches KI-Modell passt? Aufgabe, Kontext und Budget angeben, passende Modelle nach Preis erhalten.
ÖffnenToken-Zähler
Tokens eines Textes oder einer Datei (PDF, Word, TXT) zählen, mit Kosten für alle Modelle.
ÖffnenKontextfenster-Rechner
Passt mein Dokument ins Kontextfenster? Seiten oder Wörter eingeben, für alle Modelle prüfen.
Öffnen