Was ist multimodale KI? Text, Bild und Ton in einem Modell

1 Min. LesezeitStand 07.10.2026Mit KI erstellt · redaktionell geprüft

Multimodale KI verarbeitet mehr als nur Text: Sie versteht Bilder, Diagramme, Ton und teils Video und kann aus mehreren Eingaben eine gemeinsame Antwort bilden. Fast alle aktuellen Spitzenmodelle von OpenAI, Anthropic und Google sind multimodal.

Wie das funktioniert

Ein multimodales Modell wandelt jede Eingabe in Tokens um. Bei Bildern zerlegt ein eigener Bildteil das Bild in kleine Kacheln und übersetzt sie in Zahlenreihen, die das Sprachmodell wie Wörter verarbeitet. Bei Ton geschieht dasselbe mit kurzen Zeitabschnitten. Dadurch kann das Modell etwa eine Frage zu einem Foto beantworten oder ein Diagramm beschreiben.

Typische Einsätze

  • Fotos von Belegen, Rechnungen oder Formularen auslesen
  • Diagramme, Tabellen und Screenshots erklären lassen
  • Fehler auf Fotos von Geräten oder Bauteilen beschreiben
  • Gesprochene Sprache transkribieren und zusammenfassen
  • Barrierefreiheit: Bildbeschreibungen für Websites erstellen

Grenzen

Modelle lesen kleine Schrift, Handschrift und dichte Tabellen nicht immer zuverlässig. Zahlen aus Bildern sollten Sie deshalb prüfen. Auch räumliches Verständnis, etwa Abstände oder Größen, ist oft ungenau.

Was Bilder kosten

Ein Bild kostet je nach Größe einige hundert bis über tausend Tokens. Wer viele Bilder verarbeitet, sollte sie vorher auf die nötige Auflösung verkleinern. Die Kosten je Bild zeigt der Bild-Token-Rechner; wie Sie Bilder an die API senden, erklärt Bilder an die KI-API senden.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Bild-Token-RechnerWie viele Tokens ein Bild kostet, nach den Formeln von Anthropic, OpenAI und Google.
Öffnen

Auch hilfreich: Antwortzeit-Rechner · max_tokens-Rechner

Weiterlesen

Weitere Artikel

  1. Was ist Fine-Tuning? Sprachmodelle mit eigenen Daten anpassenWas ist Fine-Tuning? Wie man ein Sprachmodell mit eigenen Beispielen nachtrainiert, wann sich das lohnt, was es kostet und wann Prompts oder RAG besser sind.
  2. Mixture of Experts einfach erklärt: Warum große Modelle sparsam rechnenMixture of Experts einfach erklärt: Warum riesige Modelle pro Wort nur einen kleinen Teil nutzen und was das für Kosten, Tempo und Hardware bedeutet.
  3. Quantisierung erklärt: Sprachmodelle kleiner und schneller machenQuantisierung erklärt: Wie 4-Bit- und 8-Bit-Versionen Sprachmodelle verkleinern, wie viel Qualität das kostet und welche Stufe sich lokal eignet.