Was ist multimodale KI? Text, Bild und Ton in einem Modell
Multimodale KI verarbeitet mehr als nur Text: Sie versteht Bilder, Diagramme, Ton und teils Video und kann aus mehreren Eingaben eine gemeinsame Antwort bilden. Fast alle aktuellen Spitzenmodelle von OpenAI, Anthropic und Google sind multimodal.
Wie das funktioniert
Ein multimodales Modell wandelt jede Eingabe in Tokens um. Bei Bildern zerlegt ein eigener Bildteil das Bild in kleine Kacheln und übersetzt sie in Zahlenreihen, die das Sprachmodell wie Wörter verarbeitet. Bei Ton geschieht dasselbe mit kurzen Zeitabschnitten. Dadurch kann das Modell etwa eine Frage zu einem Foto beantworten oder ein Diagramm beschreiben.
Typische Einsätze
- Fotos von Belegen, Rechnungen oder Formularen auslesen
- Diagramme, Tabellen und Screenshots erklären lassen
- Fehler auf Fotos von Geräten oder Bauteilen beschreiben
- Gesprochene Sprache transkribieren und zusammenfassen
- Barrierefreiheit: Bildbeschreibungen für Websites erstellen
Grenzen
Modelle lesen kleine Schrift, Handschrift und dichte Tabellen nicht immer zuverlässig. Zahlen aus Bildern sollten Sie deshalb prüfen. Auch räumliches Verständnis, etwa Abstände oder Größen, ist oft ungenau.
Was Bilder kosten
Ein Bild kostet je nach Größe einige hundert bis über tausend Tokens. Wer viele Bilder verarbeitet, sollte sie vorher auf die nötige Auflösung verkleinern. Die Kosten je Bild zeigt der Bild-Token-Rechner; wie Sie Bilder an die API senden, erklärt Bilder an die KI-API senden.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.