Gemini 3.8 Flash TTS: Sprachausgabe mit über 2.000 Stimmen
Google hat neue Modelle für Sprachausgabe vorgestellt. Gemini 3.8 Flash TTS und Flash-Lite TTS sprechen mit über 2.000 Stimmen in mehr als 100 Sprachen und Dialekten.
Die Modelle können eine Stimme aus einer 30 Sekunden langen Aufnahme nachbilden. In Ranglisten für Stimmgestaltung und Sprachqualität landeten sie laut Google auf Platz eins. Alle erzeugten Aufnahmen tragen ein unsichtbares Wasserzeichen (SynthID) und Herkunftsangaben nach dem C2PA-Standard.
Einsatzfelder sind Vorlesefunktionen, Sprachassistenten, Hörbücher und die Vertonung von Videos. Das Klonen von Stimmen birgt zugleich Missbrauchsrisiken, etwa für Betrugsanrufe; die Wasserzeichen sollen helfen, KI-Stimmen zu erkennen.
KI-Stimmen, die echt wirken, müssen nach der KI-Verordnung gekennzeichnet werden. Was genau gilt, erklärt KI-Kennzeichnungspflicht; Hinweistexte erstellt der KI-Kennzeichnungs-Generator.
Quellen
Eigene Zusammenfassung auf Grundlage der genannten Quellen, erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Illustration: Tokenlabor, per Programm gezeichnet, kein KI-Bild.


