Microsoft bringt eigene Sprachmodelle für Echtzeit-Transkription und Stimmen

ModelleMit KI erstellt · redaktionell geprüft
Illustration zur Meldung: Microsoft bringt eigene Sprachmodelle für Echtzeit-Transkription und Stimmen

Microsoft AI hat am 1. Oktober drei neue Sprachmodelle vorgestellt: ein Modell für Transkription in Echtzeit und zwei Modelle für synthetische Stimmen. Damit lassen sich Sprachagenten vollständig mit Microsoft-Modellen bauen.

MAI-Transcribe-2-Streaming schreibt Gesprochenes mit, während noch geredet wird, und korrigiert die Zwischenergebnisse, sobald mehr Kontext vorliegt. Erste Ergebnisse sollen nach gut 100 Millisekunden vorliegen. Das Modell unterstützt 60 Sprachen und erkennt sie automatisch. Microsoft nennt eine Fehlerquote von 2,5 Prozent der Wörter und einen Einführungspreis von 0,54 Dollar pro Stunde Audio bis Ende 2026.

MAI-Voice-2.1 erweitert die Sprachausgabe von 15 auf 23 Sprachen; eine Stimme soll dabei in allen Sprachen mit passendem Akzent sprechen. Die schnellere Variante MAI-Voice-2.1-Flash ist für Anwendungen gedacht, bei denen jede Millisekunde zählt.

Die Modelle stehen über Microsoft Foundry bereit. Microsoft baut damit neben den Modellen von OpenAI und Anthropic zunehmend eigene Modelle auf.

Was das für Sie bedeutet

Bei Sprachassistenten zählt vor allem die Wartezeit bis zur ersten Antwort. Woraus sie sich zusammensetzt, zeigt der Antwortzeit-Rechner; was ein Assistent im Kundenservice leisten kann, beschreibt KI im Kundenservice.

Quellen

Themen:Microsoft & Copilot

Eigene Zusammenfassung auf Grundlage der genannten Quellen, erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Illustration: Tokenlabor, per Programm gezeichnet, kein KI-Bild.

KI-News

Weitere Meldungen

Alle Meldungen