Sprachassistent mit KI bauen: Von der Spracheingabe zur gesprochenen Antwort
Einen Sprachassistent mit KI bauen ist heute auch für kleinere Teams machbar. Die Bausteine Spracherkennung, Sprachmodell und Sprachausgabe gibt es als Dienste, und einige Anbieter haben Modelle, die gesprochene Sprache direkt verarbeiten. Die größte Herausforderung ist meist nicht die Intelligenz, sondern die Geschwindigkeit: Gespräche wirken nur natürlich, wenn die Antwort schnell kommt.
Zwei Bauweisen
- Kette aus drei Bausteinen: Spracherkennung wandelt Sprache in Text, ein Sprachmodell erzeugt die Antwort, eine Sprachausgabe (Text-to-Speech) liest sie vor. Jeder Baustein ist austauschbar, und Sie können die Texte protokollieren und prüfen.
- Echtzeit-Sprachmodell: Ein Modell nimmt Audio entgegen und antwortet direkt mit Audio. Das ist oft schneller und klingt natürlicher, bietet aber weniger Kontrolle über einzelne Schritte.
Latenz: die wichtigste Größe
In einem Gespräch fallen längere Pausen sofort auf. Bei der Kette addieren sich die Wartezeiten: Erkennen, dass der Nutzer fertig ist, Text erkennen, erste Tokens erzeugen, erste Audiodaten erzeugen. Hilfreich sind:
- Streaming überall: Spracherkennung, Modell und Sprachausgabe arbeiten mit Teilstücken, statt auf vollständige Ergebnisse zu warten.
- Satzweise vorlesen: Sobald der erste Satz fertig ist, beginnt die Ausgabe.
- Schnelle Modelle: Für Sprachdialoge reichen oft kleinere, schnelle Modelle.
- Kurze Antworten: Im Systemprompt knappe, gesprochene Sprache verlangen.
Die Wartezeit bis zur ersten Antwort schätzt der Antwortzeit-Rechner; Hintergründe stehen unter Latenz von KI-Anwendungen.
Gesprächsführung
- Sprechpausen erkennen: Eine Erkennung des Sprachendes entscheidet, wann der Nutzer fertig ist. Zu früh unterbricht, zu spät wirkt träge.
- Unterbrechen erlauben: Spricht der Nutzer dazwischen, sollte die Ausgabe sofort stoppen.
- Für das Ohr schreiben: keine Tabellen, Aufzählungszeichen oder Links. Zahlen, Daten und Abkürzungen so formulieren, wie man sie spricht.
- Bestätigen bei Wichtigem: Namen, Termine und Nummern wiederholen lassen, weil Spracherkennung sich verhören kann.
Werkzeuge anbinden
Ein Sprachassistent wird erst nützlich, wenn er handeln kann: Termin nachsehen, Bestellstatus abfragen, an einen Menschen übergeben. Das geschieht wie bei Text-Agenten über Werkzeugaufrufe; siehe KI-Agenten programmieren. Planen Sie immer einen Weg zu einem Menschen ein.
Für Telefonanwendungen kommt die Anbindung an die Telefonie hinzu, etwa über einen Telefonie-Anbieter, der Anrufe als Audiostream an Ihre Anwendung weiterleitet. Die Audioqualität am Telefon ist geringer als bei einem Mikrofon am Rechner; testen Sie die Spracherkennung deshalb mit echten Anrufen, Dialekten und Hintergrundgeräuschen.
Kosten
Abgerechnet wird je Baustein unterschiedlich: Spracherkennung meist nach Audiominuten, Sprachmodelle nach Tokens, Sprachausgabe nach Zeichen oder Minuten. Echtzeit-Sprachmodelle rechnen Audio-Tokens ab, die teurer sein können als Text-Tokens. Prüfen Sie die aktuellen Preisseiten der Anbieter und rechnen Sie mit einer typischen Gesprächsdauer. Für den Textteil hilft der KI-Kosten-Rechner.
Recht und Datenschutz
Stimmen sind personenbezogene Daten. Für Aufzeichnung und Verarbeitung braucht es eine Rechtsgrundlage, Transparenz und Verträge mit den Dienstleistern. Seit dem 2. August 2026 gelten außerdem die Transparenzpflichten nach Art. 50 der KI-Verordnung: Menschen müssen erkennen können, dass sie mit einer KI sprechen, sofern das nicht offensichtlich ist. Hinweise dazu gibt KI-Kennzeichnungspflicht. Das ist keine Rechtsberatung; lassen Sie den konkreten Einsatz prüfen.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.