Mehrsprachige KI-Anwendungen: Chatbots und Tools für viele Sprachen
Mehrsprachige KI-Anwendungen sind mit großen Sprachmodellen einfacher geworden: Die meisten Modelle verstehen und schreiben viele Sprachen, ohne dass Sie für jede eine eigene Lösung brauchen. Trotzdem gibt es Stolpersteine, etwa bei der Wahl der Antwortsprache, bei der Suche in Dokumenten und bei den Kosten.
Die Antwortsprache steuern
Ohne klare Anweisung antworten Modelle meist in der Sprache der Frage, aber nicht immer. Enthält der Kontext viele deutsche Dokumente, antwortet das Modell auf eine englische Frage manchmal auf Deutsch. Bewährt hat sich:
- die Sprache explizit festlegen, etwa über eine Einstellung des Nutzers oder die erkannte Sprache der Frage
- im Systemprompt eindeutig formulieren: „Antworte immer auf <Sprache>, unabhängig von der Sprache der Dokumente.“
- die Anweisung am Ende des Prompts wiederholen, wenn viel anderssprachiger Kontext folgt
Prompts: eine Sprache oder viele?
Ein Systemprompt auf Englisch oder Deutsch funktioniert auch für Antworten in anderen Sprachen. Sie müssen nicht für jede Sprache einen eigenen Prompt pflegen. Achten Sie aber auf Beispiele im Prompt: Few-Shot-Beispiele in nur einer Sprache können die Antwortsprache beeinflussen. Ob Prompts besser auf Deutsch oder Englisch geschrieben werden, diskutiert Prompts auf Deutsch oder Englisch.
Mehrsprachige Suche in Dokumenten
Bei RAG-Anwendungen liegt die Wissensbasis oft nur in einer Sprache vor, die Fragen kommen aber in vielen. Dafür gibt es drei Wege:
- Mehrsprachige Embeddings: Gute mehrsprachige Embedding-Modelle bilden gleiche Bedeutungen in verschiedenen Sprachen nah beieinander ab. Eine spanische Frage findet dann die deutsche Textstelle.
- Frage übersetzen: Die Frage wird vor der Suche in die Sprache der Dokumente übersetzt. Das hilft vor allem bei der Stichwortsuche.
- Dokumente übersetzen: Die Wissensbasis wird vorab in alle Zielsprachen übersetzt. Aufwendig, aber bei wichtigen Inhalten die verlässlichste Lösung.
Wie Stichwort- und Vektorsuche zusammenspielen, beschreibt Hybride Suche.
Kosten je Sprache
Tokenizer sind auf englische Texte optimiert. Derselbe Inhalt braucht auf Deutsch meist mehr Tokens, in Sprachen mit anderen Schriftsystemen teils deutlich mehr. Das wirkt sich auf Kosten, Antwortzeit und den nutzbaren Platz im Kontextfenster aus. Den Unterschied erklärt Tokens auf Deutsch und Englisch; was Übersetzungen kosten, rechnet der Übersetzungskosten-Rechner aus.
Qualität je Sprache prüfen
Modelle sind nicht in allen Sprachen gleich gut. In weit verbreiteten Sprachen ist die Qualität meist hoch, in kleineren Sprachen können Grammatik, Fachbegriffe und Höflichkeitsformen leiden. Testen Sie jede Zielsprache mit eigenen Beispielen und lassen Sie Muttersprachler Stichproben bewerten. Achten Sie dabei auf:
- Anrede (Sie oder du, entsprechende Formen in anderen Sprachen)
- Datums-, Zahlen- und Währungsformate
- Fachbegriffe und Produktnamen, die nicht übersetzt werden sollen
- kulturelle Unterschiede bei Beispielen und Ton
Eine Liste nicht zu übersetzender Begriffe im Systemprompt verhindert viele Fehler. Legen Sie außerdem für jede Zielsprache einige feste Testfragen an und lassen Sie diese nach jeder Änderung an Prompt oder Modell erneut laufen. Hinweise für Übersetzungsaufträge gibt Mit KI übersetzen; den systematischen Testaufbau beschreibt LLM-Anwendungen testen.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.