Sprache erkennen: welche Sprache ist das?

Sprache erkennen für über 30 Sprachen: Das Werkzeug bestimmt Schriftsystem, Sprache und ISO-Code eines Textes, auf Wunsch je Absatz, direkt im Browser.

–

 

Kandidaten
SpracheCodeAnteilMerkmale
Erkannte Sprachen und Schriftsystem
SchriftSprachenMerkmal
Lateinische SchriftDeutsch, Englisch, Französisch, Spanisch, Italienisch, Portugiesisch, Niederländisch, Polnisch, Tschechisch, Slowakisch, Schwedisch, Dänisch, Norwegisch, Finnisch, Türkisch, Ungarisch, Rumänisch, Kroatisch, Indonesischhäufige Funktionswörter und Sonderzeichen wie ß, ñ, ł, ř, ő, ș
KyrillischRussisch, Ukrainisch, Bulgarisch, SerbischBuchstaben wie і, ї, є (Ukrainisch), ђ, ј, љ (Serbisch), ъ ohne ы (Bulgarisch)
Griechisch, Hebräisch, Georgisch, Armenisch, Thaijeweils eine Spracheeigene Schrift
Arabische SchriftArabisch, PersischPersisch an پ, چ, ژ, گ
DevanagariHindiSchrift; Marathi und Nepali nutzen dieselbe
Chinesisch, Japanisch, KoreanischChinesisch, Japanisch, KoreanischHan-Zeichen, Kana (Japanisch), Hangul (Koreanisch)

Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.

So funktioniert die Spracherkennung

Mit diesem Werkzeug können Sie die Sprache eines Textes erkennen, etwa wenn eine E-Mail, ein Ticket oder ein Absatz in einem Dokument eingeordnet werden soll. Die Spracherkennung für Text unterstützt über 30 Sprachen und zeigt neben der wahrscheinlichsten Sprache den ISO-639-1-Code (zum Beispiel „de“, „fr“, „pl“) und weitere Kandidaten mit ihrem Anteil. Die Frage „welche Sprache ist das?“ beantwortet sie in Sekundenbruchteilen und ohne Internetverbindung.

Die Language Detection läuft in zwei Stufen. Zuerst bestimmt das Werkzeug das Schriftsystem: Kyrillisch, Griechisch, Arabisch, Hebräisch, Devanagari, Thai, Chinesisch, Japanisch (an Hiragana und Katakana erkennbar), Koreanisch (Hangul), Georgisch oder Armenisch. Innerhalb einer Schrift helfen besondere Buchstaben, etwa і und ї für Ukrainisch oder پ und گ für Persisch. Bei lateinischer Schrift zählt es häufige Funktionswörter jeder Sprache, im Deutschen etwa „und“, „der“, „nicht“, im Niederländischen „het“, „een“, „niet“, und gewichtet typische Sonderzeichen wie ß, ñ, ã, ł, ř oder ő. Die Sprache mit den meisten Treffern gewinnt, die Sicherheit hängt vom Abstand zur zweitbesten ab. Mit der Absatzerkennung können Sie die Sprache bestimmen, wenn ein Dokument mehrere Sprachen mischt.

Grenzen: Sehr kurze Texte, Eigennamen, Fachbegriffe und Listen ohne Funktionswörter lassen sich in lateinischer Schrift schlecht zuordnen. Eng verwandte Sprachen wie Dänisch und Norwegisch (Bokmål), Tschechisch und Slowakisch oder Kroatisch, Serbisch und Bosnisch in lateinischer Schrift werden nur anhand weniger Merkmale unterschieden. Für die Kosten eines Textes in verschiedenen Sprachen hilft der Token-Zähler.

Anleitung: Sprache erkennen in 4 Schritten

  1. Den Text in das Feld „Text“ einfügen oder eines der Beispiele laden.
  2. Das Ergebnis mit Sprachname und ISO-Code lesen und in der Tabelle die weiteren Kandidaten mit ihrem Anteil vergleichen.
  3. Bei gemischten Dokumenten „Je Absatz erkennen“ aktivieren, um die Sprache jedes Absatzes einzeln zu sehen.
  4. Mit „Ergebnis kopieren“ Sprache und Code übernehmen, etwa für ein lang-Attribut.

Typische Anwendungsfälle

  • Eingehende E-Mails oder Tickets vor der Weiterleitung an das passende Sprachteam einordnen.
  • Prüfen, ob eine Übersetzung vollständig ist oder noch Absätze in der Ausgangssprache enthält.
  • Das richtige lang-Attribut für Webseiten oder Dokumente bestimmen.
  • Datensätze für KI-Projekte nach Sprache sortieren, bevor sie weiterverarbeitet werden.
Fragen

Häufige Fragen

Welche Sprachen werden erkannt?

Deutsch, Englisch, Französisch, Spanisch, Italienisch, Portugiesisch, Niederländisch, Polnisch, Tschechisch, Slowakisch, Schwedisch, Dänisch, Norwegisch, Finnisch, Türkisch, Ungarisch, Rumänisch, Kroatisch, Indonesisch, Russisch, Ukrainisch, Bulgarisch, Serbisch, Griechisch, Arabisch, Persisch, Hebräisch, Hindi, Thai, Chinesisch, Japanisch, Koreanisch, Georgisch und Armenisch.

Was bedeutet der Anteil in der Tabelle?

Er zeigt, wie sich die Treffer auf die Sprachen verteilen. Ein hoher Anteil der ersten Sprache und ein großer Abstand zur zweiten bedeuten eine sichere Erkennung.

Warum wird mein Text als unsicher eingestuft?

Meist ist er zu kurz oder enthält kaum Funktionswörter, etwa bei Stichpunkten oder Produktnamen. Fügen Sie ganze Sätze ein, dann steigt die Sicherheit.

Kann ich die Spracherkennung offline nutzen?

Ja. Nach dem Laden der Seite arbeitet das Werkzeug ohne Internetverbindung, alle Regeln stecken im Skript.

Erkennt das Werkzeug Dialekte wie Schweizerdeutsch?

Nein. Schweizerdeutsch in Mundart wird meist als Deutsch erkannt, manchmal mit geringer Sicherheit. Dialekte und regionale Varianten wie brasilianisches und europäisches Portugiesisch werden nicht unterschieden.

Wie viel Text braucht die Erkennung?

Für lateinisch geschriebene Sprachen genügen meist ein bis zwei Sätze mit zusammen 15 bis 20 Wörtern. Bei Schriften wie Griechisch, Koreanisch oder Thai reicht oft schon ein Wort.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. KI-Texte überarbeiten: So klingen sie nicht nach ChatGPTKI-Texte überarbeiten: typische Floskeln erkennen, Struktur und Ton verbessern und schon im Prompt gegensteuern, damit Texte nicht nach ChatGPT klingen.
  2. KI im Kundenservice: Einsatz, Kosten und GrenzenKI im Kundenservice: Wo Chatbots und KI-Assistenten wirklich helfen, was ein Gespräch kostet, wie Sie Qualität sichern und was rechtlich zu beachten ist.
  3. E-Mails mit KI schreiben: Prompts, Beispiele und GrenzenE-Mails mit KI schreiben: Mit welchen Prompts ChatGPT, Claude und Copilot gute Geschäfts-E-Mails formulieren, wie sie nach Ihnen klingen und was Sie nie eingeben sollten.
Weitere Werkzeuge

Das könnte auch helfen

Alle 558 Werkzeuge