Token-Dichte: Tokens pro Zeichen je Sprache

Token-Dichte im Vergleich: Derselbe Text in 15 Sprachen, gezählt mit dem o200k-Tokenizer, zeigt Tokens pro Zeichen und den Faktor gegenüber Englisch.

Token-Dichte je Sprache
SpracheZeichenBytes (UTF-8)TokensTokens je 100 ZeichenZeichen je TokenFaktor

Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.

Warum Sprachen unterschiedlich viele Tokens brauchen

Die Token-Dichte gibt an, wie viele Tokens ein Sprachmodell für einen Text braucht, hier gemessen als Tokens pro Zeichen und als Faktor gegenüber einer Bezugssprache. Das Werkzeug zählt mit dem Tokenizer o200k_base, den OpenAI für GPT-4o und neuere Modelle verwendet; er wird beim ersten Aufruf einmalig (rund 2 MB) geladen und läuft dann vollständig im Browser. Vorbelegt ist derselbe kurze Text in 15 Sprachen, sinngemäß übersetzt, damit Inhalt und Länge vergleichbar sind.

Der Vergleich zeigt, wie unterschiedlich die Token-Effizienz ausfällt. Deutsch und Englisch liegen nah beieinander, Deutsch braucht wegen langer zusammengesetzter Wörter meist etwas mehr Tokens. Sprachen mit anderer Schrift wie Griechisch, Hindi oder Arabisch werden oft in deutlich kleinere Stücke zerlegt. Japanisch und Chinesisch haben wenige Zeichen, aber viele Tokens je Zeichen. Weil Anbieter nach Tokens abrechnen und das Kontextfenster in Tokens begrenzt ist, kostet derselbe Inhalt in manchen Sprachen ein Vielfaches.

Grenzen: Ein solcher Tokenizer-Sprachen-Vergleich gilt nur für diesen Tokenizer und diesen Text. Claude, Gemini, Llama oder Mistral nutzen eigene Tokenizer mit anderem Vokabular; die Tendenz ist ähnlich, die genauen Zahlen nicht. Kurze Texte schwanken stärker, fügen Sie für belastbare Werte längere eigene Texte ein. Einzelne Texte zählen Sie mit dem Token-Zähler, Wörter in Tokens schätzt der Wörter-Token-Umrechner.

Anleitung: Token-Dichte in 4 Schritten

  1. Die Tabelle mit dem Beispieltext in 15 Sprachen wird automatisch berechnet, sobald der Tokenizer geladen ist.
  2. Im Feld „Texte je Sprache“ eigene Übersetzungen im Format Sprache | Text ergänzen oder ändern.
  3. Mit „Bezugssprache“ festlegen, mit welcher Sprache die anderen verglichen werden.
  4. Tokens, Tokens je Zeichen und den Faktor gegenüber der Bezugssprache ablesen und mit „Tabelle kopieren“ übernehmen.

Typische Anwendungsfälle

  • Kosten mehrsprachiger Anwendungen schätzen: Erkennen, um wie viel teurer ein Chatbot auf Polnisch oder Japanisch ist als auf Englisch.
  • Kontext planen: Abschätzen, wie viel Text einer Sprache in ein Kontextfenster passt.
  • Übersetzungen kalkulieren: Den Faktor zwischen Quell- und Zielsprache für Budgets verwenden.
Fragen

Häufige Fragen

Braucht Deutsch mehr Tokens als Englisch?

Meist ja, typischerweise einige zehn Prozent mehr für denselben Inhalt. Wie viel genau, hängt vom Text ab; die Tabelle zeigt den Faktor für das Beispiel und für eigene Texte.

Welche Sprachen sind besonders teuer?

Sprachen mit Schriften, die im Trainingsmaterial des Tokenizers seltener vorkommen, etwa Hindi, Griechisch oder Arabisch, brauchen oft deutlich mehr Tokens als Englisch.

Kann ich eigene Texte vergleichen?

Ja. Schreiben Sie je Zeile den Namen der Sprache, einen senkrechten Strich und den Text. Für einen fairen Vergleich sollten alle Zeilen denselben Inhalt haben.

Werden meine Texte übertragen?

Nein. Der Tokenizer wird einmal als Datei von dieser Website geladen, gezählt wird im Browser.

Warum braucht Englisch meist die wenigsten Tokens?

Tokenizer werden auf großen Textmengen trainiert, in denen Englisch überwiegt. Häufige englische Wörter bekommen eigene Tokens, seltenere Sprachen werden in kleinere Stücke zerlegt.

Gelten die Werte auch für Claude oder Gemini?

Nur ungefähr. Jeder Anbieter nutzt einen eigenen Tokenizer. Die Reihenfolge der Sprachen ist meist ähnlich, die genauen Zahlen unterscheiden sich.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
  2. Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
  3. Warum deutsche Texte mehr Tokens brauchen als englischeDeutsche Texte brauchen meist 20 bis 50 Prozent mehr Tokens als englische. Woran das liegt, was es kostet und was man dagegen tun kann.
Weitere Werkzeuge

Das könnte auch helfen

Alle 558 Werkzeuge