Warum deutsche Texte mehr Tokens brauchen als englische
Deutsche Texte brauchen mehr Tokens. Wer einen Text einmal auf Deutsch und einmal auf Englisch durch den Token-Zähler schickt, sieht es sofort: Die deutsche Fassung braucht spürbar mehr Tokens. Das hat drei Gründe, und alle liegen im Tokenizer.
Grund 1: Trainingsdaten
Ein Tokenizer lernt seine Wortstücke aus einer großen Textsammlung. Häufige Zeichenfolgen bekommen ein eigenes Token, seltene werden aus kleineren Teilen zusammengesetzt. Da Englisch in diesen Sammlungen weit überwiegt, sind englische Wörter und Endungen gut abgedeckt. Deutsche Wörter zerfallen häufiger in zwei, drei oder mehr Stücke.
Grund 2: Zusammengesetzte Wörter
„Krankenversicherungsbeitrag“ ist auf Englisch „health insurance contribution“: drei kurze, häufige Wörter, drei Tokens. Das deutsche Wort kennt kein Tokenizer als Ganzes; es wird in vier bis sechs Stücke zerlegt. Lange Komposita sind der größte einzelne Kostentreiber deutscher Texte.
Grund 3: Umlaute und ß
Tokenizer arbeiten auf Byte-Ebene. „ä“, „ö“, „ü“ und „ß“ bestehen in der üblichen Kodierung aus zwei Bytes. Fehlt ein passendes Token für die Kombination mit den Nachbarbuchstaben, zählt der Umlaut extra. In einem normalen deutschen Text kommt alle paar Wörter ein Umlaut vor, das summiert sich.
Wie groß ist der Unterschied?
Für die Tokenizer von OpenAI liegt der Aufschlag für Deutsch meist bei 20 bis 40 Prozent gegenüber dem englischen Gegenstück. Bei älteren Tokenizern mit kleinerem Wortschatz waren es auch 50 Prozent und mehr. Neuere Tokenizer mit größerem Wortschatz (200.000 statt 100.000 Einträge) haben die Lücke verkleinert, aber nicht geschlossen. Andere Anbieter verhalten sich ähnlich; genaue Zahlen hängen vom Modell und vom Text ab.
Was man tun kann
- Nichts erzwingen. Englische Prompts für deutsche Aufgaben sparen zwar Tokens in der Anweisung, verschlechtern aber manchmal die deutsche Ausgabe. Testen Sie es, bevor Sie umstellen.
- Anweisungen knapp halten. Der eigentliche Inhalt lässt sich nicht kürzen, die Anweisungen drumherum schon. Floskeln und Wiederholungen raus.
- Caching nutzen. Lange deutsche Systemanweisungen kosten bei jeder Anfrage. Als Cache markiert, fallen sie kaum noch ins Gewicht.
- Mit echten Texten rechnen. Bei Kostenschätzungen nicht die englische Faustregel „vier Zeichen pro Token“ anwenden, sondern eher 3,5 Zeichen. Oder gleich den eigenen Text zählen.
Zum Nachrechnen
Der Token-Zähler zeigt Ihnen die Zerlegung Ihres Textes Token für Token. Dort sehen Sie, welche Wörter besonders viele Stücke brauchen. Der Kostenrechner übersetzt die Tokenzahl dann in Euro.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.