Byte Pair Encoding: So zerlegt ein Tokenizer Text

2 Min. LesezeitStand 07.10.2026Mit KI erstellt · redaktionell geprüft

Byte Pair Encoding (BPE) ist das Verfahren, mit dem fast alle großen Sprachmodelle Text in Tokens zerlegen. Es erklärt, warum „Haus“ ein Token ist, „Donaudampfschifffahrt“ aber fünf, und warum dieselbe Seite in verschiedenen Modellen unterschiedlich viel kostet.

Die Idee: häufige Paare zusammenfassen

BPE beginnt mit einzelnen Bytes, also Buchstaben und Zeichen. Dann zählt es in einer großen Textsammlung, welches Paar am häufigsten nebeneinander steht, etwa „e“ und „n“, und macht daraus ein neues Zeichen „en“. Das wiederholt sich viele tausend Mal: aus „en“ und „t“ wird „ent“, später vielleicht „ung“, „die“ oder „ the“. Am Ende steht ein Vokabular mit 100.000 bis 260.000 Einträgen.

Was daraus folgt

  • Häufige Wörter sind ein Token. „und“, „the“ oder „Haus“ kommen so oft vor, dass sie ein eigenes Token bekommen haben.
  • Seltene Wörter werden zerlegt. Lange Komposita, Fachbegriffe und Namen bestehen aus mehreren Stücken.
  • Leerzeichen gehören dazu. „ Haus“ mit Leerzeichen davor ist ein anderes Token als „Haus“ am Zeilenanfang.
  • Nichts ist unbekannt. Weil BPE auf Bytes aufbaut, lässt sich jeder Text darstellen, auch Emojis und chinesische Zeichen, nur eben in mehr Tokens.

Warum Deutsch teurer ist

Die Vokabulare werden überwiegend mit englischem Text gelernt. Englische Wörter landen deshalb öfter vollständig im Vokabular, deutsche Wörter werden häufiger zerlegt. Ein deutscher Text braucht etwa 1,45 Tokens pro Wort, ein englischer rund 1,3. Details und Messwerte im Artikel Warum deutsche Texte mehr Tokens brauchen.

Jeder Anbieter hat seinen eigenen Tokenizer

OpenAI veröffentlicht seinen Tokenizer (o200k), deshalb lassen sich GPT-Tokens exakt zählen. Anthropic und Google nennen ihre Tokenizer nicht vollständig; für denselben deutschen Text zählen aktuelle Claude-Modelle rund ein Drittel mehr Tokens als GPT. Für Kostenvergleiche heißt das: Nicht nur der Preis pro Token zählt, sondern auch, wie viele Tokens ein Modell für Ihren Text braucht. Der Token-Zähler zeigt die Zerlegung live und rechnet die Unterschiede ein.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Token-ZählerTokens eines Textes oder einer Datei (PDF, Word, TXT) zählen, mit Kosten für alle Modelle.
Öffnen

Auch hilfreich: Antwortzeit-Rechner · max_tokens-Rechner

Weiterlesen

Weitere Artikel

  1. Reasoning-Modelle: Wann sich das Nachdenken lohntReasoning-Modelle denken vor der Antwort nach. Wann das bessere Ergebnisse bringt, was die Denk-Tokens kosten und wie Sie den Denkaufwand sinnvoll einstellen.
  2. Embeddings erklärt: Wie KI Bedeutung in Zahlen fasstEmbeddings erklärt: Wie Texte zu Zahlenreihen werden, warum sich so Bedeutung vergleichen lässt und wofür Sie Embeddings in Suche, RAG und Klassifizierung nutzen.
  3. Kann KI rechnen? Warum Sprachmodelle sich verrechnenKann KI rechnen? Warum Sprachmodelle bei Zahlen und Zählaufgaben Fehler machen, wie Tokens und Wahrscheinlichkeiten das erklären und wie Sie trotzdem richtige Ergebnisse bekommen.