Transformer-Architektur erklärt: Das Bauprinzip moderner Sprachmodelle
Die Transformer-Architektur ist das Bauprinzip fast aller heutigen Sprachmodelle. Sie wurde 2017 in einem Forschungsartikel mit dem Titel „Attention Is All You Need“ vorgestellt und hat ältere Ansätze abgelöst, weil sie Texte parallel verarbeiten und Zusammenhänge über weite Strecken erfassen kann.
Das Problem, das Transformer lösen
Ältere neuronale Netze für Sprache, sogenannte rekurrente Netze, lasen einen Text Wort für Wort nacheinander. Das war langsam und machte es schwer, Bezüge über viele Sätze hinweg zu behalten. Ein Transformer Modell betrachtet dagegen alle Wörter eines Abschnitts gleichzeitig und berechnet, welche davon füreinander wichtig sind. Dadurch lässt sich das Training auf vielen Grafikprozessoren parallel ausführen, und Modelle konnten auf ihre heutige Größe wachsen.
Der Weg eines Textes durch das Modell
- Tokenisierung: Der Text wird in Tokens zerlegt, also Wörter oder Wortteile. Wie viele das sind, zeigt der Token-Zähler.
- Embeddings: Jedes Token wird in einen Zahlenvektor übersetzt, der seine Bedeutung abbildet. Dazu kommt eine Information über die Position im Text.
- Attention: In jeder Schicht berechnet das Modell für jedes Token, wie stark es auf alle anderen Tokens achten soll. Details im Beitrag Attention-Mechanismus erklärt.
- Feed-Forward-Schicht: Ein kleines neuronales Netz verarbeitet jedes Token weiter und speichert dabei viel des gelernten Wissens.
- Viele Schichten: Diese Bausteine werden dutzendfach übereinandergestapelt. Jede Schicht verfeinert das Verständnis.
- Ausgabe: Am Ende steht eine Wahrscheinlichkeitsverteilung für das nächste Token.
Encoder, Decoder und was ChatGPT nutzt
Der ursprüngliche Transformer hatte zwei Teile: einen Encoder, der den Eingabetext versteht, und einen Decoder, der daraus einen neuen Text erzeugt, etwa eine Übersetzung. Später entstanden Varianten:
- Nur Encoder: gut zum Verstehen und Klassifizieren von Texten, Grundlage vieler Embedding-Modelle.
- Nur Decoder: erzeugen Text Token für Token. Die großen Chat-Modelle gehören zu dieser Gruppe.
- Encoder-Decoder: weiterhin genutzt für Übersetzung und manche Spezialaufgaben.
Warum Transformer Text Stück für Stück schreiben
Ein Decoder-Modell erzeugt immer nur das nächste Token und hängt es an den bisherigen Text an. Dann beginnt die Berechnung erneut. Deshalb erscheinen Antworten im Chat nach und nach, und deshalb kosten Ausgabe-Tokens bei den API-Anbietern mehr als Eingabe-Tokens. Wie diese schrittweise Berechnung abläuft, beschreibt der Beitrag Was ist Inferenz?
Weiterentwicklungen
Das Grundprinzip ist seit 2017 gleich geblieben, im Detail hat sich viel verändert. Beispiele sind effizientere Attention-Varianten für sehr lange Kontexte, Mixture-of-Experts-Modelle, bei denen pro Token nur ein Teil des Netzes rechnet (siehe Mixture of Experts), und Modelle, die neben Text auch Bilder und Audio verarbeiten. Auch Bild- und Videogeneratoren nutzen heute oft Transformer-Bausteine.
Was das für Anwender bedeutet
Für die Nutzung muss man die Transformer-Architektur nicht im Detail verstehen. Drei Folgen sind aber praktisch: Modelle denken in Tokens statt in Wörtern, sie haben ein begrenztes Kontextfenster, und sie erzeugen Text nach Wahrscheinlichkeit. Wer das im Hinterkopf hat, versteht Kosten, Längengrenzen und gelegentliche Fehler besser.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.