Wie lernen Sprachmodelle? Vortraining, Feinschliff und Belohnung
Wie lernen Sprachmodelle? In drei großen Schritten: Zuerst lesen sie riesige Textmengen und lernen, das nächste Wort vorherzusagen. Dann werden sie mit Beispielen zu hilfreichen Assistenten geformt. Zuletzt lernen sie durch Belohnung, gute von schlechten Antworten zu unterscheiden.
1. Vortraining
Das Modell liest Billionen von Tokens aus Büchern, Websites, Code und anderen Quellen. Bei jedem Text soll es das nächste Token vorhersagen und passt seine Parameter an, wenn es danebenliegt. Dabei lernt es Sprache, Fakten und Zusammenhänge. Dieser Schritt kostet die meiste Rechenleistung, oft Wochen auf zehntausenden Grafikprozessoren.
2. Feinschliff mit Beispielen
Ein vortrainiertes Modell setzt Texte nur fort. Damit es Fragen beantwortet und Anweisungen befolgt, wird es mit Beispielgesprächen weitertrainiert: Frage und gute Antwort, Aufgabe und gutes Ergebnis.
3. Lernen durch Belohnung
Im letzten Schritt bewerten Menschen oder automatische Prüfer verschiedene Antworten des Modells. Das Modell lernt, bevorzugte Antworten häufiger zu geben (RLHF, Reinforcement Learning from Human Feedback). Reasoning-Modelle werden zusätzlich mit Aufgaben trainiert, deren Lösung sich prüfen lässt, etwa Mathematik oder Code mit Tests.
Was daraus folgt
- Das Wissen endet zum Stichtag der Trainingsdaten. Für Aktuelles braucht das Modell Suche oder Dokumente.
- Das Modell kennt Wahrscheinlichkeiten, keine geprüften Fakten. Daher kommen Halluzinationen.
- Was in den Trainingsdaten selten vorkommt, beherrscht es schlechter, etwa Nischenthemen oder seltene Sprachen.
Wie Texte in Tokens zerlegt werden, zeigt der Token-Zähler; die Grundlagen erklärt Was ist ein LLM?.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.