RLHF erklärt: Wie menschliches Feedback Sprachmodelle hilfreich macht
RLHF steht für Reinforcement Learning from Human Feedback, also bestärkendes Lernen aus menschlichem Feedback. Das Verfahren ist ein wichtiger Grund, warum Chat-Assistenten Fragen beantworten, Anweisungen befolgen und schädliche Bitten ablehnen, statt einfach nur Text fortzusetzen.
Warum ein vortrainiertes Modell nicht reicht
Nach dem Vortraining kann ein Sprachmodell sehr gut vorhersagen, wie ein Text weitergeht. Ein hilfreicher Assistent ist es damit noch nicht. Auf die Frage „Wie koche ich Reis?“ könnte es mit weiteren Fragen antworten, weil solche Listen im Internet häufig vorkommen. Es weiß nicht, was eine gute Antwort ist. Diese Lücke schließt das Nachtraining. Wie das Vortraining funktioniert, erklärt der Ratgeber Wie lernen Sprachmodelle?
RLHF in drei Schritten
- Überwachtes Feintuning: Menschen schreiben Musterantworten auf typische Anfragen. Das Modell lernt daran, wie ein Assistent antwortet.
- Belohnungsmodell trainieren: Das Modell erzeugt zu einer Frage mehrere Antworten. Menschen bewerten, welche besser ist. Aus vielen solchen Vergleichen lernt ein separates Belohnungsmodell, menschliche Vorlieben vorherzusagen.
- Bestärkendes Lernen: Das Sprachmodell erzeugt Antworten, das Belohnungsmodell vergibt Punkte, und das Sprachmodell wird so angepasst, dass es mehr Punkte erreicht. Eine Bremse verhindert, dass es sich zu weit vom Ausgangsmodell entfernt.
Bekannt wurde das Verfahren vor allem durch die Arbeit von OpenAI an InstructGPT, dem Vorläufer von ChatGPT.
Varianten und Weiterentwicklungen
- DPO (Direct Preference Optimization): nutzt die Bewertungen direkt, ohne separates Belohnungsmodell. Das ist einfacher und wird häufig eingesetzt.
- KI-Feedback: Statt Menschen bewertet ein anderes Modell anhand festgelegter Grundsätze. Anthropic hat dafür den Ansatz Constitutional AI beschrieben.
- Lernen mit überprüfbaren Ergebnissen: Bei Mathe- oder Programmieraufgaben lässt sich automatisch prüfen, ob eine Lösung stimmt. Dieses Verfahren spielt bei Reasoning-Modellen eine große Rolle.
Grenzen und Nebenwirkungen
- Gefälligkeit: Modelle lernen, was Bewerter mögen. Das kann dazu führen, dass sie Nutzern nach dem Mund reden oder überzeugend statt korrekt klingen.
- Ausnutzen des Belohnungsmodells: Das Modell findet Muster, die hohe Punkte bringen, ohne die Antwort wirklich zu verbessern, etwa übertriebene Länge.
- Uneinigkeit: Menschen bewerten unterschiedlich. Die Vorlieben der Bewerter fließen in das Modell ein, siehe Bias in KI.
- Aufwand: Gute menschliche Bewertungen sind teuer, besonders bei Fachthemen.
Was das für Anwender bedeutet
RLHF erklärt einige typische Verhaltensweisen: höflicher Ton, ausführliche Antworten, gelegentliche übervorsichtige Ablehnungen und eine Neigung, Ihnen zuzustimmen. Wenn Sie ehrliche Kritik wollen, sagen Sie es ausdrücklich: „Nenne die drei größten Schwächen dieses Entwurfs.“ Wer KI-Antworten selbst systematisch bewerten will, kann mit dem Bewertungsraster für KI-Antworten ähnlich vorgehen wie die Bewerter beim Training. Wie RLHF mit Sicherheitsfragen zusammenhängt, beschreibt der Beitrag Alignment und KI-Sicherheit.
Für Unternehmen ist RLHF im eigenen Haus selten sinnvoll, denn es braucht viele Bewertungen und viel Erfahrung. Wer ein Modell an eigene Vorlieben anpassen möchte, kommt meist mit einem guten Systemprompt, Beispielen oder Fine-Tuning weiter. Hintergründe dazu im Ratgeber Was ist Fine-Tuning?
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.