Nvidia NeMo-DCR: Gewichte großer Modelle in Minuten statt Stunden abgleichen
Ein neues Verfahren von Nvidia verkürzt eine der langsamsten Phasen beim Training großer Modelle mit Reinforcement Learning. Statt kompletter Checkpoints werden nur noch die geänderten Gewichte übertragen.
Laut dem Paper ändern sich pro Trainingsschritt nur etwa 1 Prozent der Gewichte. NeMo-DCR kodiert diese Änderungen als XOR-Masken gegenüber dem Stand, der auf den Rechnern für die Rollouts bereits liegt, und komprimiert sie zusätzlich. Das Ergebnis ist bitgenau identisch mit einem vollständigen Abgleich.
Bei einem Modell mit einer Billion Parametern zwischen zwei AWS-Regionen sinkt die Zeit von 87,5 Minuten auf 150 Sekunden. Für Modelle von 30 Milliarden bis einer Billion Parametern nennt Nvidia eine 12- bis 40-fache Beschleunigung. Den größten Teil der verbleibenden Zeit macht die Netzwerkübertragung aus. Die Referenzimplementierung mit rund 7.000 Zeilen Python ist in das Open-Source-Projekt NeMo RL eingeflossen; beteiligt waren Forschende von Nvidia und der Aalto-Universität.
Davon profitieren vor allem Teams, die eigene Modelle nachtrainieren und dafür Rechenzeit mieten. Was das kostet, zeigt GPU mieten: Kosten; Grundlagen erklärt Was ist RLHF?.
Quellen
Eigene Zusammenfassung auf Grundlage der genannten Quellen, erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Illustration: Tokenlabor, per Programm gezeichnet, kein KI-Bild.


