Chinchilla-Rechner: Tokens, Parameter und FLOPs
Der Chinchilla-Rechner bestimmt das rechenoptimale Verhältnis von Trainings-Tokens zu Parametern, die Trainings-FLOPs nach 6·N·D und die nötigen GPU-Stunden.
| Größe | Wert |
|---|
Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.
Rechenoptimal trainieren
Der Chinchilla-Rechner beruht auf der Arbeit „Training Compute-Optimal Large Language Models“ von Hoffmann und Kollegen (DeepMind, 2022). Sie zeigte, dass viele große Modelle zu wenig Daten gesehen hatten. Rechenoptimal ist ein Verhältnis von ungefähr 20 Tokens pro Parameter: Das Modell Chinchilla mit 70 Milliarden Parametern wurde auf 1,4 Billionen Tokens trainiert und schlug größere Modelle mit gleichem Rechenaufwand. Diese Chinchilla Scaling Law ist eine Faustregel, kein Naturgesetz.
Die Trainings-FLOPs schätzt man mit C ≈ 6 · N · D: Pro Parameter und Token fallen etwa 2 FLOPs im Vorwärts- und 4 im Rückwärtsdurchlauf an. Bei festem Budget C und Verhältnis r folgen N = √(C / (6 r)) und D = r · N. Aus den FLOPs berechnet das Werkzeug GPU-Stunden: FLOPs geteilt durch Spitzenleistung mal Auslastung (Model FLOPs Utilization, MFU). Gut optimierte Trainingsläufe erreichen etwa 35 bis 50 Prozent MFU.
Heute trainieren Anbieter bewusst weit über dem Chinchilla-Punkt, weil kleinere Modelle im Betrieb günstiger sind; Meta nennt für Llama 3 über 15 Billionen Trainings-Tokens, beim 8B-Modell also fast 2.000 Tokens pro Parameter. Stellen Sie dafür das Verhältnis entsprechend höher ein. Die Spitzenleistungen sind Herstellerangaben für dichte Matrizen ohne Sparsity. Die Kosten basieren auf Ihrem eingetragenen Stundenpreis, nicht auf aktuellen Marktpreisen. Wie sich N aus der Architektur ergibt, zeigt der Transformer-Parameter-Rechner.
Anleitung: Chinchilla-Rechner in 4 Schritten
- Bei „Ausgangsgröße“ wählen, ob von der Parameterzahl, von der Zahl der Trainings-Tokens oder vom Rechenbudget in FLOPs ausgegangen wird.
- Den Wert eintragen und bei „Tokens pro Parameter“ das Verhältnis festlegen, voreingestellt sind 20.
- Unter „GPU“ einen Beschleuniger wählen und die Auslastung (MFU) anpassen.
- Parameter, Tokens, FLOPs und GPU-Stunden ablesen, optional mit eigenem Stundenpreis.
Typische Anwendungsfälle
- Lernen und Lehren: Den Zusammenhang zwischen Modellgröße, Datenmenge und Rechenaufwand an Zahlen nachvollziehen.
- Eigenes Training planen: Für ein kleines Modell abschätzen, wie viele Tokens und GPU-Stunden sinnvoll sind.
- Veröffentlichungen einordnen: Prüfen, wie weit ein Modell über das Chinchilla-Verhältnis hinaus trainiert wurde.
Häufige Fragen
Was sagt die Chinchilla Scaling Law?
Bei festem Rechenbudget sollten Modellgröße und Datenmenge etwa im gleichen Verhältnis wachsen. Als Faustregel gelten rund 20 Trainings-Tokens pro Parameter.
Woher kommt die Zahl 6 in 6·N·D?
Ein Vorwärtsdurchlauf kostet etwa 2 FLOPs pro Parameter und Token (eine Multiplikation und eine Addition), der Rückwärtsdurchlauf etwa doppelt so viel. Zusammen ergibt das rund 6.
Was ist MFU?
Model FLOPs Utilization ist der Anteil der theoretischen Spitzenleistung, den ein Training tatsächlich für das Modell nutzt. Kommunikation, Speicherzugriffe und Wartezeiten senken den Wert.
Wie viele FLOPs hatte das Training von Chinchilla?
Nach 6·N·D mit 70 Milliarden Parametern und 1,4 Billionen Tokens rund 5,9 · 10²³ FLOPs. Das Werkzeug rechnet das mit dem Knopf „Beispiel Chinchilla 70B“ nach.
Warum trainieren viele Anbieter weit mehr als 20 Tokens pro Parameter?
Chinchilla optimiert nur die Trainingskosten. Ein kleineres Modell, das länger trainiert wurde, ist bei der späteren Nutzung günstiger und schneller. Bei vielen Anfragen lohnt sich der höhere Trainingsaufwand.
Gilt die Formel 6·N·D auch für Mixture-of-Experts?
Als Näherung mit den aktiven Parametern je Token. Das Routing und die Kommunikation zwischen den Experten kommen als Aufwand hinzu.
Zum Weiterlesen
- Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
- Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
- Warum deutsche Texte mehr Tokens brauchen als englischeDeutsche Texte brauchen meist 20 bis 50 Prozent mehr Tokens als englische. Woran das liegt, was es kostet und was man dagegen tun kann.
Das könnte auch helfen
Antwortzeit-Rechnerneu
Wie lange dauert eine KI-Antwort? Wartezeit aus Antwortlänge, Geschwindigkeit und Nachdenken.
Öffnenmax_tokens-Rechnerneu
Welches max_tokens für 500 Wörter? Ausgabelimit passend zur gewünschten Antwortlänge setzen.
ÖffnenTemperatur-Simulator
Sehen, wie Temperatur, Top-p und Top-k die Wortwahl eines Sprachmodells verändern.
ÖffnenModell-Finder
Welches KI-Modell passt? Aufgabe, Kontext und Budget angeben, passende Modelle nach Preis erhalten.
ÖffnenToken-Zähler
Tokens eines Textes oder einer Datei (PDF, Word, TXT) zählen, mit Kosten für alle Modelle.
ÖffnenKontextfenster-Rechner
Passt mein Dokument ins Kontextfenster? Seiten oder Wörter eingeben, für alle Modelle prüfen.
Öffnen