Parameter eines Sprachmodells: Was die Milliarden-Zahlen bedeuten
Die Parameter eines Sprachmodells sind die Zahlenwerte, die es beim Training gelernt hat. Wenn von einem Modell mit 8 oder 70 Milliarden Parametern die Rede ist, geht es um deren Anzahl. Diese Gewichte speichern alles, was das Modell über Sprache und Welt weiß. Die Zahl sagt viel über Speicherbedarf und Kosten aus, aber weniger über die Qualität, als man denkt.
Was ein Parameter ist
Ein neuronales Netz besteht aus vielen Schichten, in denen Zahlen miteinander multipliziert und addiert werden. Die Faktoren dieser Rechnungen sind die Parameter, auch Gewichte genannt. Zu Beginn des Trainings sind sie zufällig. Mit jedem Trainingsbeispiel werden sie ein wenig angepasst, bis das Modell gute Vorhersagen macht. Ein einzelner Parameter hat keine erkennbare Bedeutung. Erst im Zusammenspiel von Milliarden entsteht das Verhalten des Modells.
Was 8B oder 70B bedeutet
Bei offenen Modellen steht die Modellgröße oft im Namen. Das B steht für englisch billion, also Milliarde. Ein 8B-Modell hat rund 8 Milliarden Parameter, ein 70B-Modell rund 70 Milliarden. Die großen kommerziellen Anbieter veröffentlichen die Parameterzahl ihrer Spitzenmodelle meist nicht. Schätzungen, die im Netz kursieren, sind mit Vorsicht zu genießen.
Modellgröße und Speicherbedarf
Jeder Parameter braucht Speicherplatz. Grob gilt:
- 16 Bit: 2 Byte je Parameter, ein 8B-Modell braucht etwa 16 GB.
- 8 Bit: 1 Byte je Parameter, etwa 8 GB.
- 4 Bit: ein halbes Byte je Parameter, etwa 4 GB.
Dazu kommt Arbeitsspeicher für den Kontext. Durch Quantisierung, also das Speichern mit weniger Bits, passen Modelle auf kleinere Grafikkarten; Details unter Quantisierung erklärt.
Mehr Parameter, bessere Antworten?
Größere Modelle können mehr Wissen speichern und komplexere Zusammenhänge abbilden. Aber die Parameterzahl ist nur ein Faktor unter mehreren:
- Trainingsdaten: Menge und Qualität der Daten sind mindestens so wichtig wie die Größe. Siehe Trainingsdaten von KI-Modellen.
- Nachtraining: Feinabstimmung mit menschlichem Feedback macht Modelle erst hilfreich.
- Architektur: Bei Mixture-of-Experts-Modellen ist nur ein Teil der Parameter pro Token aktiv. Es gibt dann eine Gesamtzahl und eine Zahl aktiver Parameter.
- Destillation: Kleine Modelle, die von großen lernen, erreichen oft erstaunliche Qualität.
Ein aktuelles kleines Modell schlägt deshalb nicht selten ein älteres großes.
Was Parameter für Kosten und Tempo bedeuten
Je mehr Parameter pro Token rechnen, desto mehr Rechenarbeit fällt an. Deshalb sind große Modelle langsamer und bei den API-Anbietern teurer. Anbieter bieten ihre Modelle in Familien an, etwa groß, mittel und klein. Für Klassifizieren, Extrahieren oder kurze Antworten reicht häufig ein kleines Modell. Der Ratgeber Kleines oder großes Modell? hilft bei der Abwägung.
So wählen Sie die passende Größe
- Aufgabe beschreiben und mit einem mittleren Modell testen.
- Dieselben Testfälle mit einem kleineren Modell wiederholen.
- Nur dort zum großen Modell wechseln, wo die Qualität spürbar fehlt.
Eine Vorauswahl nach Aufgabe und Budget trifft der Modell-Finder, die Stärken der einzelnen Modelle zeigt die Übersicht Modelle nach Stärken.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.