Parameter eines Sprachmodells: Was die Milliarden-Zahlen bedeuten

2 Min. LesezeitStand 08.10.2026Mit KI erstellt · redaktionell geprüft

Die Parameter eines Sprachmodells sind die Zahlenwerte, die es beim Training gelernt hat. Wenn von einem Modell mit 8 oder 70 Milliarden Parametern die Rede ist, geht es um deren Anzahl. Diese Gewichte speichern alles, was das Modell über Sprache und Welt weiß. Die Zahl sagt viel über Speicherbedarf und Kosten aus, aber weniger über die Qualität, als man denkt.

Was ein Parameter ist

Ein neuronales Netz besteht aus vielen Schichten, in denen Zahlen miteinander multipliziert und addiert werden. Die Faktoren dieser Rechnungen sind die Parameter, auch Gewichte genannt. Zu Beginn des Trainings sind sie zufällig. Mit jedem Trainingsbeispiel werden sie ein wenig angepasst, bis das Modell gute Vorhersagen macht. Ein einzelner Parameter hat keine erkennbare Bedeutung. Erst im Zusammenspiel von Milliarden entsteht das Verhalten des Modells.

Was 8B oder 70B bedeutet

Bei offenen Modellen steht die Modellgröße oft im Namen. Das B steht für englisch billion, also Milliarde. Ein 8B-Modell hat rund 8 Milliarden Parameter, ein 70B-Modell rund 70 Milliarden. Die großen kommerziellen Anbieter veröffentlichen die Parameterzahl ihrer Spitzenmodelle meist nicht. Schätzungen, die im Netz kursieren, sind mit Vorsicht zu genießen.

Modellgröße und Speicherbedarf

Jeder Parameter braucht Speicherplatz. Grob gilt:

  • 16 Bit: 2 Byte je Parameter, ein 8B-Modell braucht etwa 16 GB.
  • 8 Bit: 1 Byte je Parameter, etwa 8 GB.
  • 4 Bit: ein halbes Byte je Parameter, etwa 4 GB.

Dazu kommt Arbeitsspeicher für den Kontext. Durch Quantisierung, also das Speichern mit weniger Bits, passen Modelle auf kleinere Grafikkarten; Details unter Quantisierung erklärt.

Mehr Parameter, bessere Antworten?

Größere Modelle können mehr Wissen speichern und komplexere Zusammenhänge abbilden. Aber die Parameterzahl ist nur ein Faktor unter mehreren:

  • Trainingsdaten: Menge und Qualität der Daten sind mindestens so wichtig wie die Größe. Siehe Trainingsdaten von KI-Modellen.
  • Nachtraining: Feinabstimmung mit menschlichem Feedback macht Modelle erst hilfreich.
  • Architektur: Bei Mixture-of-Experts-Modellen ist nur ein Teil der Parameter pro Token aktiv. Es gibt dann eine Gesamtzahl und eine Zahl aktiver Parameter.
  • Destillation: Kleine Modelle, die von großen lernen, erreichen oft erstaunliche Qualität.

Ein aktuelles kleines Modell schlägt deshalb nicht selten ein älteres großes.

Was Parameter für Kosten und Tempo bedeuten

Je mehr Parameter pro Token rechnen, desto mehr Rechenarbeit fällt an. Deshalb sind große Modelle langsamer und bei den API-Anbietern teurer. Anbieter bieten ihre Modelle in Familien an, etwa groß, mittel und klein. Für Klassifizieren, Extrahieren oder kurze Antworten reicht häufig ein kleines Modell. Der Ratgeber Kleines oder großes Modell? hilft bei der Abwägung.

So wählen Sie die passende Größe

  1. Aufgabe beschreiben und mit einem mittleren Modell testen.
  2. Dieselben Testfälle mit einem kleineren Modell wiederholen.
  3. Nur dort zum großen Modell wechseln, wo die Qualität spürbar fehlt.

Eine Vorauswahl nach Aufgabe und Budget trifft der Modell-Finder, die Stärken der einzelnen Modelle zeigt die Übersicht Modelle nach Stärken.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Modell-FinderWelches KI-Modell passt? Aufgabe, Kontext und Budget angeben, passende Modelle nach Preis erhalten.
Öffnen

Auch hilfreich: Antwortzeit-Rechner · max_tokens-Rechner

Weiterlesen

Weitere Artikel

  1. KI-Trainingsdaten: Woher das Wissen von Sprachmodellen stammtKI-Trainingsdaten erklärt: Welche Daten in Sprachmodelle fließen, wie sie aufbereitet werden, welche Rechtsfragen bestehen und wie Sie eigene Inhalte schützen.
  2. Wissensstichtag bei KI: Warum ChatGPT und Co. nicht alles Aktuelle kennenWissensstichtag bei KI erklärt: Was der Knowledge Cutoff ist, warum Modelle aktuelle Ereignisse nicht kennen und wie Websuche und eigene Quellen helfen.
  3. Warum KI jedes Mal anders antwortet: Zufall, Temperatur und KontextWarum KI jedes Mal anders antwortet: Sampling, Temperatur, Verlauf und Modellupdates erklärt. Und wie Sie Antworten gleichmäßiger und verlässlicher machen.