Transformer-Parameter berechnen: Layer, d_model, Vokabular
Transformer-Parameter berechnen aus Layern, d_model, Attention-Köpfen, FFN-Größe und Vokabular, mit Aufteilung, Speicher in FP16 und Rechenaufwand je Token.
| Baustein | Formel | Parameter | Anteil |
|---|
Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.
Woraus ein Transformer besteht
Mit diesem Werkzeug können Sie Transformer-Parameter berechnen, so wie sie in Decoder-Modellen wie Llama, Qwen, Mistral oder Gemma vorkommen. Die Parameteranzahl setzt sich aus drei Teilen zusammen. Die Embedding-Parameter sind Vokabular mal d_model, einmal für die Eingabe und, falls nicht geteilt, noch einmal für die Ausgabeschicht (LM-Head). Je Layer kommen die Attention-Matrizen hinzu: Q und O mit d_model × Köpfe × Kopfdimension, K und V mit d_model × KV-Köpfe × Kopfdimension.
Den größten Anteil hat meist der Feed-Forward-Block. Bei SwiGLU, das fast alle aktuellen Modelle nutzen, sind es drei Matrizen der Größe d_model × FFN-Größe (Gate, Up, Down), bei klassischen Transformern wie GPT-2 zwei. Dazu kommen je Layer zwei Norm-Vektoren mit d_model Einträgen und eine Abschluss-Norm. Bei Mixture-of-Experts gibt es den FFN-Block je Experte, dazu einen Router mit d_model × Experten. Rechnet man Llama 3.1 8B nach, ergeben sich 8,03 Milliarden Parameter, davon gut 1 Milliarde für die beiden Embedding-Matrizen mit dem großen Vokabular von 128.256 Tokens.
Aus der Parameterzahl folgen zwei nützliche Größen: der Speicher in FP16 (2 Byte je Parameter) und der Rechenaufwand von etwa 2 FLOPs je aktivem Parameter und Token beim Erzeugen. Bias-Terme, Positions-Embeddings mit eigenen Gewichten oder Zusatzköpfe zählt das Werkzeug nicht mit; die Abweichung liegt dadurch meist unter einem Prozent. Wie viele Trainings-Tokens zu einer Modellgröße passen, zeigt der Chinchilla-Rechner.
Anleitung: Transformer-Parameter berechnen in 4 Schritten
- Eine Beispielarchitektur wählen oder Werte aus der config.json eintragen: „Layer“, „d_model“, „Attention-Köpfe“, „KV-Köpfe“, „FFN-Größe“ und „Vokabular“.
- Den FFN-Typ (SwiGLU mit drei Matrizen oder klassisch mit zwei) und „Embeddings geteilt“ einstellen.
- Gesamtzahl der Parameter und die Aufteilung auf Embeddings, Attention und FFN ablesen.
- Speicherbedarf in FP16 und den Rechenaufwand je Token aus der Übersicht übernehmen.
Typische Anwendungsfälle
- Modellkarten nachrechnen: Prüfen, wie die Angabe 8B aus den Architekturwerten zustande kommt.
- Eigene Architektur entwerfen: Abschätzen, wie sich mehr Layer oder ein größeres Vokabular auf die Größe auswirken.
- Lehre: Zeigen, welcher Anteil eines Sprachmodells auf Embeddings, Attention und Feed-Forward entfällt.
Häufige Fragen
Wie berechnet man die Parameter eines Transformers?
Summe aus Embeddings (Vokabular × d_model, gegebenenfalls zweimal), je Layer Attention (Q, K, V, O) und Feed-Forward (2 oder 3 Matrizen d_model × FFN-Größe) sowie Normalisierungen. Das Werkzeug zeigt jede Formel einzeln.
Was bedeutet tied embeddings?
Eingabe-Embedding und Ausgabeschicht nutzen dieselbe Matrix. Das spart Vokabular × d_model Parameter und ist bei kleinen Modellen wie Llama 3.2 3B oder Gemma üblich.
Was ist die Kopfdimension?
Die Breite eines Attention-Kopfs, meist d_model geteilt durch die Zahl der Köpfe, oft 128. Manche Modelle wie Gemma 2 9B weichen ab und nutzen 256.
Warum ist die FFN-Größe bei SwiGLU so krumm?
Bei SwiGLU wird die FFN-Größe meist auf etwa zwei Drittel von 4 × d_model gesetzt, damit drei Matrizen ungefähr so viele Parameter haben wie zwei klassische, und dann auf ein Vielfaches von 256 oder 512 gerundet.
Warum weicht mein Ergebnis um wenige Millionen von der Modellkarte ab?
Bias-Terme, zusätzliche Normalisierungen oder auf ein Vielfaches aufgerundete Vokabulare verändern die Summe leicht. Das Werkzeug zählt die üblichen Gewichtsmatrizen und Norm-Vektoren.
Wie zähle ich Mixture-of-Experts-Modelle?
Die FFN-Parameter gibt es je Experte. Für die Gesamtgröße multiplizieren Sie den FFN-Anteil mit der Zahl der Experten, für die aktiven Parameter mit der Zahl der Experten je Token.
Zum Weiterlesen
- Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
- Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
- Warum deutsche Texte mehr Tokens brauchen als englischeDeutsche Texte brauchen meist 20 bis 50 Prozent mehr Tokens als englische. Woran das liegt, was es kostet und was man dagegen tun kann.
Das könnte auch helfen
Antwortzeit-Rechnerneu
Wie lange dauert eine KI-Antwort? Wartezeit aus Antwortlänge, Geschwindigkeit und Nachdenken.
Öffnenmax_tokens-Rechnerneu
Welches max_tokens für 500 Wörter? Ausgabelimit passend zur gewünschten Antwortlänge setzen.
ÖffnenTemperatur-Simulator
Sehen, wie Temperatur, Top-p und Top-k die Wortwahl eines Sprachmodells verändern.
ÖffnenModell-Finder
Welches KI-Modell passt? Aufgabe, Kontext und Budget angeben, passende Modelle nach Preis erhalten.
ÖffnenToken-Zähler
Tokens eines Textes oder einer Datei (PDF, Word, TXT) zählen, mit Kosten für alle Modelle.
ÖffnenKontextfenster-Rechner
Passt mein Dokument ins Kontextfenster? Seiten oder Wörter eingeben, für alle Modelle prüfen.
Öffnen