LLM Quantisierung: Modellgröße in FP16, 8 Bit und 4 Bit

LLM Quantisierung auf einen Blick: Die Tabelle zeigt die Modellgröße für FP16, 8 Bit, 4 Bit und GGUF-Stufen wie Q4_K_M in GB und GiB.

–

 

Modellgröße je Format
FormatBits pro GewichtGBGiBpasstEinordnung

Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.

Bits pro Gewicht und Modellgröße

LLM Quantisierung speichert die Gewichte eines Sprachmodells mit weniger Bits. Die Modellgröße ergibt sich aus Parametern mal Bits pro Gewicht geteilt durch acht: Ein Modell mit 8 Milliarden Parametern belegt in FP16 (16 Bit) etwa 16 GB, mit 8 Bit etwa 8 GB und mit 4 Bit rund 4 bis 5 GB. Die Tabelle rechnet das für die gängigen Formate gleichzeitig aus, in Gigabyte (10⁹ Byte) und Gibibyte (2³⁰ Byte), wie sie Betriebssysteme oft anzeigen.

Bei GGUF, dem Dateiformat von llama.cpp, Ollama und LM Studio, liegen die effektiven Bits pro Gewicht etwas über der Nennzahl. Q8_0 speichert je 32 Gewichte einen 16-Bit-Skalierungsfaktor, das ergibt 8,5 Bit. Mischformate wie Q4_K_M halten wichtige Tensoren in höherer Genauigkeit und kommen so auf etwa 4,8 bis 4,9 Bit. GPTQ und AWQ speichern je Gruppe von 128 Gewichten zusätzlich Skalierung und Nullpunkt. Die Werte in der Tabelle sind deshalb Richtwerte; die tatsächliche Dateigröße hängt vom Modell ab, etwa vom Vokabular und davon, welche Tensoren unquantisiert bleiben.

Zur Qualität gilt als Faustregel: 8 Bit ist kaum von FP16 zu unterscheiden, Q5 und Q6 verlieren wenig, Q4_K_M gilt als guter Kompromiss für den Alltag. Unter 4 Bit steigen die Fehler deutlich, besonders bei kleinen Modellen. Ein großes Modell in 4 Bit ist oft besser als ein kleines in FP16. Wie viel Speicher das Modell beim Ausführen inklusive KV-Cache braucht, zeigt der LLM-VRAM-Rechner.

Anleitung: LLM Quantisierung in 5 Schritten

  1. Bei „Parameter (Milliarden)“ die Größe des Modells eintragen oder ein Beispielmodell wählen.
  2. Bei „Eigene Bits pro Gewicht“ optional einen Wert für ein eigenes Format ergänzen.
  3. In der Tabelle Dateigröße in GB und GiB je Format ablesen.
  4. Mit „Grafikspeicher zum Vergleich“ markieren, welche Formate in den vorhandenen Speicher passen.
  5. Die Tabelle mit „Tabelle kopieren“ als Text übernehmen.

Typische Anwendungsfälle

  • Download planen: Vor dem Herunterladen von Hugging Face abschätzen, wie viel Platz eine GGUF-Datei belegt.
  • Format wählen: Erkennen, ab welcher Quantisierung ein 70B-Modell auf zwei 24-GB-Karten passt.
  • Dateien prüfen: Ungewöhnlich große oder kleine Dateien mit den erwarteten Bits pro Gewicht vergleichen.
Fragen

Häufige Fragen

Welche Quantisierung sollte ich wählen?

Für die meisten Anwendungen ist Q4_K_M oder Q5_K_M ein guter Startpunkt. Wenn genug Speicher da ist, bringt Q6_K oder Q8_0 etwas mehr Genauigkeit. Q3 und Q2 lohnen sich nur, wenn das Modell sonst gar nicht passt.

Was ist der Unterschied zwischen FP16 und BF16?

Beide belegen 16 Bit. BF16 hat einen größeren Wertebereich und weniger Nachkommastellen und ist das übliche Trainingsformat vieler Modelle. Für die Dateigröße macht es keinen Unterschied.

Was ist GGUF?

GGUF ist das Dateiformat von llama.cpp. Es enthält Gewichte, Tokenizer und Metadaten in einer Datei und unterstützt viele Quantisierungsstufen. Ollama und LM Studio nutzen es ebenfalls.

Warum zeigt mein Explorer eine kleinere Zahl als die Tabelle?

Windows rechnet in Gibibyte (1.024³ Byte), beschriftet sie aber mit GB. Vergleichen Sie deshalb mit der Spalte GiB.

Was bedeutet das K in Q4_K_M?

K steht für die K-Quants von llama.cpp: Gewichte werden in Superblöcken mit eigenen Skalierungsfaktoren gespeichert. S, M und L geben an, wie viele wichtige Tensoren mit höherer Genauigkeit gespeichert bleiben.

Ist die Größe auf der Festplatte gleich dem Speicherbedarf beim Ausführen?

Nicht ganz. Beim Ausführen kommen KV-Cache, Puffer und Laufzeit hinzu. Den Gesamtbedarf schätzt der LLM-VRAM-Rechner.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
  2. Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
  3. Warum deutsche Texte mehr Tokens brauchen als englischeDeutsche Texte brauchen meist 20 bis 50 Prozent mehr Tokens als englische. Woran das liegt, was es kostet und was man dagegen tun kann.
Weitere Werkzeuge

Das könnte auch helfen

Alle 558 Werkzeuge