Quantisierung erklärt: Sprachmodelle kleiner und schneller machen
Quantisierung macht Sprachmodelle kleiner, indem sie die Zahlen im Modell mit weniger Genauigkeit speichert. Statt 16 Bit je Parameter genügen oft 8 oder 4 Bit. Das Modell braucht dann nur einen Bruchteil des Speichers und läuft auf normaler Hardware.
Wie viel Speicher das spart
- 16 Bit: 2 Byte je Parameter. Ein Modell mit 8 Milliarden Parametern braucht rund 16 GB.
- 8 Bit: etwa 8 GB, kaum Qualitätsverlust.
- 4 Bit: etwa 4,5 bis 5 GB, meist nur kleine Einbußen. Die beliebteste Stufe für den lokalen Betrieb.
- 2 bis 3 Bit: sehr klein, aber deutlich schlechtere Antworten.
Begriffe, die Sie sehen werden
Dateien im Format GGUF sind für Programme wie llama.cpp, Ollama und LM Studio gedacht. Bezeichnungen wie Q4_K_M oder Q8_0 nennen die Stufe: Q4 steht für etwa 4 Bit. Für Grafikkarten gibt es Formate wie AWQ oder GPTQ.
Was Sie verlieren
Bei 8 Bit ist kaum ein Unterschied messbar. Bei 4 Bit leiden vor allem anspruchsvolle Aufgaben wie Rechnen oder Programmieren etwas. Größere Modelle vertragen Quantisierung besser als kleine: Ein großes Modell in 4 Bit ist meist besser als ein halb so großes in 8 Bit.
Empfehlung
Starten Sie mit 4 Bit (Q4_K_M) und gehen Sie auf 5 oder 8 Bit, wenn genug Speicher da ist und die Qualität nicht reicht. Welche Hardware Sie brauchen, zeigt KI lokal ausführen.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.