Quantisierung erklärt: Sprachmodelle kleiner und schneller machen

1 Min. LesezeitStand 07.10.2026Mit KI erstellt · redaktionell geprüft

Quantisierung macht Sprachmodelle kleiner, indem sie die Zahlen im Modell mit weniger Genauigkeit speichert. Statt 16 Bit je Parameter genügen oft 8 oder 4 Bit. Das Modell braucht dann nur einen Bruchteil des Speichers und läuft auf normaler Hardware.

Wie viel Speicher das spart

  • 16 Bit: 2 Byte je Parameter. Ein Modell mit 8 Milliarden Parametern braucht rund 16 GB.
  • 8 Bit: etwa 8 GB, kaum Qualitätsverlust.
  • 4 Bit: etwa 4,5 bis 5 GB, meist nur kleine Einbußen. Die beliebteste Stufe für den lokalen Betrieb.
  • 2 bis 3 Bit: sehr klein, aber deutlich schlechtere Antworten.

Begriffe, die Sie sehen werden

Dateien im Format GGUF sind für Programme wie llama.cpp, Ollama und LM Studio gedacht. Bezeichnungen wie Q4_K_M oder Q8_0 nennen die Stufe: Q4 steht für etwa 4 Bit. Für Grafikkarten gibt es Formate wie AWQ oder GPTQ.

Was Sie verlieren

Bei 8 Bit ist kaum ein Unterschied messbar. Bei 4 Bit leiden vor allem anspruchsvolle Aufgaben wie Rechnen oder Programmieren etwas. Größere Modelle vertragen Quantisierung besser als kleine: Ein großes Modell in 4 Bit ist meist besser als ein halb so großes in 8 Bit.

Empfehlung

Starten Sie mit 4 Bit (Q4_K_M) und gehen Sie auf 5 oder 8 Bit, wenn genug Speicher da ist und die Qualität nicht reicht. Welche Hardware Sie brauchen, zeigt KI lokal ausführen.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Modell-FinderWelches KI-Modell passt? Aufgabe, Kontext und Budget angeben, passende Modelle nach Preis erhalten.
Öffnen

Auch hilfreich: Antwortzeit-Rechner · max_tokens-Rechner

Weiterlesen

Weitere Artikel

  1. Wie lernen Sprachmodelle? Vortraining, Feinschliff und BelohnungWie lernen Sprachmodelle? Vortraining mit Billionen Tokens, Feinschliff mit Beispielen und Lernen durch Belohnung. Einfach erklärt, ohne Formeln.
  2. Generative KI einfach erklärt: Was sie kann und was nichtGenerative KI einfach erklärt: Wie Text-, Bild- und Ton-KI neue Inhalte erzeugen, wofür sie sich im Alltag eignet, wo die Grenzen liegen und was rechtlich gilt.
  3. Hat KI ein Gedächtnis? Kontext, Memory und Projekte erklärtHat KI ein Gedächtnis? Was ChatGPT, Claude und Gemini sich merken: Kontextfenster, Memory-Funktionen und Projekte. Mit Tipps zu Datenschutz und Kontrolle.