Distillation erklärt: Wie kleine KI-Modelle von großen lernen

2 Min. LesezeitStand 08.10.2026Mit KI erstellt · redaktionell geprüft

Distillation, auf Deutsch Wissensdestillation, ist ein Verfahren, bei dem ein kleines KI-Modell von einem großen lernt. Das große Modell dient als Lehrer, das kleine als Schüler. Ziel ist ein Modell, das fast so gut ist wie das große, aber deutlich schneller und günstiger läuft.

Das Lehrer-Schüler-Prinzip

Normalerweise lernt ein Modell aus Daten, bei denen nur die richtige Antwort bekannt ist. Bei der Knowledge Distillation bekommt der Schüler mehr Information:

  • Klassische Distillation: Der Schüler lernt nicht nur das wahrscheinlichste nächste Token, sondern die gesamte Wahrscheinlichkeitsverteilung des Lehrers. Er erfährt also auch, welche Alternativen der Lehrer für plausibel hielt. Diese Zusatzinformation macht das Lernen effizienter.
  • Distillation über Ausgaben: Der Lehrer erzeugt Antworten, Lösungswege oder Beispieldialoge. Der Schüler wird mit diesen Texten trainiert. Das ist eine Form von synthetischen Daten und funktioniert auch, wenn man nur die Texte des Lehrers kennt.

Warum Distillation so verbreitet ist

Viele kleine Modelle der großen Anbieter sind vermutlich ganz oder teilweise durch Distillation aus größeren Modellen entstanden, auch wenn die Hersteller Details selten offenlegen. Bei offenen Modellen wird das Verfahren häufig dokumentiert, etwa wenn ein Hersteller kleinere Varianten aus einem großen Reasoning-Modell ableitet. Das erklärt, warum kleine Modelle heute deutlich besser sind als große Modelle vor wenigen Jahren. Mehr dazu im Beitrag Small Language Models.

Vorteile

  • Geringere Kosten: Kleinere Modelle brauchen weniger Rechenleistung pro Anfrage.
  • Mehr Tempo: kürzere Antwortzeiten, wichtig für Chatbots und Echtzeitanwendungen.
  • Lokaler Betrieb: Destillierte Modelle passen auf Laptops und Smartphones.
  • Spezialisierung: Ein Schüler kann gezielt auf eine Aufgabe trainiert werden und darin den Lehrer sogar erreichen.

Grenzen

  • Der Schüler übernimmt auch Fehler und Verzerrungen des Lehrers.
  • Breites Weltwissen lässt sich nur begrenzt in ein kleines Modell pressen.
  • Außerhalb des trainierten Aufgabenbereichs fällt die Qualität oft deutlich ab.

Distillation im eigenen Unternehmen

Auch ohne eigenes Forschungslabor lässt sich das Prinzip nutzen. Einige API-Anbieter bieten Fine-Tuning an, bei dem Ausgaben eines großen Modells als Trainingsdaten für ein kleineres dienen. Ablauf:

  1. Typische Anfragen sammeln und von einem großen Modell beantworten lassen.
  2. Die Antworten prüfen und schlechte aussortieren.
  3. Ein kleines Modell mit diesen Paaren feintunen.
  4. Mit getrennten Testfällen vergleichen, ob die Qualität reicht.

Was das Training kostet, schätzt der Fine-Tuning-Kostenrechner. Ob sich der Aufwand gegenüber anderen Wegen lohnt, beleuchtet der Ratgeber Fine-Tuning oder RAG?

Lizenzen und Nutzungsbedingungen

Viele Anbieter untersagen in ihren Bedingungen, Ausgaben ihrer Modelle zum Training konkurrierender Modelle zu verwenden. Für das eigene, interne Spezialmodell kann das anders aussehen. Prüfen Sie die Bedingungen des Anbieters und die Lizenz offener Modelle, bevor Sie Daten zum Destillieren erzeugen. Dies ist keine Rechtsberatung. Verwandte Verfahren zur Verkleinerung von Modellen beschreibt der Beitrag Quantisierung erklärt.

Ein Hinweis zur Einordnung: Distillation ersetzt keine sorgfältige Auswahl. Oft ist ein bereits verfügbares kleines Modell mit gutem Prompt schneller einsatzbereit als ein selbst destilliertes.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Fine-Tuning-KostenrechnerTraining und Nutzung eines angepassten Modells in Euro berechnen.
Öffnen

Auch hilfreich: Systemprompt-Kostenrechner · KI-Preiskalkulation

Weiterlesen

Weitere Artikel

  1. Computer-Use-Agenten: Wenn KI Maus und Tastatur selbst bedientComputer-Use-Agenten erklärt: Wie KI Bildschirm, Maus und Tastatur bedient, wofür das taugt, welche Sicherheitsrisiken bestehen und was es kostet.
  2. Deep Research erklärt: Wie KI-Recherche-Agenten ausführliche Berichte erstellenDeep Research erklärt: Wie KI-Recherche-Agenten Dutzende Quellen durchsuchen und Berichte schreiben, wofür sie taugen, wo Fehler lauern und wie Sie gut fragen.
  3. Alignment und KI-Sicherheit: Wie KI auf menschliche Ziele ausgerichtet wirdKI-Sicherheit und Alignment erklärt: Wie Anbieter Modelle auf menschliche Werte ausrichten, welche Risiken bestehen und was Unternehmen selbst tun können.