Mixture of Experts einfach erklärt: Warum große Modelle sparsam rechnen
Mixture of Experts, kurz MoE, ist eine Bauweise für Sprachmodelle, bei der nicht das ganze Modell an jeder Antwort rechnet. Stattdessen wählt eine Weiche für jedes Wort einige wenige „Experten“ aus. So kann ein Modell riesig sein und trotzdem sparsam arbeiten.
Wie es funktioniert
Ein MoE-Modell besteht aus vielen Teilnetzen, den Experten. Für jedes Token entscheidet eine kleine Weiche (Router), welche zwei bis acht Experten es bearbeiten. Die übrigen bleiben untätig. Deshalb werden zwei Zahlen genannt: die Gesamtzahl der Parameter, etwa 500 Milliarden, und die aktiven Parameter pro Token, etwa 20 Milliarden.
Warum das wichtig ist
- Geschwindigkeit und Kosten: Die Rechenarbeit pro Token richtet sich nach den aktiven Parametern. MoE-Modelle antworten deshalb schneller und günstiger als gleich große dichte Modelle.
- Speicher: Für den Speicherbedarf zählt die Gesamtzahl. Alle Experten müssen geladen sein, auch wenn nur wenige rechnen.
- Wissen: Mehr Experten können mehr Wissen speichern, ohne jede Antwort zu verteuern.
Beispiele
Viele aktuelle offene Modelle nutzen MoE, etwa DeepSeek, Mistral Large, Kimi oder Qwen. Auch bei den geschlossenen Spitzenmodellen gilt die Bauweise als verbreitet, die Anbieter nennen aber selten Details.
Was das für Sie bedeutet
Wer Modelle lokal betreibt, braucht für MoE viel Speicher, bekommt aber hohes Tempo. Einige Programme lagern Experten in den Arbeitsspeicher aus, sodass große Modelle sogar auf Gaming-Grafikkarten laufen. Mehr dazu in KI lokal ausführen.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.