Mixture of Experts einfach erklärt: Warum große Modelle sparsam rechnen

1 Min. LesezeitStand 07.10.2026Mit KI erstellt · redaktionell geprüft

Mixture of Experts, kurz MoE, ist eine Bauweise für Sprachmodelle, bei der nicht das ganze Modell an jeder Antwort rechnet. Stattdessen wählt eine Weiche für jedes Wort einige wenige „Experten“ aus. So kann ein Modell riesig sein und trotzdem sparsam arbeiten.

Wie es funktioniert

Ein MoE-Modell besteht aus vielen Teilnetzen, den Experten. Für jedes Token entscheidet eine kleine Weiche (Router), welche zwei bis acht Experten es bearbeiten. Die übrigen bleiben untätig. Deshalb werden zwei Zahlen genannt: die Gesamtzahl der Parameter, etwa 500 Milliarden, und die aktiven Parameter pro Token, etwa 20 Milliarden.

Warum das wichtig ist

  • Geschwindigkeit und Kosten: Die Rechenarbeit pro Token richtet sich nach den aktiven Parametern. MoE-Modelle antworten deshalb schneller und günstiger als gleich große dichte Modelle.
  • Speicher: Für den Speicherbedarf zählt die Gesamtzahl. Alle Experten müssen geladen sein, auch wenn nur wenige rechnen.
  • Wissen: Mehr Experten können mehr Wissen speichern, ohne jede Antwort zu verteuern.

Beispiele

Viele aktuelle offene Modelle nutzen MoE, etwa DeepSeek, Mistral Large, Kimi oder Qwen. Auch bei den geschlossenen Spitzenmodellen gilt die Bauweise als verbreitet, die Anbieter nennen aber selten Details.

Was das für Sie bedeutet

Wer Modelle lokal betreibt, braucht für MoE viel Speicher, bekommt aber hohes Tempo. Einige Programme lagern Experten in den Arbeitsspeicher aus, sodass große Modelle sogar auf Gaming-Grafikkarten laufen. Mehr dazu in KI lokal ausführen.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Modell-FinderWelches KI-Modell passt? Aufgabe, Kontext und Budget angeben, passende Modelle nach Preis erhalten.
Öffnen

Auch hilfreich: Antwortzeit-Rechner · max_tokens-Rechner

Weiterlesen

Weitere Artikel

  1. Quantisierung erklärt: Sprachmodelle kleiner und schneller machenQuantisierung erklärt: Wie 4-Bit- und 8-Bit-Versionen Sprachmodelle verkleinern, wie viel Qualität das kostet und welche Stufe sich lokal eignet.
  2. Wie lernen Sprachmodelle? Vortraining, Feinschliff und BelohnungWie lernen Sprachmodelle? Vortraining mit Billionen Tokens, Feinschliff mit Beispielen und Lernen durch Belohnung. Einfach erklärt, ohne Formeln.
  3. Generative KI einfach erklärt: Was sie kann und was nichtGenerative KI einfach erklärt: Wie Text-, Bild- und Ton-KI neue Inhalte erzeugen, wofür sie sich im Alltag eignet, wo die Grenzen liegen und was rechtlich gilt.