Skip to content
BotServBotServ
MoEMixture of Expertsgpt-oss-120bMixtralQwen3DeepSeekModelle

MoE-Modelle verstehen: Mixture of Experts für lokale KI

Was Mixture-of-Experts-Modelle sind, warum sie für lokale KI wichtig sind und welche MoE-Modelle (gpt-oss-120b, Qwen3, Mixtral) sich lohnen.

S

schutzgeist

3 min read
Mixture-of-Experts-Modell-Architektur

MoE-Modelle verstehen: Mixture of Experts für lokale KI

Was dieser Artikel behandelt

  • Was MoE (Mixture of Experts) technisch ist, kurz und verständlich.
  • Warum MoE für lokale KI ein Gamechanger ist: riesige Modelle, schnelle Inferenz.
  • Die Hardware-Falle: vollständige Parameter müssen ins RAM/VRAM.
  • Welche MoE-Modelle sich lokal lohnen und welche Hardware sie brauchen.

Einleitung

MoE (Mixture of Experts) ist die Architektur hinter den stärksten offenen Modellen der letzten Jahre: Mixtral, DeepSeek-V3/R1, Qwen3-MoE, Llama 4 Scout, gpt-oss-120b. Statt jedes Token durch alle Parameter zu schicken, aktiviert ein MoE-Modell pro Token nur eine kleine Teilmenge der „Experten”, ein Router-Netzwerk entscheidet welche.

Das Ergebnis: Modell mit der Kapazität eines Riesen, aber der Geschwindigkeit eines Kleinen und genau das macht MoE für lokale KI interessant.

Wie MoE funktioniert (kompakt)

Dense-Modell (klassisch): Jedes Token durchläuft alle Schichten mit allen Parametern. Ein 70B-Modell nutzt bei jedem Token ~70B Parameter → langsam, rechenintensiv.

MoE-Modell: Die FFN-Schichten sind in viele „Experten” aufgeteilt (z. B. 128 Stück). Ein Router wählt pro Token die Top-2 bis Top-8 passenden Experten.

Beispiel Qwen3-30B-A3B: 30,5B Parameter gesamt, aber nur ~3,3B aktiv pro Token. Inferenz-Geschwindigkeit wie ein 3B-Modell, Qualität wie ein viel größeres.

Token → Router → wählt 2-8 von 128 Experten → nur die aktiven werden berechnet

Warum MoE für lokale KI zählt

VorteilErklärung
SchnellNur aktive Parameter werden berechnet → mehr Tokens/Sekunde
QualitätGroße Gesamt-Parameterzahl = mehr Wissen gespeichert
EffizientBesseres Qualität/Geschwindigkeit-Verhältnis als Dense-Modelle
Die FalleErklärung
Gesamt-SpeicherALLE Parameter müssen im RAM/VRAM liegen auch die inaktiven
VRAM-Bedarfgpt-oss-120b braucht ~60-80 GB, Qwen3-235B ~130+ GB
OffloadingMoE + RAM-Offloading (CPU/GPU-Mix) ist trickreicher als bei Dense

Wichtige MoE-Modelle für lokale Nutzung

ModellGesamtAktivVRAM/RAM nötigFür was
gpt-oss-120b~120B~5B aktiv~60-80 GBBestes Open-Modell, Agenten, Reasoning
Qwen3-30B-A3B30B3B~20 GBAllround, schnell, gute Qualität
Qwen3-235B-A22B235B22B~130+ GBTop-Qualität, nur auf Servern
Mixtral 8x7B47B~13B~26 GBKlassiker, gut eingeführt
Mixtral 8x22B141B~39B~80+ GBGroße Qualität, schwer lokal
DeepSeek-V3/R1671B37B~400+ GBNicht realistisch lokal (nur API)
Llama 4 Scout109B17B~60 GBMoE mit guter Code-Fähigkeit

Hardware-Realität

Das ist der Knackpunkt: MoE-Modelle sind schnell, aber speicherhungrig. Alle Parameter müssen verfügbar sein, auch wenn pro Token nur wenige aktiv sind.

  • gpt-oss-120b (~60-80 GB): Auf einer RTX 4090 (24 GB) unmöglich. Auf einem Mini-PC mit 128 GB Unified Memory (MS-S1 Max) läuft es, langsam (~10-15 tok/s), aber komplett lokal. Siehe Homelab-Guide.
  • Qwen3-30B-A3B (~20 GB): Läuft auf einer 24-GB-GPU oder einem 32-GB-Mac, das Sweetspot-MoE für Desktop.
  • CPU-Inferenz: MoE auf CPU ist möglich, aber langsam, große Speicherbandbreite hilft (siehe Speicherbandbreite).

MoE vs. Dense, wann was?

MoE wählen wenn:

  • Du viel RAM/VRAM hast (>24 GB) und maximale Qualität pro Token willst.
  • Geschwindigkeit wichtig ist (aktive Parameter klein).
  • Du große Modelle lokal willst, die als Dense unbezahlbar wären.

Dense wählen wenn:

  • Wenig Speicher (<16 GB), ein 7B/8B-Dense ist kleiner und vorhersehbarer.
  • Einfachheit zählt: Dense-Modelle sind unkomplizierter zu quantisieren/deployen.
  • Latenz-kritisch auf schwacher Hardware: Dense hat konstante Aktivierungskosten.

Praxis-Tipps

  • Ollama: ollama run gpt-oss:120b oder qwen3:30b-a3b: MoE läuft wie jedes andere Modell, nur die RAM-Anforderung ist höher.
  • Quantisierung: MoE-Modelle gut quantisierbar (Q4_M etc.): Speicherbedarf sinkt deutlich.
  • Offloading: Bei knapper GPU MoE-Layer auf CPU auslagern (--n-gpu-layers), siehe GPU-Offloading.
  • llama.cpp: Unterstützt MoE mit Expert-Parallelism, für Multi-Node-Cluster.

Key Takeaways:

  • MoE aktiviert pro Token nur einige Experten, schnell wie klein, schlau wie groß.
  • Aber: Alle Parameter müssen ins RAM/VRAM, die Gesamtgröße ist der Speicher-Bedarf.
  • gpt-oss-120b, Qwen3-MoE, Mixtral sind die relevanten lokalen MoE-Modelle.
  • 128-GB-Maschinen (MS-S1 Max) machen 120B-MoE lokal möglich.
  • Für <16 GB Hardware bleiben Dense-Modelle praktischer.

FAQ

Was ist MoE?

Mixture of Experts: Statt alle Parameter pro Token zu nutzen, wählt ein Router-Netzwerk 2-8 von vielen Experten-Subnetzen aus. Ergebnis: große Gesamt-Kapazität, kleine Rechenkosten pro Token.

Warum ist MoE schneller?

Weil nur die aktiven Experten berechnet werden. Qwen3-30B-A3B nutzt nur ~3B Parameter pro Token: Inferenz-Geschwindigkeit wie ein 3B-Modell, aber mit 30B Gesamtwissen.

Was ist die MoE-Falle?

Alle Parameter müssen im Speicher liegen auch die inaktiven. gpt-oss-120b braucht ~60-80 GB, obwohl pro Token nur ~5B aktiv sind. MoE ist schnell, aber speicherhungrig.

Welches MoE für zu Hause?

Qwen3-30B-A3B (~20 GB) für normale GPU-PCs; gpt-oss-120b für 128-GB-Maschinen wie den MS-S1 Max. Mixtral 8x7B als kompakter Klassiker.

MoE auf CPU?

Möglich aber langsam: MoE profitiert von Speicherbandbreite. Auf Unified-Memory-Maschinen (Mac, Strix Halo) besser als auf klassischem CPU+RAM. Für CPU ist ein kleines Dense-Modell meist flotter.

Ist MoE die Zukunft?

Sieht so aus, fast alle neuen Flaggschiff-Modelle (DeepSeek, Qwen3, Llama 4, gpt-oss) sind MoE. Die Architektur skaliert besser als Dense.

Quellen und weiterführende Literatur

Zurück zum KI Blog
Share:

Ähnliche Beiträge