MoE-Modelle verstehen: Mixture of Experts für lokale KI
Was dieser Artikel behandelt
- Was MoE (Mixture of Experts) technisch ist, kurz und verständlich.
- Warum MoE für lokale KI ein Gamechanger ist: riesige Modelle, schnelle Inferenz.
- Die Hardware-Falle: vollständige Parameter müssen ins RAM/VRAM.
- Welche MoE-Modelle sich lokal lohnen und welche Hardware sie brauchen.
Einleitung
MoE (Mixture of Experts) ist die Architektur hinter den stärksten offenen Modellen der letzten Jahre: Mixtral, DeepSeek-V3/R1, Qwen3-MoE, Llama 4 Scout, gpt-oss-120b. Statt jedes Token durch alle Parameter zu schicken, aktiviert ein MoE-Modell pro Token nur eine kleine Teilmenge der „Experten”, ein Router-Netzwerk entscheidet welche.
Das Ergebnis: Modell mit der Kapazität eines Riesen, aber der Geschwindigkeit eines Kleinen und genau das macht MoE für lokale KI interessant.
Wie MoE funktioniert (kompakt)
Dense-Modell (klassisch): Jedes Token durchläuft alle Schichten mit allen Parametern. Ein 70B-Modell nutzt bei jedem Token ~70B Parameter → langsam, rechenintensiv.
MoE-Modell: Die FFN-Schichten sind in viele „Experten” aufgeteilt (z. B. 128 Stück). Ein Router wählt pro Token die Top-2 bis Top-8 passenden Experten.
Beispiel Qwen3-30B-A3B: 30,5B Parameter gesamt, aber nur ~3,3B aktiv pro Token. Inferenz-Geschwindigkeit wie ein 3B-Modell, Qualität wie ein viel größeres.
Token → Router → wählt 2-8 von 128 Experten → nur die aktiven werden berechnet
Warum MoE für lokale KI zählt
| Vorteil | Erklärung |
|---|---|
| Schnell | Nur aktive Parameter werden berechnet → mehr Tokens/Sekunde |
| Qualität | Große Gesamt-Parameterzahl = mehr Wissen gespeichert |
| Effizient | Besseres Qualität/Geschwindigkeit-Verhältnis als Dense-Modelle |
| Die Falle | Erklärung |
|---|---|
| Gesamt-Speicher | ALLE Parameter müssen im RAM/VRAM liegen auch die inaktiven |
| VRAM-Bedarf | gpt-oss-120b braucht ~60-80 GB, Qwen3-235B ~130+ GB |
| Offloading | MoE + RAM-Offloading (CPU/GPU-Mix) ist trickreicher als bei Dense |
Wichtige MoE-Modelle für lokale Nutzung
| Modell | Gesamt | Aktiv | VRAM/RAM nötig | Für was |
|---|---|---|---|---|
| gpt-oss-120b | ~120B | ~5B aktiv | ~60-80 GB | Bestes Open-Modell, Agenten, Reasoning |
| Qwen3-30B-A3B | 30B | 3B | ~20 GB | Allround, schnell, gute Qualität |
| Qwen3-235B-A22B | 235B | 22B | ~130+ GB | Top-Qualität, nur auf Servern |
| Mixtral 8x7B | 47B | ~13B | ~26 GB | Klassiker, gut eingeführt |
| Mixtral 8x22B | 141B | ~39B | ~80+ GB | Große Qualität, schwer lokal |
| DeepSeek-V3/R1 | 671B | 37B | ~400+ GB | Nicht realistisch lokal (nur API) |
| Llama 4 Scout | 109B | 17B | ~60 GB | MoE mit guter Code-Fähigkeit |
Hardware-Realität
Das ist der Knackpunkt: MoE-Modelle sind schnell, aber speicherhungrig. Alle Parameter müssen verfügbar sein, auch wenn pro Token nur wenige aktiv sind.
- gpt-oss-120b (~60-80 GB): Auf einer RTX 4090 (24 GB) unmöglich. Auf einem Mini-PC mit 128 GB Unified Memory (MS-S1 Max) läuft es, langsam (~10-15 tok/s), aber komplett lokal. Siehe Homelab-Guide.
- Qwen3-30B-A3B (~20 GB): Läuft auf einer 24-GB-GPU oder einem 32-GB-Mac, das Sweetspot-MoE für Desktop.
- CPU-Inferenz: MoE auf CPU ist möglich, aber langsam, große Speicherbandbreite hilft (siehe Speicherbandbreite).
MoE vs. Dense, wann was?
MoE wählen wenn:
- Du viel RAM/VRAM hast (>24 GB) und maximale Qualität pro Token willst.
- Geschwindigkeit wichtig ist (aktive Parameter klein).
- Du große Modelle lokal willst, die als Dense unbezahlbar wären.
Dense wählen wenn:
- Wenig Speicher (<16 GB), ein 7B/8B-Dense ist kleiner und vorhersehbarer.
- Einfachheit zählt: Dense-Modelle sind unkomplizierter zu quantisieren/deployen.
- Latenz-kritisch auf schwacher Hardware: Dense hat konstante Aktivierungskosten.
Praxis-Tipps
- Ollama:
ollama run gpt-oss:120boderqwen3:30b-a3b: MoE läuft wie jedes andere Modell, nur die RAM-Anforderung ist höher. - Quantisierung: MoE-Modelle gut quantisierbar (Q4_M etc.): Speicherbedarf sinkt deutlich.
- Offloading: Bei knapper GPU MoE-Layer auf CPU auslagern (
--n-gpu-layers), siehe GPU-Offloading. - llama.cpp: Unterstützt MoE mit Expert-Parallelism, für Multi-Node-Cluster.
Weiterführende Links
- IRC-Coding.de: Programmier-Tutorials: Modell-Inferenz, GPU-Config.
- Homelab-Guide: Hardware für große MoE-Modelle.
- KI-Mini-PC: 128-GB-Maschinen.
- Textmodelle: Modellvergleich.
- VRAM-Rechner: Speicherbedarf berechnen.
- Quantisierung: GGUF und Quants.
Key Takeaways:
- MoE aktiviert pro Token nur einige Experten, schnell wie klein, schlau wie groß.
- Aber: Alle Parameter müssen ins RAM/VRAM, die Gesamtgröße ist der Speicher-Bedarf.
- gpt-oss-120b, Qwen3-MoE, Mixtral sind die relevanten lokalen MoE-Modelle.
- 128-GB-Maschinen (MS-S1 Max) machen 120B-MoE lokal möglich.
- Für <16 GB Hardware bleiben Dense-Modelle praktischer.
FAQ
Was ist MoE?
Warum ist MoE schneller?
Was ist die MoE-Falle?
Welches MoE für zu Hause?
MoE auf CPU?
Ist MoE die Zukunft?
Quellen und weiterführende Literatur
- Mixtral Paper: MoE-Grundlagen.
- Qwen3: Qwen-MoE-Modelle.
- IRC-Coding.de: Programmier-Tutorials.


