Entender los modelos MoE: Mixture of Experts para IA local
Qué cubre este artículo
- Qué es MoE (Mixture of Experts) técnicamente, de forma breve y clara.
- Por qué MoE es un cambio radical para IA local: modelos enormes, inferencia rápida.
- La trampa de hardware: todos los parámetros deben caber en RAM/VRAM.
- Qué modelos MoE funcionan localmente y qué hardware necesitan.
Introducción
MoE (Mixture of Experts) es la arquitectura detrás de los modelos abiertos más potentes de los últimos años: Mixtral, DeepSeek-V3/R1, Qwen3-MoE, Llama 4 Scout, gpt-oss-120b. En lugar de pasar cada token a través de todos los parámetros, un modelo MoE activa por token solo un pequeño subconjunto de “expertos”, un router decide cuáles.
El resultado: un modelo con la capacidad de un gigante, pero la velocidad de uno pequeño, y eso es exactamente lo que hace interesante MoE para IA local.
Cómo funciona MoE (comprimido)
Modelo Dense (clásico): cada token atraviesa todas las capas con todos los parámetros. Un modelo de 70B utiliza ~70B parámetros por token, es lento y computacionalmente intensivo.
Modelo MoE: las capas FFN se dividen en muchos “expertos” (por ejemplo, 128). Un router selecciona por token los Top-2 hasta Top-8 expertos más adecuados.
Ejemplo Qwen3-30B-A3B: 30,5B parámetros totales, pero solo ~3,3B activos por token. Velocidad de inferencia como un modelo de 3B, calidad como uno mucho más grande.
Token → Router → selecciona 2-8 de 128 expertos → solo se calculan los activos
Por qué MoE importa para IA local
| Ventaja | Explicación |
|---|---|
| Rápido | Solo se calculan parámetros activos, más tokens/segundo |
| Calidad | Número total de parámetros grande = más conocimiento almacenado |
| Eficiente | Mejor relación calidad/velocidad que modelos Dense |
| La trampa | Explicación |
|---|---|
| Memoria total | TODOS los parámetros deben estar en RAM/VRAM, incluso los inactivos |
| Necesidad de VRAM | gpt-oss-120b necesita ~60-80 GB, Qwen3-235B ~130+ GB |
| Offloading | MoE + offloading a RAM (CPU/GPU mixto) es más complicado que en Dense |
Modelos MoE importantes para uso local
| Modelo | Total | Activos | VRAM/RAM necesarios | Uso |
|---|---|---|---|---|
| gpt-oss-120b | ~120B | ~5B activos | ~60-80 GB | Mejor modelo abierto, agentes, razonamiento |
| Qwen3-30B-A3B | 30B | 3B | ~20 GB | Propósito general, rápido, buena calidad |
| Qwen3-235B-A22B | 235B | 22B | ~130+ GB | Calidad top, solo en servidores |
| Mixtral 8x7B | 47B | ~13B | ~26 GB | Clásico, bien establecido |
| Mixtral 8x22B | 141B | ~39B | ~80+ GB | Gran calidad, difícil localmente |
| DeepSeek-V3/R1 | 671B | 37B | ~400+ GB | Poco realista localmente (solo API) |
| Llama 4 Scout | 109B | 17B | ~60 GB | MoE con buena capacidad de código |
La realidad del hardware
Este es el punto crítico: los modelos MoE son rápidos, pero consumen mucha memoria. Todos los parámetros deben estar disponibles, aunque solo algunos sean activos por token.
- gpt-oss-120b (~60-80 GB): imposible en una RTX 4090 (24 GB). En un mini-PC con 128 GB de Unified Memory (MS-S1 Max) funciona, lentamente (~10-15 tok/s), pero completamente local. Ver guía de Homelab.
- Qwen3-30B-A3B (~20 GB): funciona en una GPU de 24 GB o en un Mac de 32 GB, el punto óptimo de MoE para desktop.
- Inferencia en CPU: MoE en CPU es posible, pero lento, el ancho de banda de memoria ayuda (ver ancho de banda de memoria).
MoE vs. Dense, cuándo qué
Elige MoE si:
- tienes mucho RAM/VRAM (>24 GB) y quieres máxima calidad por token.
- la velocidad es importante (parámetros activos pequeños).
- quieres modelos grandes localmente que como Dense serían inasequibles.
Elige Dense si:
- tienes poco almacenamiento (menos de 16 GB), un Dense de 7B/8B es más pequeño y predecible.
- cuenta la simplicidad: los modelos Dense son más directos de cuantizar y desplegar.
- es crítico por latencia en hardware débil: Dense tiene costos de activación constantes.
Consejos prácticos
- Ollama:
ollama run gpt-oss:120boqwen3:30b-a3b: MoE funciona como cualquier otro modelo, solo que la necesidad de RAM es mayor. - Cuantización: los modelos MoE se cuantizan bien (Q4_M etc.): la necesidad de memoria baja notablemente.
- Offloading: con GPU escasa, saca las capas MoE a CPU (
--n-gpu-layers), ver GPU-Offloading. - llama.cpp: soporta MoE con Expert-Parallelism, para clusters multi-nodo.
Enlaces relacionados
- IRC-Coding.de: tutoriales de programación: inferencia de modelos, configuración de GPU.
- Guía de Homelab: hardware para modelos MoE grandes.
- Mini-PC de IA: máquinas de 128 GB.
- Modelos de texto: comparación de modelos.
- Calculadora VRAM: calcula necesidad de memoria.
- Cuantización: GGUF y cuantos.
Puntos clave:
- MoE activa solo algunos expertos por token, rápido como uno pequeño, inteligente como uno grande.
- Pero: todos los parámetros deben entrar en RAM/VRAM, el tamaño total es la necesidad de memoria.
- gpt-oss-120b, Qwen3-MoE, Mixtral son los modelos MoE locales relevantes.
- Máquinas de 128 GB (MS-S1 Max) hacen posible MoE de 120B localmente.
- Para hardware con menos de 16 GB siguen siendo más prácticos los modelos Dense.
FAQ
¿Qué es MoE?
¿Por qué MoE es más rápido?
¿Cuál es la trampa de MoE?
¿Qué MoE para casa?
¿MoE en CPU?
¿Es MoE el futuro?
Fuentes y lecturas adicionales
- Mixtral Paper: fundamentos de MoE.
- Qwen3: modelos Qwen-MoE.
- IRC-Coding.de: tutoriales de programación.


