Skip to content
BotServBotServ
MoEMixture of Expertsgpt-oss-120bMixtralQwen3DeepSeekModelos

Modelos MoE: Mixture of Experts para IA local

Qué son los modelos Mixture of Experts, por qué importan para IA local y cuáles valen la pena: gpt-oss-120b, Qwen3, Mixtral.

S

schutzgeist

4 min read
Modelos MoE: Mixture of Experts para IA local

Entender los modelos MoE: Mixture of Experts para IA local

Qué cubre este artículo

  • Qué es MoE (Mixture of Experts) técnicamente, de forma breve y clara.
  • Por qué MoE es un cambio radical para IA local: modelos enormes, inferencia rápida.
  • La trampa de hardware: todos los parámetros deben caber en RAM/VRAM.
  • Qué modelos MoE funcionan localmente y qué hardware necesitan.

Introducción

MoE (Mixture of Experts) es la arquitectura detrás de los modelos abiertos más potentes de los últimos años: Mixtral, DeepSeek-V3/R1, Qwen3-MoE, Llama 4 Scout, gpt-oss-120b. En lugar de pasar cada token a través de todos los parámetros, un modelo MoE activa por token solo un pequeño subconjunto de “expertos”, un router decide cuáles.

El resultado: un modelo con la capacidad de un gigante, pero la velocidad de uno pequeño, y eso es exactamente lo que hace interesante MoE para IA local.

Cómo funciona MoE (comprimido)

Modelo Dense (clásico): cada token atraviesa todas las capas con todos los parámetros. Un modelo de 70B utiliza ~70B parámetros por token, es lento y computacionalmente intensivo.

Modelo MoE: las capas FFN se dividen en muchos “expertos” (por ejemplo, 128). Un router selecciona por token los Top-2 hasta Top-8 expertos más adecuados.

Ejemplo Qwen3-30B-A3B: 30,5B parámetros totales, pero solo ~3,3B activos por token. Velocidad de inferencia como un modelo de 3B, calidad como uno mucho más grande.

Token → Router → selecciona 2-8 de 128 expertos → solo se calculan los activos

Por qué MoE importa para IA local

VentajaExplicación
RápidoSolo se calculan parámetros activos, más tokens/segundo
CalidadNúmero total de parámetros grande = más conocimiento almacenado
EficienteMejor relación calidad/velocidad que modelos Dense
La trampaExplicación
Memoria totalTODOS los parámetros deben estar en RAM/VRAM, incluso los inactivos
Necesidad de VRAMgpt-oss-120b necesita ~60-80 GB, Qwen3-235B ~130+ GB
OffloadingMoE + offloading a RAM (CPU/GPU mixto) es más complicado que en Dense

Modelos MoE importantes para uso local

ModeloTotalActivosVRAM/RAM necesariosUso
gpt-oss-120b~120B~5B activos~60-80 GBMejor modelo abierto, agentes, razonamiento
Qwen3-30B-A3B30B3B~20 GBPropósito general, rápido, buena calidad
Qwen3-235B-A22B235B22B~130+ GBCalidad top, solo en servidores
Mixtral 8x7B47B~13B~26 GBClásico, bien establecido
Mixtral 8x22B141B~39B~80+ GBGran calidad, difícil localmente
DeepSeek-V3/R1671B37B~400+ GBPoco realista localmente (solo API)
Llama 4 Scout109B17B~60 GBMoE con buena capacidad de código

La realidad del hardware

Este es el punto crítico: los modelos MoE son rápidos, pero consumen mucha memoria. Todos los parámetros deben estar disponibles, aunque solo algunos sean activos por token.

  • gpt-oss-120b (~60-80 GB): imposible en una RTX 4090 (24 GB). En un mini-PC con 128 GB de Unified Memory (MS-S1 Max) funciona, lentamente (~10-15 tok/s), pero completamente local. Ver guía de Homelab.
  • Qwen3-30B-A3B (~20 GB): funciona en una GPU de 24 GB o en un Mac de 32 GB, el punto óptimo de MoE para desktop.
  • Inferencia en CPU: MoE en CPU es posible, pero lento, el ancho de banda de memoria ayuda (ver ancho de banda de memoria).

MoE vs. Dense, cuándo qué

Elige MoE si:

  • tienes mucho RAM/VRAM (>24 GB) y quieres máxima calidad por token.
  • la velocidad es importante (parámetros activos pequeños).
  • quieres modelos grandes localmente que como Dense serían inasequibles.

Elige Dense si:

  • tienes poco almacenamiento (menos de 16 GB), un Dense de 7B/8B es más pequeño y predecible.
  • cuenta la simplicidad: los modelos Dense son más directos de cuantizar y desplegar.
  • es crítico por latencia en hardware débil: Dense tiene costos de activación constantes.

Consejos prácticos

  • Ollama: ollama run gpt-oss:120b o qwen3:30b-a3b: MoE funciona como cualquier otro modelo, solo que la necesidad de RAM es mayor.
  • Cuantización: los modelos MoE se cuantizan bien (Q4_M etc.): la necesidad de memoria baja notablemente.
  • Offloading: con GPU escasa, saca las capas MoE a CPU (--n-gpu-layers), ver GPU-Offloading.
  • llama.cpp: soporta MoE con Expert-Parallelism, para clusters multi-nodo.

Enlaces relacionados

Puntos clave:

  • MoE activa solo algunos expertos por token, rápido como uno pequeño, inteligente como uno grande.
  • Pero: todos los parámetros deben entrar en RAM/VRAM, el tamaño total es la necesidad de memoria.
  • gpt-oss-120b, Qwen3-MoE, Mixtral son los modelos MoE locales relevantes.
  • Máquinas de 128 GB (MS-S1 Max) hacen posible MoE de 120B localmente.
  • Para hardware con menos de 16 GB siguen siendo más prácticos los modelos Dense.

FAQ

¿Qué es MoE?

Mixture of Experts: en lugar de usar todos los parámetros por token, una red router selecciona 2-8 de muchas subredes de expertos. Resultado: gran capacidad total, pequeño costo computacional por token.

¿Por qué MoE es más rápido?

Porque solo se calculan los expertos activos. Qwen3-30B-A3B usa solo ~3B parámetros por token: velocidad de inferencia como un modelo de 3B, pero con 30B de conocimiento total.

¿Cuál es la trampa de MoE?

Todos los parámetros deben estar en memoria, incluso los inactivos. gpt-oss-120b necesita ~60-80 GB, aunque solo ~5B sean activos por token. MoE es rápido, pero consume mucha memoria.

¿Qué MoE para casa?

Qwen3-30B-A3B (~20 GB) para PCs con GPU normal; gpt-oss-120b para máquinas de 128 GB como el MS-S1 Max. Mixtral 8x7B como clásico compacto.

¿MoE en CPU?

Es posible pero lento: MoE se beneficia del ancho de banda de memoria. En máquinas con Unified Memory (Mac, Strix Halo) mejor que en CPU+RAM clásico. Para CPU generalmente un modelo Dense pequeño es más rápido.

¿Es MoE el futuro?

Parece que sí, casi todos los modelos buque insignia nuevos (DeepSeek, Qwen3, Llama 4, gpt-oss) son MoE. La arquitectura escala mejor que Dense.

Fuentes y lecturas adicionales

Volver al blog
Share:

Entradas relacionadas