Skip to content
BotServBotServ
Mac miniM4M4 ProApple SiliconOllamaUnified MemoryIA local

Mac mini para IA local: Setup y rendimiento

Mac mini M4, M4 Pro y M4 Max para IA local. Configura Ollama, carga modelos y optimiza rendimiento.

S

schutzgeist

5 min read
Mac mini para IA local: Setup y rendimiento

Mac mini para IA local: configuración y rendimiento

Qué cubre este artículo

  • Cómo configurar Ollama en un Mac mini.
  • Qué modelos funcionan en las diferentes variantes M4.
  • Cuánta Unified Memory necesitas para cada modelo.
  • Consejos de rendimiento para máxima velocidad.
  • Dónde están los límites del Mac mini para IA.

Introducción: Mac mini para IA

El Mac mini es la máquina de escritorio más compacta de Apple. Con los procesadores M4, se ha convertido en una herramienta seria para IA. Cabe en cualquier escritorio, funciona casi en silencio y consume poca energía. Para IA local destaca porque ofrece Unified Memory: CPU y GPU comparten el mismo espacio de memoria, lo que permite cargar modelos grandes sin necesidad de una tarjeta gráfica cara.

¿Por qué Mac mini para IA?

Imagina que quieres ejecutar un modelo de 13B localmente. En una PC necesitarías una GPU con al menos 8 GB de VRAM o mucha RAM para una inferencia lenta por CPU. Un Mac mini con M4 y 32 GB de Unified Memory carga el modelo en la memoria compartida, y la GPU accede directamente a él. Sin copias de datos, sin tarjeta gráfica separada, sin problemas de controladores.

Mac mini explicado brevemente

El Mac mini es una máquina de escritorio compacta de Apple con procesador Apple Silicon. Para IA local utiliza el framework Metal para aceleración por GPU. Ollama, LM Studio y llama.cpp funcionan de forma nativa. La decisión más importante es la configuración de memoria: 16 GB para modelos pequeños, 32 GB para 13B, 64 GB para 30B y superiores.

¿Para quién es el Mac mini?

  • Principiantes que quieren probar IA local sin instalar una GPU.
  • Desarrolladores que buscan una máquina compacta para prototipado con IA.
  • Usuarios particulares que quieren ejecutar Ollama o LM Studio sin ruido ni facturas de electricidad.
  • Equipos que necesitan un servidor IA pequeño para RAG o agentes.

Términos importantes

TérminoSignificado
Mac miniMáquina de escritorio compacta de Apple
M4Generación actual de Apple Silicon
M4 ProVariante más potente con más núcleos
M4 MaxVariante top con hasta 128 GB de Unified Memory
Unified MemoryMemoria compartida entre CPU y GPU
MetalAPI de compute para GPU de Apple
GPU CoresNúmero de núcleos de computación GPU
Memory BandwidthAncho de banda de memoria, importante para velocidad
OllamaSoftware más popular para modelos locales
Token/sMétrica de velocidad para generación de texto

Variantes del Mac mini

VarianteOpciones de MemoryGPU CoresAncho de bandaPrecio desde
M416, 24, 32 GB10120 GB/saprox. 700 EUR
M4 Pro24, 48, 64 GB16-20273 GB/saprox. 1.400 EUR
M4 Max36, 64, 128 GB32-40546 GB/saprox. 2.200 EUR

Configurar Ollama en el Mac mini

La instalación en macOS es particularmente sencilla:

# Instalar Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Cargar el primer modelo
ollama run llama3.2

# Modelo con más parámetros
ollama run llama3.1:8b

Después de la instalación, Ollama se ejecuta automáticamente en segundo plano. Puedes utilizar los modelos a través de la terminal o mediante una interfaz como Open WebUI.

¿Qué modelos funcionan?

ModeloParámetrosRequisito MemoryM4 16GBM4 Pro 32GBM4 Max 64GB
Llama 3.2 3B3B~3 GBrápidorápidomuy rápido
Llama 3.1 8B8B~6 GBbienrápidomuy rápido
Mistral 7B7B~5 GBbienrápidomuy rápido
Llama 3.1 13B13B~10 GBlentobienrápido
Qwen 2.5 30B30B~22 GBnobienrápido
Llama 3.1 70B70B~45 GBnonoposible (Q4)

Consejos de rendimiento

  • Usa cuantización: Los modelos Q4 requieren la mitad de memoria que Q8. Ejecuta ollama run llama3.1:70b-q4_K_M.
  • GPU Layers: Ollama utiliza Metal automáticamente en Apple Silicon. No necesitas configurar GPU Layers manualmente.
  • Context Window: Una ventana de contexto grande consume más memoria. Redúcela si tienes RAM limitado.
  • Cierra otras aplicaciones: El navegador y otras apps compiten por la Unified Memory.
  • LM Studio para ajustes finos: LM Studio muestra consumo de VRAM y utilización de GPU visualmente.

Modelos Mac mini recomendados en Amazon

Apple Silicon Macs en Amazon Shop

Bei Amazon ansehen

Affiliate-Link: Bei einem Kauf erhalten wir möglicherweise eine Provision.

Mac mini vs. PC con GPU

CaracterísticaMac mini M4 ProPC con RTX 4070
Precioaprox. 1.400 EURaprox. 1.500 EUR
Memoria GPU48 GB Unified12 GB VRAM
Modelo máximo30B+13B
Velocidad 7Brápidomuy rápido
Velocidad 30Bbienno posible
Ruidosilenciosoaudible
Consumo energéticoaprox. 40Waprox. 300W
Mejorasno posiblesGPU intercambiable

Obstáculos típicos

  • Memoria insuficiente: 16 GB se queda corto rápidamente. Es mejor elegir 24 GB o 32 GB.
  • Sin CUDA: Algunas herramientas de IA requieren CUDA y no funcionan en Mac.
  • Memory no ampliable: Apple Silicon está soldado. No es posible actualizar después.
  • Compatibilidad Metal: No todos los modelos están optimizados para Metal, algunos funcionan más lentamente.
  • Límites térmicos: Con carga sostenida, el Mac mini reduce la velocidad de GPU, lo que disminuye el rendimiento.
  • Soporte de software: Algunas librerías Python para IA solo soportan CUDA, no Metal.
  • Precio de memoria grande: 128 GB de Unified Memory es caro, una PC con 128 GB de RAM es más económica.

Hardware, costos y seguridad

El Mac mini consume solo 20-40 vatios durante la operación, lo que lo hace muy eficiente energéticamente. El costo de adquisición varía entre 700 y 3.500 EUR según la configuración. Dado que todos los datos se procesan localmente, tus datos permanecen en tu dispositivo. Sin nube, sin APIs externas.

Enlaces relacionados

FAQ: Mac mini para IA - Preguntas comunes

¿Puedo usar CUDA en el Mac mini?

No, CUDA es específico de NVIDIA. El Mac mini utiliza Metal para aceleración por GPU. Ollama, LM Studio y llama.cpp soportan Metal de forma nativa.

¿Cuánta Unified Memory necesito?

Para modelos de 7B son suficientes 16 GB. Para 13B recomiendo 24-32 GB. Para 30B necesitas 48 GB o más. Para 70B al menos 64 GB.

¿Es ruidoso el Mac mini?

No, el Mac mini es prácticamente silencioso en operación normal. Con carga sostenida el ventilador puede hacerse audible, pero sigue siendo mucho más silencioso que una PC.

¿Puedo usar el Mac mini como servidor de IA?

Sí, puedes ejecutar Ollama en segundo plano y hacerlo accesible a través de la red. Con Open WebUI obtienes una interfaz similar a ChatGPT.

¿Vale la pena M4 Pro en lugar de M4?

Si quieres ejecutar modelos de 13B en adelante, sí. M4 Pro ofrece más GPU Cores y mayor ancho de banda de memoria, lo que acelera notablemente la inferencia.

¿Puedo usar generación de imágenes en el Mac mini?

Sí, Stable Diffusion y ComfyUI funcionan en Apple Silicon. La velocidad es más lenta que en una NVIDIA RTX 4090.

¿Necesito monitor para el Mac mini?

Para la configuración inicial sí. Después puedes ejecutar el Mac mini sin monitor y controlarlo remotamente vía SSH o Open WebUI.

¿Qué tan rápido es Ollama en el Mac mini?

Un M4 Pro logra aproximadamente 30-50 Token/s con modelos de 7B. Con 13B alrededor de 15-25 Token/s. Esto es fluido para uso interactivo.

¿Puedo cargar varios modelos simultáneamente?

Sí, siempre que haya suficiente memoria. Con 32 GB puedes ejecutar un modelo de 7B y un modelo de embedding en paralelo.

¿Qué es mejor: Mac mini o Mac Studio?

El Mac Studio ofrece más memoria (hasta 192 GB) y más potencia GPU para modelos grandes. El Mac mini es más compacto y económico para comenzar.

Fuentes y lecturas adicionales

  • Apple Silicon Technical Overview (developer.apple.com)
  • Ollama Documentation (ollama.com)
  • llama.cpp Metal Support (github.com/llama.cpp)
  • MLX Framework para Apple Silicon (github.com/ml-explore/mlx)
Volver al blog
Share:

Entradas relacionadas