Mac mini para IA local: configuración y rendimiento
Qué cubre este artículo
- Cómo configurar Ollama en un Mac mini.
- Qué modelos funcionan en las diferentes variantes M4.
- Cuánta Unified Memory necesitas para cada modelo.
- Consejos de rendimiento para máxima velocidad.
- Dónde están los límites del Mac mini para IA.
Introducción: Mac mini para IA
El Mac mini es la máquina de escritorio más compacta de Apple. Con los procesadores M4, se ha convertido en una herramienta seria para IA. Cabe en cualquier escritorio, funciona casi en silencio y consume poca energía. Para IA local destaca porque ofrece Unified Memory: CPU y GPU comparten el mismo espacio de memoria, lo que permite cargar modelos grandes sin necesidad de una tarjeta gráfica cara.
¿Por qué Mac mini para IA?
Imagina que quieres ejecutar un modelo de 13B localmente. En una PC necesitarías una GPU con al menos 8 GB de VRAM o mucha RAM para una inferencia lenta por CPU. Un Mac mini con M4 y 32 GB de Unified Memory carga el modelo en la memoria compartida, y la GPU accede directamente a él. Sin copias de datos, sin tarjeta gráfica separada, sin problemas de controladores.
Mac mini explicado brevemente
El Mac mini es una máquina de escritorio compacta de Apple con procesador Apple Silicon. Para IA local utiliza el framework Metal para aceleración por GPU. Ollama, LM Studio y llama.cpp funcionan de forma nativa. La decisión más importante es la configuración de memoria: 16 GB para modelos pequeños, 32 GB para 13B, 64 GB para 30B y superiores.
¿Para quién es el Mac mini?
- Principiantes que quieren probar IA local sin instalar una GPU.
- Desarrolladores que buscan una máquina compacta para prototipado con IA.
- Usuarios particulares que quieren ejecutar Ollama o LM Studio sin ruido ni facturas de electricidad.
- Equipos que necesitan un servidor IA pequeño para RAG o agentes.
Términos importantes
| Término | Significado |
|---|---|
| Mac mini | Máquina de escritorio compacta de Apple |
| M4 | Generación actual de Apple Silicon |
| M4 Pro | Variante más potente con más núcleos |
| M4 Max | Variante top con hasta 128 GB de Unified Memory |
| Unified Memory | Memoria compartida entre CPU y GPU |
| Metal | API de compute para GPU de Apple |
| GPU Cores | Número de núcleos de computación GPU |
| Memory Bandwidth | Ancho de banda de memoria, importante para velocidad |
| Ollama | Software más popular para modelos locales |
| Token/s | Métrica de velocidad para generación de texto |
Variantes del Mac mini
| Variante | Opciones de Memory | GPU Cores | Ancho de banda | Precio desde |
|---|---|---|---|---|
| M4 | 16, 24, 32 GB | 10 | 120 GB/s | aprox. 700 EUR |
| M4 Pro | 24, 48, 64 GB | 16-20 | 273 GB/s | aprox. 1.400 EUR |
| M4 Max | 36, 64, 128 GB | 32-40 | 546 GB/s | aprox. 2.200 EUR |
Configurar Ollama en el Mac mini
La instalación en macOS es particularmente sencilla:
# Instalar Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Cargar el primer modelo
ollama run llama3.2
# Modelo con más parámetros
ollama run llama3.1:8b
Después de la instalación, Ollama se ejecuta automáticamente en segundo plano. Puedes utilizar los modelos a través de la terminal o mediante una interfaz como Open WebUI.
¿Qué modelos funcionan?
| Modelo | Parámetros | Requisito Memory | M4 16GB | M4 Pro 32GB | M4 Max 64GB |
|---|---|---|---|---|---|
| Llama 3.2 3B | 3B | ~3 GB | rápido | rápido | muy rápido |
| Llama 3.1 8B | 8B | ~6 GB | bien | rápido | muy rápido |
| Mistral 7B | 7B | ~5 GB | bien | rápido | muy rápido |
| Llama 3.1 13B | 13B | ~10 GB | lento | bien | rápido |
| Qwen 2.5 30B | 30B | ~22 GB | no | bien | rápido |
| Llama 3.1 70B | 70B | ~45 GB | no | no | posible (Q4) |
Consejos de rendimiento
- Usa cuantización: Los modelos Q4 requieren la mitad de memoria que Q8. Ejecuta
ollama run llama3.1:70b-q4_K_M. - GPU Layers: Ollama utiliza Metal automáticamente en Apple Silicon. No necesitas configurar GPU Layers manualmente.
- Context Window: Una ventana de contexto grande consume más memoria. Redúcela si tienes RAM limitado.
- Cierra otras aplicaciones: El navegador y otras apps compiten por la Unified Memory.
- LM Studio para ajustes finos: LM Studio muestra consumo de VRAM y utilización de GPU visualmente.
Modelos Mac mini recomendados en Amazon
Apple Silicon Macs en Amazon Shop
Bei Amazon ansehenAffiliate-Link: Bei einem Kauf erhalten wir möglicherweise eine Provision.
Mac mini vs. PC con GPU
| Característica | Mac mini M4 Pro | PC con RTX 4070 |
|---|---|---|
| Precio | aprox. 1.400 EUR | aprox. 1.500 EUR |
| Memoria GPU | 48 GB Unified | 12 GB VRAM |
| Modelo máximo | 30B+ | 13B |
| Velocidad 7B | rápido | muy rápido |
| Velocidad 30B | bien | no posible |
| Ruido | silencioso | audible |
| Consumo energético | aprox. 40W | aprox. 300W |
| Mejoras | no posibles | GPU intercambiable |
Obstáculos típicos
- Memoria insuficiente: 16 GB se queda corto rápidamente. Es mejor elegir 24 GB o 32 GB.
- Sin CUDA: Algunas herramientas de IA requieren CUDA y no funcionan en Mac.
- Memory no ampliable: Apple Silicon está soldado. No es posible actualizar después.
- Compatibilidad Metal: No todos los modelos están optimizados para Metal, algunos funcionan más lentamente.
- Límites térmicos: Con carga sostenida, el Mac mini reduce la velocidad de GPU, lo que disminuye el rendimiento.
- Soporte de software: Algunas librerías Python para IA solo soportan CUDA, no Metal.
- Precio de memoria grande: 128 GB de Unified Memory es caro, una PC con 128 GB de RAM es más económica.
Hardware, costos y seguridad
El Mac mini consume solo 20-40 vatios durante la operación, lo que lo hace muy eficiente energéticamente. El costo de adquisición varía entre 700 y 3.500 EUR según la configuración. Dado que todos los datos se procesan localmente, tus datos permanecen en tu dispositivo. Sin nube, sin APIs externas.
Enlaces relacionados
- Descripción general de Apple Silicon
- Mac Studio para IA
- Guía de compra Mac mini
- Fundamentos de Unified Memory
- Ollama en macOS
- Cuantización
- Ancho de banda de memoria
FAQ: Mac mini para IA - Preguntas comunes
¿Puedo usar CUDA en el Mac mini?
No, CUDA es específico de NVIDIA. El Mac mini utiliza Metal para aceleración por GPU. Ollama, LM Studio y llama.cpp soportan Metal de forma nativa.
¿Cuánta Unified Memory necesito?
Para modelos de 7B son suficientes 16 GB. Para 13B recomiendo 24-32 GB. Para 30B necesitas 48 GB o más. Para 70B al menos 64 GB.
¿Es ruidoso el Mac mini?
No, el Mac mini es prácticamente silencioso en operación normal. Con carga sostenida el ventilador puede hacerse audible, pero sigue siendo mucho más silencioso que una PC.
¿Puedo usar el Mac mini como servidor de IA?
Sí, puedes ejecutar Ollama en segundo plano y hacerlo accesible a través de la red. Con Open WebUI obtienes una interfaz similar a ChatGPT.
¿Vale la pena M4 Pro en lugar de M4?
Si quieres ejecutar modelos de 13B en adelante, sí. M4 Pro ofrece más GPU Cores y mayor ancho de banda de memoria, lo que acelera notablemente la inferencia.
¿Puedo usar generación de imágenes en el Mac mini?
Sí, Stable Diffusion y ComfyUI funcionan en Apple Silicon. La velocidad es más lenta que en una NVIDIA RTX 4090.
¿Necesito monitor para el Mac mini?
Para la configuración inicial sí. Después puedes ejecutar el Mac mini sin monitor y controlarlo remotamente vía SSH o Open WebUI.
¿Qué tan rápido es Ollama en el Mac mini?
Un M4 Pro logra aproximadamente 30-50 Token/s con modelos de 7B. Con 13B alrededor de 15-25 Token/s. Esto es fluido para uso interactivo.
¿Puedo cargar varios modelos simultáneamente?
Sí, siempre que haya suficiente memoria. Con 32 GB puedes ejecutar un modelo de 7B y un modelo de embedding en paralelo.
¿Qué es mejor: Mac mini o Mac Studio?
El Mac Studio ofrece más memoria (hasta 192 GB) y más potencia GPU para modelos grandes. El Mac mini es más compacto y económico para comenzar.
Fuentes y lecturas adicionales
- Apple Silicon Technical Overview (developer.apple.com)
- Ollama Documentation (ollama.com)
- llama.cpp Metal Support (github.com/llama.cpp)
- MLX Framework para Apple Silicon (github.com/ml-explore/mlx)


