Skip to content
BotServBotServ
OllamamacOSApple SiliconM1M2M3M4MetalUnified MemoryIA local

Ollama en macOS: Instalación y configuración

Instala Ollama en macOS y Apple Silicon. Guía paso a paso con Unified Memory, Metal Framework y consejos para usuarios Mac.

S

schutzgeist

12 min read
Ollama en macOS: Instalación y configuración

Ollama en macOS: instalación y configuración

Qué cubre este artículo sobre Ollama en macOS

  • Instalación de Ollama en macOS mediante DMG y Homebrew
  • Uso del framework Metal en Apple Silicon para inferencia acelerada por GPU
  • Unified Memory en chips M-Series y cuánta RAM necesitas para cada modelo
  • Configuración de la ubicación de almacenamiento de modelos e inicio automático mediante LaunchAgent
  • Problemas típicos y soluciones para usuarios de Mac

Introducción: Ollama en macOS explicado claramente

Ollama es un entorno de ejecución que te permite ejecutar Large Language Models localmente en tu ordenador. En macOS funciona especialmente bien porque Apple Silicon cuenta con Unified Memory. Esto significa que la CPU y la GPU comparten el mismo espacio de direcciones de memoria. No necesitas una tarjeta gráfica separada con su propio VRAM para cargar modelos con aceleración GPU. Ollama utiliza el framework Metal de Apple para acceder automáticamente a la GPU de los chips M-Series. Este artículo te guía paso a paso a través de la instalación, configuración y uso inicial en tu Mac.

¿Por qué necesitas esta guía?

Los usuarios de Mac tienen una ventaja especial al ejecutar modelos de IA localmente: Unified Memory. Un Mac Studio con 64 GB de RAM puede, por ejemplo, cargar completamente un modelo de 34 mil millones de parámetros en la memoria compartida y ejecutarlo a través de la GPU. En un PC convencional necesitarías una tarjeta gráfica cara con suficiente VRAM. Sin embargo, muchos usuarios de Mac no saben cómo aprovechar realmente este potencial. Aunque Ollama detecta Apple Silicon automáticamente, necesitas saber cuánta RAM requieren tus modelos, cómo ajustar la ubicación de almacenamiento y cómo verificar que la GPU se está utilizando realmente. Precisamente en esto se centra esta guía.

Ollama en macOS en pocas palabras

Ollama se ejecuta en macOS como un proceso en segundo plano y proporciona una API local en http://localhost:11434. Después de la instalación, descargas un modelo con ollama pull e inicias con ollama run. En Apple Silicon, Ollama utiliza automáticamente el framework Metal para aceleración GPU. En Macs con Intel, la inferencia se realiza exclusivamente por CPU. La instalación se realiza mediante descarga DMG oficial o Homebrew.

A quién va dirigida esta guía

Esta guía es para usuarios de Mac que desean instalar y configurar Ollama por primera vez. No necesitas conocimientos previos sobre IA local. Si ya has instalado Ollama en otro sistema, aquí encontrarás las características específicas de macOS. Para las instrucciones de instalación generales en todas las plataformas, consulta Ollama installieren.

Términos importantes relacionados con Ollama en macOS

TérminoSignificado
OllamaEntorno de ejecución para modelos de lenguaje locales
Apple SiliconFamilia propia de chips de Apple, desde M1, con arquitectura ARM
Unified MemoryMemoria de trabajo compartida entre CPU y GPU en Apple Silicon
MetalFramework de gráficos y compute de Apple para aceleración GPU
M-SeriesDesignación de los chips de Apple desde M1, incluyendo M2, M3 y M4
GPU TilesUnidades GPU físicas dentro de un chip Apple Silicon
HomebrewGestor de paquetes para macOS para instalar software desde Terminal
LaunchAgentMecanismo de macOS para iniciar procesos automáticamente al hacer login
OLLAMA_MODELSVariable de entorno para especificar la ubicación de almacenamiento de modelos
Activity MonitorHerramienta de macOS para monitorear el uso de CPU, GPU y RAM

Requisitos previos

Antes de instalar Ollama, verifica los siguientes puntos:

  • Versión de macOS: Ollama requiere macOS 13.6 (Ventura) o superior. En versiones más antiguas, Ollama no funciona de manera confiable.
  • Apple Silicon vs. Intel: Ollama se ejecuta en ambas arquitecturas. Apple Silicon se acelera mediante el framework Metal. Los Macs con Intel utilizan solo la CPU y son significativamente más lentos.
  • RAM: Para modelos pequeños como Llama 3.2 con 3B parámetros, 8 GB son suficientes. Para modelos de 8B parámetros se recomienda 16 GB. Los modelos más grandes con 70B parámetros requieren 64 GB o más. Encontrarás más detalles sobre los requisitos de memoria en Unified Memory.
  • Espacio en disco: Cada modelo requiere espacio de almacenamiento. Un modelo de 8B en cuantización Q4 ocupa aproximadamente 4 a 5 GB. Asegúrate de reservar suficiente espacio, especialmente si almacenas varios modelos.

Paso 1: descargar e instalar Ollama

La forma más simple es descargar la aplicación oficial:

  1. Abre ollama.com en tu navegador.
  2. Haz clic en el botón de descarga y selecciona macOS.
  3. Descarga el archivo .zip y descomprímelo.
  4. Arrastra la aplicación Ollama a la carpeta Aplicaciones.
  5. Inicia Ollama haciendo doble clic.

En el primer inicio, Ollama configura el servicio en segundo plano. Verás un pequeño icono de Ollama en la barra de menú. El servicio se ejecuta ahora en segundo plano y la API es accesible en http://localhost:11434.

Abre Terminal y verifica la instalación:

ollama --version

Si aparece un número de versión, Ollama está listo para usar.

Paso 2: instalar con Homebrew

Como alternativa a la instalación DMG, puedes usar Homebrew. Homebrew es un gestor de paquetes para macOS que permite instalar software desde Terminal. Si aún no tienes Homebrew, instálalo primero:

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

Después, instala Ollama con un solo comando:

brew install ollama

Homebrew descarga los binarios y configura todo lo necesario. Inicia el servicio manualmente después:

ollama serve

La diferencia con la instalación DMG es que Homebrew no inicia Ollama automáticamente como una aplicación en segundo plano. Debes iniciar el servicio manualmente o configurar un LaunchAgent, lo cual se describe más adelante.

Paso 3: Apple Silicon y Metal

En Apple Silicon, Ollama utiliza automáticamente el framework Metal. Metal es la interfaz de programación de Apple para GPU-compute y gráficos. Ollama no requiere configuración adicional para usar la GPU. Cada vez que inicia un modelo, Ollama verifica si hay una GPU compatible con Metal y luego carga el modelo en la memoria unificada.

Puedes verificar si Metal está activo iniciando un modelo y observando el resultado. Ollama indica al cargar si se está utilizando la GPU. Alternativamente, en Activity Monitor bajo la pestaña “GPU” encontrarás el uso de las GPU Tiles. Si hay actividad visible mientras consultas un modelo, Ollama está usando Metal.

Encontrarás más información sobre los fundamentos de hardware en Apple Silicon.

Paso 4: iniciar el primer modelo

Después de la instalación, descargas tu primer modelo. Para empezar, Llama 3.1 con 8B parámetros es una buena opción:

ollama pull llama3.1

La descarga toma algunos minutos dependiendo de tu conexión a internet. Después, inicia el modelo:

ollama run llama3.1

Ollama abre un chat en Terminal. Puedes hacer preguntas inmediatamente. Con /bye terminas la sesión. Encontrarás más información sobre modelos adicionales y su gestión en el artículo Ollama Modelle verwalten.

Paso 5: Usar la API

Ollama expone una API HTTP local en http://localhost:11434. Puedes llamarla desde tus propias aplicaciones, scripts o automatizaciones.

Un ejemplo simple con curl:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1",
  "prompt": "Was ist lokale KI?",
  "stream": false
}'

En Python:

import requests

response = requests.post(
    "http://localhost:11434/api/generate",
    json={
        "model": "llama3.1",
        "prompt": "Erkläre Unified Memory in zwei Saetzen.",
        "stream": False
    }
)
print(response.json()["response"])

Encontrarás ejemplos más detallados y todos los endpoints en el artículo Ollama API nutzen.

Particularidades de Apple Silicon

Apple Silicon posee una característica que la hace especialmente atractiva para IA local: Unified Memory. La CPU y la GPU acceden a la misma memoria física. No hay copia de datos entre la RAM del sistema y la VRAM, como ocurre con las tarjetas gráficas tradicionales.

Para Ollama, esto significa que el tamaño completo del modelo debe caber en la RAM disponible. Un Mac con 16 GB de RAM puede cargar sin problemas un modelo de 8B en cuantización Q4, ya que ocupa unos 5 GB. Un modelo de 70B requiere alrededor de 40 GB y solo funciona en Macs con 64 GB de RAM o superior.

Así verificas el uso de GPU:

  1. Abre el Monitor de Actividad mediante Spotlight o desde la carpeta Aplicaciones.
  2. Cambia a la pestaña “GPU”.
  3. Envía una consulta a Ollama.
  4. Observa el uso de las GPU-Tiles.

Si el uso de GPU aumenta durante la inferencia, Ollama utiliza correctamente el framework Metal. Si solo está saturada la CPU, hay un problema de configuración. Más detalles sobre la arquitectura de memoria en Unified Memory y en general en LLM lokal betreiben.

Macs Intel

Ollama funciona en Macs Intel, pero sin aceleración GPU. La inferencia se ejecuta exclusivamente en CPU. Esto significa tiempos de respuesta mucho más lentos. Un modelo de 8B que responde en segundos en Apple Silicon puede tardar 30 segundos o más en un Mac Intel.

Limitaciones adicionales en Macs Intel:

  • Sin soporte Metal, por lo tanto sin GPU offloading
  • Mayor consumo de energía durante la inferencia
  • Los modelos compiten con el sistema operativo por la memoria RAM
  • Los modelos grandes a partir de 13B parámetros son prácticamente inutilizables

Para Macs Intel, es recomendable ceñirse a modelos pequeños como Llama 3.2 con 3B parámetros. Si planeas trabajar en serio con IA local, tiene sentido actualizar a un Mac con Apple Silicon. El Mac Mini es una entrada económica, mientras que el Mac Studio ofrece más opciones de RAM para modelos más grandes.

Configuración: ubicación de almacenamiento e inicio automático

Por defecto, Ollama almacena los modelos en ~/.ollama/models. Si tu SSD interna tiene poco espacio, puedes cambiar la ubicación mediante la variable de entorno OLLAMA_MODELS:

export OLLAMA_MODELS=/Volumes/External/ollama-models

Para que esta configuración sea permanente, agrégala a tu configuración de shell, por ejemplo en ~/.zshrc:

echo 'export OLLAMA_MODELS=/Volumes/External/ollama-models' >> ~/.zshrc
source ~/.zshrc

Para el inicio automático en el login, configura un LaunchAgent. Crea un archivo Property-List en ~/Library/LaunchAgents/com.ollama.plist:

<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE plist PUBLIC "-//Apple//DTD PLIST 1.0//EN" "http://www.apple.com/DTDs/PropertyList-1.0.dtd">
<plist version="1.0">
<dict>
    <key>Label</key>
    <string>com.ollama</string>
    <key>ProgramArguments</key>
    <array>
        <string>/usr/local/bin/ollama</string>
        <string>serve</string>
    </array>
    <key>RunAtLoad</key>
    <true/>
    <key>KeepAlive</key>
    <true/>
</dict>
</plist>

Después, carga el LaunchAgent:

launchctl load ~/Library/LaunchAgents/com.ollama.plist

Ollama se iniciará automáticamente en cada login. Más opciones de configuración como cambio de puerto y acceso a red las encontrarás en Ollama Konfiguration.

Trampas comunes con Ollama en macOS

  1. RAM insuficiente para el modelo elegido: Ollama carga el modelo de todas formas, pero entonces utiliza memoria de intercambio. La inferencia se vuelve extremadamente lenta. Verifica de antemano si tu RAM es suficiente para el tamaño del modelo.

  2. Metal no se utiliza: Si Ollama solo usa la CPU, la causa podría ser una versión de macOS obsoleta. Metal requiere al menos macOS 13.6. Actualiza tu sistema y reinicia Ollama.

  3. Ubicación del modelo en SSD externa no accesible: Si configuraste OLLAMA_MODELS en una unidad externa y esta no está conectada cuando inicia Ollama, el servicio falla. Asegúrate de que la unidad esté montada antes de que Ollama inicie.

  4. Puerto 11434 ya en uso: Si otro proceso utiliza el puerto, el servidor de Ollama no inicia. Verifica con lsof -i :11434 qué proceso bloquea el puerto, ciérralo o cambia el puerto de Ollama mediante OLLAMA_HOST.

  5. La ruta de Homebrew difiere entre Intel y Apple Silicon: En Macs Intel, Homebrew está en /usr/local/bin, en Apple Silicon en /opt/homebrew/bin. Ajusta la ruta en el LaunchAgent según corresponda, de lo contrario el servicio no encontrará el binario de Ollama.

  6. La sandbox de la app bloquea el acceso a la API: Si quieres llamar a Ollama desde otra aplicación y macOS bloquea el acceso, debes permitir a Ollama el acceso a la red local en Configuración del Sistema bajo “Privacidad y seguridad”.

  7. El Monitor de Actividad no muestra actividad GPU: A veces el Monitor de Actividad no actualiza la pantalla de GPU en tiempo real. Usa alternativamente la herramienta de terminal asitop o powermetrics para monitorear el uso de GPU con mayor precisión.

Hardware, costos y seguridad con Ollama en macOS

Hardware: El rendimiento de Ollama en macOS depende directamente de tu chip y tu RAM. Un M2 con 16 GB de RAM es adecuado para modelos de hasta 8B parámetros. Un M4 Max con 64 GB de RAM puede ejecutar fluidamente modelos de hasta 70B parámetros. La cantidad de GPU-Cores influye en la velocidad de la inferencia. Más cores significan generación de tokens más rápida.

Costos: Ollama es gratuito y de código abierto. No pagas honorarios de licencia ni costos de API. Los únicos gastos son el hardware y el consumo de energía. Apple Silicon es muy eficiente, el consumo de energía durante la inferencia es bajo comparado con tarjetas gráficas dedicadas.

Seguridad: Ollama se ejecuta por defecto solo localmente y no es accesible desde la red. Si quieres compartir Ollama con otros dispositivos en la red, establece OLLAMA_HOST=0.0.0.0:11434. En ese caso, presta atención al firewall y autenticación, ya que el endpoint estaría desprotegido de otro modo. Ollama descarga los modelos y los almacena localmente. Tus prompts y respuestas no abandonan tu Mac.

Enlaces adicionales e información sobre Ollama en macOS

Preguntas frecuentes: Ollama en macOS

¿Funciona Ollama en cualquier Mac?

Ollama se ejecuta en Macs con macOS 13.6 o posterior. Los chips Apple Silicon reciben aceleración GPU, mientras que los Macs Intel utilizan CPU. Ambas arquitecturas son compatibles.

¿Necesito una tarjeta gráfica dedicada?

No. En Apple Silicon, Ollama aprovecha la GPU integrada mediante Metal. La memoria unificada reemplaza el VRAM separado de una tarjeta gráfica dedicada.

¿Cuánta RAM necesito para Ollama en macOS?

Un modelo de 3B requiere 8 GB. Para modelos de 8B se recomiendan 16 GB. Los modelos de 70B necesitan al menos 64 GB. El tamaño del modelo en cuantización Q4 equivale aproximadamente al 60 por ciento del número de parámetros en GB.

¿Cómo sé si se está usando la GPU?

Abre Activity Monitor y ve a la pestaña “GPU”. Si ves actividad durante una consulta a Ollama, significa que Ollama está usando Metal. Alternativamente, puedes usar la herramienta de terminal asitop.

¿Puedo instalar Ollama mediante Homebrew en lugar de la app?

Sí. Con brew install ollama instalas Ollama desde el terminal. La diferencia es que debes iniciar el servicio manualmente con ollama serve o configurar un LaunchAgent.

¿Dónde guarda Ollama los modelos en macOS?

Por defecto en ~/.ollama/models. Puedes cambiar la ubicación mediante la variable de entorno OLLAMA_MODELS, por ejemplo hacia una SSD externa.

¿Se inicia Ollama automáticamente al iniciar sesión?

Si usas la app oficial, sí. Con la instalación de Homebrew debes configurar un LaunchAgent para que Ollama se inicie automáticamente.

¿Se puede usar Ollama en Macs Intel?

Sí, pero solo a través de CPU. La inferencia es significativamente más lenta que en Apple Silicon. Para Macs Intel es recomendable quedarse con modelos pequeños como Llama 3.2 de 3B parámetros.

¿Puedo hacer Ollama accesible desde la red?

Sí, mediante la variable de entorno OLLAMA_HOST=0.0.0.0:11434. Ten cuidado con la configuración del firewall y la autenticación, ya que de lo contrario el endpoint estará desprotegido.

¿Consume mucha energía Ollama en el Mac?

Apple Silicon es muy eficiente. El consumo de energía durante la inferencia es bajo comparado con tarjetas gráficas dedicadas. En estado inactivo, Ollama consume pocos recursos siempre que no haya ningún modelo cargado.

¿Puedo cargar varios modelos simultáneamente?

Sí, siempre que tu RAM lo permita. Cada modelo cargado ocupa memoria. Si no hay suficiente RAM, macOS usa memoria de swap y el rendimiento cae drásticamente.

Fuentes y lecturas recomendadas

  • Sitio web oficial de Ollama y descargas: ollama.com
  • Repositorio Ollama en GitHub con documentación
  • Documentación de Apple Developer sobre Metal
  • Sitio web oficial de Homebrew: brew.sh
  • Descripciones técnicas de Apple Silicon para chips de la serie M
Volver al blog
Share:

Entradas relacionadas