Skip to content
BotServBotServ
OllamamacOSApple SiliconM1M2M3M4MetalUnified Memorylokale KI

Ollama auf macOS: Installation und Einrichtung

Ollama auf macOS und Apple Silicon installieren. Schritt-für-Schritt mit Unified Memory, Metal-Framework und Tipps für Mac-Nutzer.

S

schutzgeist

11 min read
Ollama auf macOS installieren

Ollama auf macOS: Installation und Einrichtung

Was dieser Artikel über Ollama auf macOS behandelt

  • Installation von Ollama auf macOS über DMG und Homebrew
  • Nutzung des Metal-Frameworks auf Apple Silicon für GPU-beschleunigte Inferenz
  • Unified Memory bei M-Series Chips und wieviel RAM Du für welche Modelle brauchst
  • Konfiguration des Modell-Speicherorts und Autostart über LaunchAgent
  • Typische Stolpersteine und Lösungsansätze für Mac-Nutzer

Einleitung: Ollama auf macOS verständlich erklärt

Ollama ist eine Laufzeitumgebung, mit der Du Large Language Models lokal auf Deinem Rechner ausführst. Auf macOS funktioniert das besonders gut, weil Apple Silicon über Unified Memory verfügt. Das bedeutet, CPU und GPU teilen sich denselben Arbeitsspeicher. Du brauchst keine separate Grafikkarte mit eigenem VRAM, um Modelle mit GPU-Beschleunigung zu laden. Ollama nutzt das Metal-Framework von Apple, um die GPU der M-Series Chips automatisch anzusprechen. Dieser Artikel führt Dich Schritt für Schritt durch die Installation, Konfiguration und erste Nutzung auf Deinem Mac.

Warum brauche ich diese Anleitung?

Mac-Nutzer haben einen besonderen Vorteil beim lokalen Betrieb von KI-Modellen: Unified Memory. Ein Mac Studio mit 64 GB RAM kann beispielsweise ein 34-Milliarden-Parameter-Modell vollständig in den Shared Memory laden und über die GPU ausführen. Auf einem klassischen PC bräuchtest Du dafür eine teure Grafikkarte mit ausreichend VRAM. Viele Mac-Nutzer wissen jedoch nicht, wie sie dieses Potenzial tatsächlich nutzen. Ollama erkennt Apple Silicon zwar automatisch, aber Du musst wissen, wieviel RAM Deine Modelle benötigen, wie Du den Speicherort anpasst und wie Du überprüfst, ob die GPU wirklich eingesetzt wird. Genau hier setzt diese Anleitung an.

Ollama auf macOS kurz erklärt

Ollama läuft auf macOS als Hintergrundprozess und stellt eine lokale API unter http://localhost:11434 bereit. Nach der Installation lädst Du ein Modell mit ollama pull herunter und startest es mit ollama run. Auf Apple Silicon nutzt Ollama automatisch das Metal-Framework für GPU-Beschleunigung. Auf Intel-Macs erfolgt die Inferenz ausschließlich über die CPU. Die Installation erfolgt entweder über den offiziellen DMG-Download oder über Homebrew.

Für wen ist diese Anleitung gedacht?

Diese Anleitung richtet sich an Mac-Nutzer, die Ollama zum ersten Mal installieren und einrichten wollen. Du brauchst keine Vorkenntnisse mit lokaler KI. Wenn Du bereits Ollama auf einem anderen System installiert hast, findest Du hier die macOS-spezifischen Besonderheiten. Für die allgemeine Installationsanleitung über alle Plattformen hinweg siehst Du Dir Ollama installieren an.

Wichtige Begriffe rund um Ollama auf macOS

BegriffBedeutung
OllamaLaufzeitumgebung für lokale Sprachmodelle
Apple SiliconEigene Chip-Familie von Apple, ab M1, mit ARM-Architektur
Unified MemoryGemeinsamer Arbeitsspeicher für CPU und GPU bei Apple Silicon
MetalGrafik- und Compute-Framework von Apple für GPU-Beschleunigung
M-SeriesBezeichnung für Apples Chips ab M1, inklusive M2, M3 und M4
GPU TilesPhysische GPU-Einheiten innerhalb eines Apple Silicon Chips
HomebrewPaketmanager für macOS zur Installation von Software über das Terminal
LaunchAgentmacOS-Mechanismus zum automatischen Starten von Prozessen beim Login
OLLAMA_MODELSUmgebungsvariable zum Festlegen des Modell-Speicherorts
Activity MonitormacOS-Werkzeug zur Überwachung von CPU-, GPU- und RAM-Auslastung

Voraussetzungen

Bevor Du Ollama installierst, prüfe folgende Punkte:

  • macOS-Version: Ollama benötigt macOS 13.6 (Ventura) oder neuer. Auf älteren Versionen funktioniert Ollama nicht zuverlässig.
  • Apple Silicon vs. Intel: Ollama läuft auf beiden Architekturen. Apple Silicon wird durch das Metal-Framework GPU-beschleunigt. Intel-Macs nutzen nur die CPU und sind deutlich langsamer.
  • RAM: Für kleine Modelle wie Llama 3.2 mit 3B Parametern reichen 8 GB. Für Modelle mit 8B Parametern empfiehlt sich 16 GB. Größere Modelle mit 70B Parametern benötigen 64 GB oder mehr. Mehr Details zum Speicherbedarf findest Du unter Unified Memory.
  • Festplattenplatz: Jedes Modell benötigt Speicherplatz. Ein 8B-Modell in Q4-Quantisierung belegt etwa 4 bis 5 GB. Plane ausreichend Platz ein, besonders wenn Du mehrere Modelle speicherst.

Schritt 1: Ollama herunterladen und installieren

Der einfachste Weg ist der Download der offiziellen App:

  1. Öffne ollama.com im Browser.
  2. Klicke auf den Download-Button und wähle macOS.
  3. Lade die .zip-Datei herunter und entpacke sie.
  4. Ziehe die Ollama-App in den Programme-Ordner.
  5. Starte Ollama mit einem Doppelklick.

Beim ersten Start richtet Ollama den Hintergrunddienst ein. Du siehst anschließend ein kleines Ollama-Symbol in der Menüleiste. Der Dienst läuft nun im Hintergrund und die API ist unter http://localhost:11434 erreichbar.

Öffne das Terminal und prüfe die Installation:

ollama --version

Wenn eine Versionsnummer erscheint, ist Ollama einsatzbereit.

Schritt 2: Mit Homebrew installieren

Alternativ zur DMG-Installation kannst Du Homebrew nutzen. Homebrew ist ein Paketmanager für macOS, mit dem Du Software über das Terminal installierst. Falls Du Homebrew noch nicht hast, installiere es zuerst:

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

Danach installierst Du Ollama mit einem einzigen Befehl:

brew install ollama

Homebrew lädt die Binaries herunter und richtet alles Notwendige ein. Starte den Dienst danach manuell:

ollama serve

Der Unterschied zur DMG-Installation: Bei Homebrew startet Ollama nicht automatisch als App im Hintergrund. Du musst den Dienst entweder manuell starten oder einen LaunchAgent einrichten, was weiter unten beschrieben wird.

Schritt 3: Apple Silicon und Metal

Auf Apple Silicon nutzt Ollama automatisch das Metal-Framework. Metal ist Apples Programmierschnittstelle für GPU-Compute und Grafik. Ollama muss nicht extra konfiguriert werden, um die GPU zu verwenden. Bei jedem Modellstart prüft Ollama, ob eine Metal-kompatible GPU vorhanden ist, und lädt das Modell dann in den Unified Memory.

Du kannst überprüfen, ob Metal aktiv ist, indem Du ein Modell startest und auf die Ausgabe achtest. Ollama zeigt beim Laden an, ob die GPU genutzt wird. Alternativ findest Du im Activity Monitor unter dem Reiter “GPU” die Auslastung der GPU-Tiles. Wenn dort Aktivität sichtbar ist, während Du ein Modell abfragst, nutzt Ollama Metal.

Mehr zur Hardware-Grundlage findest Du unter Apple Silicon.

Schritt 4: Erstes Modell starten

Nach der Installation lädst Du Dein erstes Modell herunter. Für den Anfang eignet sich Llama 3.1 mit 8B Parametern:

ollama pull llama3.1

Der Download dauert je nach Internetverbindung einige Minuten. Danach startest Du das Modell:

ollama run llama3.1

Ollama öffnet einen Chat im Terminal. Du kannst sofort Fragen stellen. Mit /bye beendest Du die Sitzung. Weitere Modelle und deren Verwaltung sind im Artikel Ollama Modelle verwalten beschrieben.

Schritt 5: API nutzen

Ollama bietet eine lokale HTTP-API unter http://localhost:11434. Damit kannst Du Ollama aus eigenen Anwendungen, Skripten oder Automatisierungen heraus ansprechen.

Ein einfacher Aufruf mit curl:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1",
  "prompt": "Was ist lokale KI?",
  "stream": false
}'

In Python sieht das so aus:

import requests

response = requests.post(
    "http://localhost:11434/api/generate",
    json={
        "model": "llama3.1",
        "prompt": "Erkläre Unified Memory in zwei Saetzen.",
        "stream": False
    }
)
print(response.json()["response"])

Ausführliche Beispiele und alle Endpunkte findest Du im Artikel Ollama API nutzen.

Apple Silicon Besonderheiten

Apple Silicon hat eine Eigenschaft, die es für lokale KI besonders attraktiv macht: Unified Memory. CPU und GPU greifen auf denselben physischen Speicher zu. Es gibt keine Kopie von Daten zwischen System-RAM und VRAM, wie bei klassischen Grafikkarten.

Das bedeutet für Ollama: Die gesamte Modellgröße muss in den freien RAM passen. Ein Mac mit 16 GB RAM kann ein 8B-Modell in Q4-Quantisierung problemlos laden, da es etwa 5 GB belegt. Ein 70B-Modell benötigt jedoch rund 40 GB und läuft nur auf Macs mit 64 GB RAM oder mehr.

So überprüfst Du die GPU-Auslastung:

  1. Öffne den Activity Monitor über Spotlight oder den Programme-Ordner.
  2. Wechsle in den Reiter “GPU”.
  3. Starte eine Anfrage an Ollama.
  4. Beobachte die Auslastung der GPU-Tiles.

Wenn die GPU-Auslastung während der Inferenz ansteigt, nutzt Ollama das Metal-Framework korrekt. Wenn nur die CPU ausgelastet ist, liegt ein Konfigurationsproblem vor. Mehr zur Speicherarchitektur findest Du unter Unified Memory und allgemeiner unter LLM lokal betreiben.

Intel Macs

Ollama funktioniert auch auf Intel-Macs, jedoch ohne GPU-Beschleunigung. Die Inferenz läuft ausschließlich über die CPU. Das bedeutet deutlich langsamere Antwortzeiten. Ein 8B-Modell, das auf Apple Silicon in wenigen Sekunden antwortet, kann auf einem Intel-Mac 30 Sekunden oder länger brauchen.

Zusätzliche Einschränkungen auf Intel-Macs:

  • Kein Metal-Support, daher kein GPU-Offloading
  • Höherer Stromverbrauch bei Inferenz
  • Modelle konkurrieren mit dem Betriebssystem um den Arbeitsspeicher
  • Große Modelle ab 13B Parametern sind praktisch kaum nutzbar

Für Intel-Macs empfiehlt sich, bei kleinen Modellen wie Llama 3.2 mit 3B Parametern zu bleiben. Wenn Du ernsthaft mit lokaler KI arbeiten willst, ist ein Upgrade auf einen Apple Silicon Mac sinnvoll. Der Mac Mini ist dabei ein kostengünstiger Einstieg, der Mac Studio bietet mehr RAM-Optionen für größere Modelle.

Konfiguration: Speicherort und Autostart

Standardmäßig speichert Ollama Modelle unter ~/.ollama/models. Wenn Deine interne SSD wenig Platz hat, kannst Du den Speicherort über die Umgebungsvariable OLLAMA_MODELS ändern:

export OLLAMA_MODELS=/Volumes/External/ollama-models

Damit diese Einstellung dauerhaft gilt, füge sie zu Deiner Shell-Konfiguration hinzu, beispielsweise in ~/.zshrc:

echo 'export OLLAMA_MODELS=/Volumes/External/ollama-models' >> ~/.zshrc
source ~/.zshrc

Für den automatischen Start beim Login richtest Du einen LaunchAgent ein. Erstelle eine Property-List-Datei unter ~/Library/LaunchAgents/com.ollama.plist:

<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE plist PUBLIC "-//Apple//DTD PLIST 1.0//EN" "http://www.apple.com/DTDs/PropertyList-1.0.dtd">
<plist version="1.0">
<dict>
    <key>Label</key>
    <string>com.ollama</string>
    <key>ProgramArguments</key>
    <array>
        <string>/usr/local/bin/ollama</string>
        <string>serve</string>
    </array>
    <key>RunAtLoad</key>
    <true/>
    <key>KeepAlive</key>
    <true/>
</dict>
</plist>

Lade den LaunchAgent danach:

launchctl load ~/Library/LaunchAgents/com.ollama.plist

Ollama startet nun bei jedem Login automatisch. Weitere Konfigurationsoptionen wie Port-Änderung und Netzwerkzugriff findest Du im Artikel Ollama Konfiguration.

Typische Stolpersteine bei Ollama auf macOS

  1. Zu wenig RAM für das gewählte Modell: Ollama lädt das Modell trotzdem, nutzt dann aber Swap-Speicher. Die Inferenz wird extrem langsam. Prüfe vorab, ob Dein RAM für die Modellgröße ausreicht.

  2. Metal wird nicht genutzt: Falls Ollama nur die CPU verwendet, kann die Ursache eine veraltete macOS-Version sein. Metal benötigt mindestens macOS 13.6. Aktualisiere Dein System und starte Ollama neu.

  3. Modell-Speicherort auf externer SSD nicht erreichbar: Wenn Du OLLAMA_MODELS auf ein externes Laufwerk setzt und dieses beim Start von Ollama nicht verbunden ist, schlägt der Dienst fehl. Stelle sicher, dass das Laufwerk vor Ollama gemountet ist.

  4. Port 11434 bereits belegt: Wenn ein anderer Prozess den Port nutzt, startet der Ollama-Server nicht. Prüfe mit lsof -i :11434, welcher Prozess den Port blockiert, und beende ihn oder ändere den Ollama-Port über OLLAMA_HOST.

  5. Homebrew-Pfad unterscheidet sich zwischen Intel und Apple Silicon: Auf Intel-Macs liegt Homebrew unter /usr/local/bin, auf Apple Silicon unter /opt/homebrew/bin. Passe den Pfad im LaunchAgent entsprechend an, sonst findet der Dienst die Ollama-Binary nicht.

  6. App-Sandbox blockiert API-Zugriff: Wenn Du Ollama aus einer anderen App heraus ansprechen willst und macOS den Zugriff blockiert, musst Du Ollama in den Systemeinstellungen unter “Datenschutz und Sicherheit” den lokalen Netzwerkzugriff erlauben.

  7. Activity Monitor zeigt keine GPU-Aktivität: Manchmal aktualisiert der Activity Monitor die GPU-Anzeige nicht in Echtzeit. Nutze alternativ das Terminal-Tool asitop oder powermetrics, um die GPU-Auslastung genauer zu überwachen.

Hardware, Kosten und Sicherheit bei Ollama auf macOS

Hardware: Die Performance von Ollama auf macOS hängt direkt von Deinem Chip und Deinem RAM ab. Ein M2 mit 16 GB RAM ist für Modelle bis 8B Parameter gut geeignet. Ein M4 Max mit 64 GB RAM kann Modelle bis 70B Parameter flüssig ausführen. Die Anzahl der GPU-Cores beeinflusst die Geschwindigkeit der Inferenz. Mehr Cores bedeuten schnellere Token-Generierung.

Kosten: Ollama selbst ist kostenlos und Open Source. Du zahlst keine Lizenzgebühren und keine API-Kosten. Die einzigen Kosten sind die Hardware und der Stromverbrauch. Apple Silicon ist dabei sehr effizient, der Stromverbrauch bei Inferenz ist gering im Vergleich zu dedizierten Grafikkarten.

Sicherheit: Ollama läuft standardmäßig nur lokal und ist nicht aus dem Netzwerk erreichbar. Wenn Du Ollama für andere Geräte im Netzwerk freigeben willst, setze OLLAMA_HOST=0.0.0.0:11434. Achte in diesem Fall auf eine Firewall und Authentifizierung, da der Endpunkt sonst ungeschützt ist. Modelle werden von Ollama heruntergeladen und lokal gespeichert. Deine Prompts und Antworten verlassen Deinen Mac nicht.

FAQ: Ollama auf macOS, typische Fragen

Funktioniert Ollama auf jedem Mac?

Ollama läuft auf Macs mit macOS 13.6 oder neuer. Apple Silicon wird GPU-beschleunigt, Intel-Macs nutzen die CPU. Beide Architekturen werden unterstützt.

Brauche ich eine separate Grafikkarte?

Nein. Auf Apple Silicon nutzt Ollama die integrierte GPU über das Metal-Framework. Unified Memory ersetzt den separaten VRAM einer dedizierten Grafikkarte.

Wieviel RAM brauche ich für Ollama auf macOS?

Für ein 3B-Modell reichen 8 GB. Für 8B-Modelle empfiehlt sich 16 GB. Für 70B-Modelle brauchst Du mindestens 64 GB. Die Modellgröße in Q4-Quantisierung entspricht etwa 60 Prozent der Parameterzahl in GB.

Wie sehe ich, ob die GPU genutzt wird?

Öffne den Activity Monitor und wechsle in den Reiter “GPU”. Wenn während einer Ollama-Anfrage Aktivität sichtbar ist, nutzt Ollama Metal. Alternativ nutzt Du das Terminal-Tool asitop.

Kann ich Ollama über Homebrew statt der App installieren?

Ja. Mit brew install ollama installierst Du Ollama über das Terminal. Der Unterschied ist, dass Du den Dienst manuell mit ollama serve starten oder einen LaunchAgent einrichten musst.

Wo speichert Ollama die Modelle auf macOS?

Standardmäßig unter ~/.ollama/models. Du kannst den Speicherort über die Umgebungsvariable OLLAMA_MODELS ändern, beispielsweise auf eine externe SSD.

Startet Ollama automatisch beim Login?

Wenn Du die offizielle App nutzt, ja. Bei der Homebrew-Installation musst Du einen LaunchAgent einrichten, damit Ollama automatisch startet.

Ist Ollama auf Intel-Macs nutzbar?

Ja, aber nur über die CPU. Die Inferenz ist deutlich langsamer als auf Apple Silicon. Für Intel-Macs empfiehlt sich, bei kleinen Modellen wie Llama 3.2 mit 3B Parametern zu bleiben.

Kann ich Ollama aus dem Netzwerk erreichbar machen?

Ja, über die Umgebungsvariable OLLAMA_HOST=0.0.0.0:11434. Achte dabei auf Firewall-Einstellungen und Authentifizierung, da der Endpunkt sonst ungeschützt ist.

Verbraucht Ollama viel Strom auf dem Mac?

Apple Silicon ist sehr effizient. Der Stromverbrauch bei Inferenz ist gering im Vergleich zu dedizierten Grafikkarten. Im Idle-Zustand verbraucht Ollama kaum Ressourcen, solange kein Modell geladen ist.

Kann ich mehrere Modelle gleichzeitig laden?

Ja, solange Dein RAM ausreicht. Jedes geladene Modell belegt Speicher. Wenn der RAM nicht reicht, nutzt macOS Swap-Speicher und die Performance sinkt drastisch.

Quellen und weiterführende Literatur

  • Ollama offizielle Webseite und Download: ollama.com
  • Ollama GitHub-Repository mit Dokumentation
  • Apple Developer Dokumentation zum Metal-Framework
  • Homebrew offizielle Webseite: brew.sh
  • Apple Silicon technische Übersichten zu M-Series Chips
Zurück zum KI Blog
Share:

Ähnliche Beiträge