Ollama auf Windows: Installation und Einrichtung
Was dieser Artikel über Ollama auf Windows behandelt
- Wie Du Ollama auf Windows 10 und Windows 11 installierst.
- Wie Du prüfst, ob Deine GPU erkannt wird und richtig konfiguriert ist.
- Wie Du Dein erstes Modell startest und die API aus PowerShell heraus nutzt.
- Wie Du Ollama in WSL2 einrichtest und auf die Windows-GPU zugreifst.
- Welche typischen Probleme auftreten und wie Du sie löst.
Einleitung: Ollama auf Windows verständlich erklärt
Ollama ist eine Laufzeitumgebung für offene Sprachmodelle. Es lädt Modelle herunter, verwaltet sie und stellt eine lokale API bereit. Auf Windows gibt es einen offiziellen Installer, der Ollama als Hintergrunddienst einrichtet. Du brauchst kein Linux und keine komplizierte Entwicklungsumgebung, um loszulegen. Dieser Artikel führt Dich Schritt für Schritt durch die Installation, die GPU-Konfiguration und die ersten Modelle. Mehr Hintergrund zu Ollama findest Du in der Ollama Übersicht.
Warum brauche ich diese Anleitung?
Stell Dir vor, Du lädst Ollama herunter, installierst es und versuchst Dein erstes Modell zu starten. Statt einer flüssigen Antwort ruckelt alles, weil die GPU nicht erkannt wird. Oder Du liest irgendwo, dass Du WSL2 brauchst, weißt aber nicht, ob das für Deinen Anwendungsfall überhaupt relevant ist. Vielleicht hast Du auch versucht, die API aus PowerShell aufzurufen und bekommst Fehlermeldungen, weil die Syntax nicht stimmt.
Genau diese Situationen behandelt dieser Artikel. Du bekommst eine klare Anleitung, mit der Du Ollama auf Windows installierst, Deine GPU einrichtest und die ersten Modelle startest. Falls Du noch nie mit lokaler KI gearbeitet hast, lies zuerst Was ist lokale KI?.
Ollama auf Windows kurz erklärt
Ollama gibt es für Windows als fertigen Installer. Du lädst die Datei von der offiziellen Webseite herunter, führst sie aus und Ollama richtet sich als Hintergrunddienst ein. Danach öffnest Du PowerShell oder die Eingabeaufforderung und nutzt Befehle wie ollama run llama3.1, um Modelle zu starten. Wenn Du eine Nvidia-GPU hast, erkennt Ollama diese automatisch, sofern die Treiber aktuell sind. Für AMD und Intel gibt es ebenfalls Support, der aber teilweise mehr Aufwand erfordert. Die API erreichst Du unter http://localhost:11434.
Für wen ist diese Anleitung gedacht?
Diese Anleitung richtet sich an Windows-Nutzer, die Ollama zum ersten Mal installieren. Du brauchst keine Programmierkenntnisse, solltest aber wissen, wie man PowerShell oder die Eingabeaufforderung öffnet. Wenn Du bereits Erfahrung mit Ollama hast und nur spezifische Probleme lösen willst, springe direkt zum Abschnitt über typische Stolpersteine oder zur Fehlerbehebung.
Wichtige Begriffe rund um Ollama auf Windows
| Begriff | Bedeutung |
|---|---|
| Ollama | Laufzeitumgebung für lokale Sprachmodelle |
| WSL2 | Windows Subsystem for Linux, ermöglicht Linux-Programme unter Windows |
| GPU | Grafikkarte, die Berechnungen beschleunigt |
| CUDA | Nvidia-Plattform für GPU-Berechnungen |
| Treiber | Software, die das Betriebssystem mit der GPU verbindet |
| PowerShell | Moderne Kommandozeile unter Windows |
| CMD | Klassische Eingabeaufforderung unter Windows |
| Docker Desktop | Grafische Oberfläche für Docker unter Windows |
| PATH | Umgebungsvariable, die festlegt, wo das System nach Programmen sucht |
| Service | Hintergrundprozess, der automatisch läuft |
Voraussetzungen
Bevor Du Ollama installierst, prüfe folgende Punkte:
- Betriebssystem: Windows 10 (ab Version 2004, Build 19041) oder Windows 11. Beide Versionen werden offiziell unterstützt.
- GPU-Treiber: Ein aktueller Grafiktreiber ist wichtig. Bei Nvidia sollte der Treiber mindestens Version 525 oder neuer sein. Bei AMD brauchst du Adrenalin 23.11.1 oder neuer. Intel-GPUs ab Arc-Serie werden ebenfalls unterstützt.
- RAM: Mindestens 8 GB für kleine Modelle. Für 7B-Modelle wie Llama 3.1 empfiehlt sich 16 GB. Größere Modelle brauchen entsprechend mehr.
- Speicherplatz: Jedes Modell belegt mehrere Gigabyte. Plane mindestens 20 GB freien Speicher ein, wenn Du mehrere Modelle testen willst.
- PowerShell oder CMD: Du solltest wissen, wie Du eine Kommandozeile öffnest. Drücke
Windows-Taste + R, tippepowershellund drücke Enter.
Mehr zu den Grundlagen findest Du im Artikel LLM lokal betreiben.
Schritt 1: Ollama herunterladen und installieren
Lade den Installer von der offiziellen Webseite herunter:
- Öffne
https://ollama.com/downloadim Browser. - Wähle den Download für Windows. Du erhältst eine Datei namens
OllamaSetup.exe. - Führe die Datei per Doppelklick aus. Windows zeigt möglicherweise eine Sicherheitswarnung. Bestätige, dass Du die App ausführen willst.
- Der Installer läuft automatisch durch. Du musst keine Pfade anpassen.
- Nach Abschluss der Installation läuft Ollama als Hintergrunddienst. Du siehst ein kleines Symbol im System-Tray, unten rechts in der Taskleiste.
Öffne nun PowerShell und prüfe, ob Ollama verfügbar ist:
ollama --version
Wenn Du eine Versionsnummer siehst, war die Installation erfolgreich. Falls der Befehl nicht gefunden wird, starte PowerShell neu oder prüfe, ob Ollama im PATH eingetragen ist. Details zur allgemeinen Installation findest Du auch unter Ollama Installation.
Schritt 2: GPU-Treiber prüfen
Ollama nutzt die GPU automatisch, wenn die Treiber korrekt installiert sind. So prüfst Du das.
Nvidia
Öffne PowerShell und gib folgenden Befehl ein:
nvidia-smi
Du siehst eine Tabelle mit Deiner GPU, der Treiberversion und der CUDA-Version. Wenn der Befehl funktioniert, ist Deine GPU bereit für Ollama. Falls Du eine Fehlermeldung bekommst, installiere den aktuellen Treiber von der Nvidia-Webseite oder über GeForce Experience.
AMD
Für AMD-GPUs brauchst Du den aktuellen Adrenalin-Treiber. Ollama nutzt die ROCm-Schnittstelle, die ab Treiberversion 23.11.1 unterstützt wird. Prüfe in PowerShell:
wmic path win32_VideoController get name
Bestätigt die Ausgabe Deine AMD-GPU, sollte Ollama sie nach der Installation erkennen. Falls nicht, aktualisiere den Treiber über das AMD Software-Tool.
Intel
Intel-GPUs ab der Arc-Serie werden unterstützt. Stelle sicher, dass der Intel Arc-Treiber aktuell ist. Ältere integrierte GPUs wie Intel UHD werden teilweise erkannt, bieten aber wenig Performance. Mehr zum Thema CPU versus GPU findest Du unter CPU vs. GPU.
Schritt 3: Erstes Modell starten
Nach der Installation und der GPU-Prüfung lädst Du Dein erstes Modell herunter. Öffne PowerShell und gib ein:
ollama run llama3.1
Der Befehl lädt das Modell automatisch herunter, falls es noch nicht lokal vorhanden ist. Der Download dauert je nach Internetverbindung einige Minuten. Danach startet der Chat direkt im Terminal. Du kannst sofort eine Frage eingeben:
>>> Erkläre lokale KI in drei Sätzen.
Das Modell antwortet direkt im Terminal. Beende die Sitzung mit /bye oder drücke Strg + D. Weitere Modelle findest Du in der Ollama Modellverwaltung.
Schritt 4: API nutzen
Ollama stellt eine HTTP-API unter http://localhost:11434 bereit. Du kannst sie aus PowerShell, Python oder anderen Programmiersprachen aufrufen.
API-Aufruf aus PowerShell
$body = @{
model = "llama3.1"
prompt = "Was ist lokale KI?"
stream = $false
} | ConvertTo-Json
Invoke-RestMethod -Uri "http://localhost:11434/api/generate" -Method Post -Body $body -ContentType "application/json"
Die Antwort kommt als JSON-Objekt zurück. Das Feld response enthält den generierten Text.
API-Aufruf mit Python
import requests
response = requests.post(
"http://localhost:11434/api/generate",
json={
"model": "llama3.1",
"prompt": "Erkläre Quantisierung in zwei Saetzen.",
"stream": False
}
)
print(response.json()["response"])
Mehr Beispiele und Endpunkte findest Du im Artikel Ollama API.
Ollama mit WSL2
WSL2 erlaubt es Dir, Linux-Programme unter Windows auszuführen. Das ist nützlich, wenn Du Ollama in einer Linux-Umgebung nutzen willst, etwa weil Du Linux-basierte Tools oder Skripte hast. Es gibt zwei Szenarien:
Szenario 1: Ollama läuft auf Windows, Du nutzt es aus WSL2
Wenn Du Ollama auf Windows installiert hast, läuft der Dienst im Hintergrund. Aus WSL2 erreichst Du die API über die Windows-IP. Öffne WSL2 und nutze die API:
curl http://host.docker.internal:11434/api/generate -d '{
"model": "llama3.1",
"prompt": "Hallo aus WSL2",
"stream": false
}'
Die Adresse host.docker.internal verweist auf den Windows-Host. So kannst Du Ollama auf Windows laufen lassen und trotzdem aus WSL2 darauf zugreifen.
Szenario 2: Ollama direkt in WSL2 installieren
Alternativ installierst Du Ollama direkt in WSL2 mit dem Linux-Skript:
curl -fsSL https://ollama.com/install.sh | sh
In diesem Fall nutzt Ollama die GPU über die WSL2-GPU-Passthrough-Funktion. Dafür muss WSL2 mit GPU-Support eingerichtet sein. Das funktioniert mit Nvidia-GPUs am besten. Installiere in WSL2 das CUDA-Toolkit, falls Ollama die GPU nicht automatisch erkennt.
Achte darauf, dass Du nicht beide Varianten gleichzeitig betreibst. Wenn Ollama auf Windows und in WSL2 läuft, kann es zu Port-Konflikten kommen, da beide den Port 11434 nutzen.
Ollama als Windows-Dienst
Nach der Installation mit dem offiziellen Installer läuft Ollama automatisch als Hintergrunddienst. Das bedeutet, Du musst Ollama nicht manuell starten. Der Dienst läuft nach dem Booten von Windows im Hintergrund und stellt die API bereit.
Du kannst den Status in PowerShell prüfen:
Get-Service ollama
Wenn der Status Running lautet, läuft der Dienst. Starte ihn manuell mit:
Start-Service ollama
Stoppen kannst Du ihn mit:
Stop-Service ollama
Der Dienst startet automatisch beim Systemstart. Falls Du das ändern willst, kannst Du den Starttyp anpassen:
Set-Service ollama -StartupType Manual
Konfiguration: Speicherort ändern
Standardmäßig speichert Ollama Modelle im Benutzerverzeichnis unter C:\Users\DeinName\.ollama\models. Wenn Deine Systemfestplatte wenig Platz hat, kannst Du den Speicherort über eine Umgebungsvariable ändern.
Setze die Variable OLLAMA_MODELS auf einen anderen Pfad:
[System.Environment]::SetEnvironmentVariable("OLLAMA_MODELS", "D:\ollama-models", "User")
Danach musst Du den Ollama-Dienst neu starten, damit die Änderung wirksam wird:
Restart-Service ollama
Neu heruntergeladene Modelle landen ab sofort im neuen Verzeichnis. Bereits heruntergeladene Modelle musst Du manuell verschieben oder neu herunterladen. Weitere Konfigurationsoptionen findest Du unter Ollama Konfiguration.
Typische Stolpersteine bei Ollama auf Windows
1. GPU wird nicht erkannt
Ollama fällt auf die CPU zurück, wenn die GPU-Treiber veraltet oder fehlen. Prüfe mit nvidia-smi, ob die GPU verfügbar ist. Aktualisiere den Treiber und starte den Ollama-Dienst neu.
2. Befehl ollama nicht gefunden
Nach der Installation ist der Befehl manchmal nicht sofort verfügbar. Schließe PowerShell und öffne es neu. Falls das nicht hilft, prüfe, ob Ollama im PATH steht. Der Standardpfad ist C:\Users\DeinName\AppData\Local\Programs\Ollama.
3. Port 11434 ist belegt
Wenn ein anderes Programm den Port nutzt, startet Ollama nicht korrekt. Prüfe mit netstat -ano | findstr 11434, welcher Prozess den Port blockiert. Beende den Prozess oder ändere den Port über die Umgebungsvariable OLLAMA_HOST.
4. Modelle werden langsam geladen
Wenn Ollama ohne GPU läuft, dauert das Laden großer Modelle lange. Prüfe die GPU-Erkennung und stelle sicher, dass genug VRAM vorhanden ist. Ein 7B-Modell braucht etwa 4 bis 5 GB VRAM.
5. WSL2 und Windows-Ollama gleichzeitig
Wenn Du Ollama auf Windows und in WSL2 installiert hast, gibt es Port-Konflikte. Entscheide Dich für eine Variante. Nutze entweder die Windows-Installation und greife aus WSL2 auf die API zu, oder installiere Ollama nur in WSL2.
6. Antivirus blockiert Ollama
Manche Antivirus-Programme blockieren den Download von Modellen oder den Dienst selbst. Füge Ollama zur Ausnahmeliste Deines Antivirus-Programms hinzu, wenn Du Probleme hast.
7. Umlaute in PowerShell
PowerShell hat manchmal Probleme mit Umlauten in Prompts. Verwende stattdessen ae, oe und ue, oder nutze die API mit Python, wo die Kodierung sauberer funktioniert.
Mehr Lösungen findest Du im Artikel Ollama Fehlerbehebung.
Hardware, Kosten und Sicherheit bei Ollama auf Windows
Hardware
Die Performance hängt stark von Deiner Hardware ab. Eine Nvidia-GPU mit 8 GB VRAM reicht für 7B-Modelle wie Llama 3.1. Für 13B-Modelle brauchst Du mindestens 12 GB VRAM. Ohne GPU läuft Ollama auf der CPU, was deutlich langsamer ist. Mehr dazu unter CPU vs. GPU.
Kosten
Ollama ist Open Source und kostenlos. Kosten entstehen nur für Hardware und Strom. Ein Modell mit 4 GB Größe herunterzuladen kostet nichts außer Deiner Internetbandbreite.
Sicherheit
Ollama läuft standardmäßig nur lokal. Die API ist unter localhost erreichbar, nicht von außen. Wenn Du die API im Netzwerk freigeben willst, setze OLLAMA_HOST=0.0.0.0:11434. Achte in diesem Fall auf Firewall-Regeln und Authentifizierung. Alle Modelle und Daten bleiben auf Deinem Rechner. Es wird nichts an Cloud-Dienste gesendet.
Weiterführende Links und Infos zu Ollama auf Windows
- Ollama Übersicht - Alles über Ollama auf einen Blick.
- Ollama Installation - Installation auf Linux, macOS und Docker.
- Ollama API - Endpunkte, curl, Python und JavaScript.
- Ollama Modelle verwalten - Modelle herunterladen, auflisten und löschen.
- Ollama Konfiguration - Umgebungsvariablen und Einstellungen.
- Ollama Fehlerbehebung - Lösungen für häufige Probleme.
- Ollama mit Docker - Ollama als Container betreiben.
- LLM lokal betreiben - Grundlagen lokaler Inferenz.
- Was ist lokale KI? - Einführung in das Thema.
- CPU vs. GPU - Wann welche Hardware sinnvoll ist.
FAQ: Ollama auf Windows - Typische Fragen
Brauche ich WSL2 für Ollama auf Windows?
Nein. Der offizielle Windows-Installer reicht aus. WSL2 ist nur nötig, wenn Du speziell eine Linux-Umgebung nutzen willst.
Funktioniert Ollama auch ohne GPU?
Ja, Ollama läuft auf der CPU. Die Performance ist deutlich niedriger, aber für kleine Modelle und Tests ausreichend.
Wo speichert Ollama die Modelle unter Windows?
Standardmäßig unter C:\Users\DeinName\.ollama\models. Du kannst den Pfad über die Umgebungsvariable OLLAMA_MODELS ändern.
Wie prüfe ich, ob meine GPU erkannt wird?
Bei Nvidia-GPUs nutze den Befehl nvidia-smi in PowerShell. Wenn eine Tabelle mit GPU-Infos erscheint, ist die GPU bereit.
Kann ich Ollama auf mehreren Windows-Nutzerkonten nutzen?
Ja, der Dienst läuft systemweit. Die Modelle liegen jedoch im Benutzerverzeichnis. Jeder Nutzer hat einen eigenen Modell-Ordner, es sei denn, Du setzt OLLAMA_MODELS auf einen gemeinsamen Pfad.
Startet Ollama automatisch beim Windows-Start?
Ja, der Installer richtet Ollama als Dienst mit automatischem Start ein. Du kannst das in den Windows-Diensten ändern.
Kann ich Ollama und Docker Desktop gleichzeitig nutzen?
Ja, solange es keine Port-Konflikte gibt. Wenn Du Ollama in Docker betreiben willst, nutze einen anderen Port oder stoppe den Windows-Dienst. Mehr dazu unter Ollama mit Docker.
Wie ändere ich den Port von Ollama?
Setze die Umgebungsvariable OLLAMA_HOST auf beispielsweise 127.0.0.1:11435 und starte den Dienst neu.
Werden AMD-GPUs unterstützt?
Ja, ab Treiberversion 23.11.1 mit ROCm-Support. Aktualisiere den Adrenalin-Treiber und prüfe, ob Ollama die GPU erkennt.
Ist Ollama auf Windows kostenlos?
Ja, Ollama ist Open Source und kostenlos. Kosten entstehen nur für Hardware und Strom.
Kann ich Ollama aus PowerShell heraus nutzen?
Ja, alle Befehle wie ollama run, ollama pull und ollama list funktionieren in PowerShell und in der klassischen Eingabeaufforderung.
Quellen und weiterführende Literatur
- Ollama Webseite
- Ollama Download-Seite
- Ollama GitHub-Repository
- Microsoft WSL2-Dokumentation
- Nvidia CUDA-Toolkit
- AMD ROCm-Dokumentation


