Skip to content
BotServBotServ
OllamaFehlerbehebungTroubleshootingGPUOOMFehlerlokale KI

Ollama Fehlerbehebung: Häufige Probleme lösen

Ollama Probleme lösen: GPU nicht erkannt, Modell lädt nicht, Out of Memory, langsame Inferenz und mehr. Praxisnahe Fehlerbehebung mit Lösungen.

S

schutzgeist

9 min read
Ollama Fehlerbehebung und Troubleshooting

Ollama Fehlerbehebung: Häufige Probleme lösen

Was dieser Artikel über Ollama Fehlerbehebung behandelt

  • Die häufigsten Ollama Probleme und wie Du sie Schritt für Schritt löst
  • Diagnose von GPU-, Speicher- und Verbindungsfehlern mit praktischen Befehlen
  • Lesen und Verstehen von Ollama Logs auf Linux, Windows und macOS
  • Tipps, mit denen Du typische Stolpersteine bei der Fehlerbehebung vermeidest
  • Antworten auf die wichtigsten Fragen zur Ollama Fehlerbehebung

Einleitung: Ollama Fehlerbehebung verständlich erklärt

Ollama macht es einfach, lokale Modelle laufen zu lassen. Doch sobald etwas schiefgeht, stehen viele Anwender vor kryptischen Fehlermeldungen und wissen nicht, wo sie ansetzen sollen. Dieser Artikel führt Dich durch die häufigsten Probleme und zeigt Dir, wie Du sie systematisch löst.

Du brauchst keine tiefe Systemadministration-Kenntnisse. Jeder Abschnitt erklärt das Problem, die Ursache und die konkreten Schritte zur Lösung. Falls Du Ollama noch nicht kennst, schau Dir zuerst die Ollama Übersicht an.

Warum brauche ich Fehlerbehebung?

Stell Dir vor, Du lädst ein Modell mit ollama run llama3 und statt einer Antwort kommt nur eine Fehlermeldung. Oder Deine GPU wird ignoriert und die Inferenz crawlt über den CPU. Solche Situationen sind frustrierend, aber fast immer lösbar.

Typische Szenarien, in denen Du Fehlerbehebung brauchst:

  • Ein Modell lädt nicht und Ollama wirft einen Out of Memory Fehler
  • Die GPU wird nicht erkannt, obwohl Treiber installiert sind
  • Die API reagiert nicht, weil der Port blockiert ist
  • Ollama startet nach einem Update gar nicht mehr

Die gute Nachricht: Die meisten Probleme lassen sich auf wenige Ursachen zurückführen. Mit der richtigen Diagnose bist Du schnell wieder am Laufen.

Ollama Fehlerbehebung kurz erklärt

Fehlerbehebung bei Ollama folgt einem einfachen Ablauf:

  1. Symptom erkennen: Was genau passiert, und was sollte passieren?
  2. Logs prüfen: Ollama schreibt detaillierte Logs, die Dir die Ursache zeigen.
  3. Ursache eingrenzen: GPU, Speicher, Netzwerk oder Modell?
  4. Lösung anwenden: Die passenden Schritte aus diesem Artikel umsetzen.
  5. Ergebnis verifizieren: Testen, ob das Problem behoben ist.

Dieser Ablauf hilft Dir bei jedem Problem, nicht nur bei den hier beschriebenen.

Für wen ist dieser Artikel gedacht?

Dieser Artikel richtet sich an Anfänger und fortgeschrittene Anwender, die Ollama lokal nutzen und auf Probleme gestossen sind. Du brauchst grundlegende Kommandozeilen-Kenntnisse, aber keine Expertise in Systemadministration. Falls Du Ollama noch nicht konfiguriert hast, hilft Dir der Artikel zur Konfiguration.

Wichtige Begriffe rund um Ollama Fehlerbehebung

BegriffBedeutung
LogEine Datei mit Systemmeldungen, die bei der Fehlersuche hilft
OOMOut of Memory, der Arbeitsspeicher oder VRAM reicht nicht aus
GPUGraphics Processing Unit, beschleunigt die Inferenz
VRAMVideo RAM, der Speicher der GPU für Modell und Kontext
CUDANVIDIAs Plattform für GPU-Computing
TreiberSoftware, damit das Betriebssystem mit der GPU kommunizieren kann
OLLAMA_DEBUGUmgebungsvariable für detailliertere Logs
JournalctlLinux-Tool zum Lesen von Systemd-Service-Logs
Event ViewerWindows-Werkzeug zum Anzeigen von System- und Applikationslogs
CrashEin plötzlicher Absturz des Programms

Problem 1: GPU wird nicht erkannt

Ollama nutzt die GPU automatisch, wenn Treiber und Runtime korrekt installiert sind. Falls nicht, fällt es auf den CPU zurück und die Inferenz wird extrem langsam.

Diagnose

Prüfe zuerst, ob Deine GPU vom System erkannt wird:

nvidia-smi

Wenn dieser Befehl funktioniert, kennt das System Deine GPU. Falls nicht, fehlt der Treiber oder er ist defekt.

Prüfe dann, ob Ollama die GPU sieht. Starte Ollama mit Debug-Logs:

OLLAMA_DEBUG=1 ollama serve

In den Logs suchst Du nach Zeilen wie GPU 0 oder CUDA. Falls nur CPU auftaucht, nutzt Ollama die GPU nicht.

Lösungen

  1. Treiber aktualisieren: Installiere den aktuellen NVIDIA Treiber für Dein Betriebssystem.
  2. CUDA prüfen: Ollama bringt eine eigene CUDA-Runtime mit, aber ein installiertes CUDA Toolkit hilft bei der Diagnose.
  3. OLLAMA_GPU_OVERHEAD anpassen: Falls Ollama die GPU erkennt, aber Modelle nicht lädt, kann der VRAM knapp sein. Setze OLLAMA_GPU_OVERHEAD auf einen höheren Wert:
export OLLAMA_GPU_OVERHEAD=2000000000

Das reserviert zusätzlichen VRAM für Overhead und verhindert Abstürze.

  1. Ollama neu starten: Nach Treiber-Updates muss Ollama neu gestartet werden, damit es die GPU neu erkennt.

Mehr zu den Grundlagen findest Du im Artikel CPU vs. GPU.

Problem 2: Modell lädt nicht oder stürzt ab

Ein häufiges Problem: Du versuchst ein Modell zu laden und bekommst einen OOM-Fehler oder Ollama stürzt ab.

Ursachen

  • Zu wenig VRAM: Das Modell passt nicht in den Grafikspeicher.
  • Quantisierung zu hoch: Ein Modell mit hoher Präzision braucht mehr Speicher.
  • Kontext zu lang: Ein grosser Kontext verbraucht zusätzlichen VRAM.

Lösungen

  1. Kleineres Modell wählen: Wenn llama3:70b nicht läuft, versuche llama3:8b.
  2. Quantisierung reduzieren: Nutze eine stärker quantisierte Version. Mehr dazu im Artikel Quantisierung.
  3. Kontextlänge anpassen: Reduziere num_ctx in den Optionen, um VRAM zu sparen. Details im Artikel Kontextlänge.
  4. RAM und VRAM prüfen: Vergleiche Deinen Speicher mit den Anforderungen im Artikel RAM und VRAM Anforderungen.

Beispiel für eine Modellanfrage mit reduziertem Kontext:

ollama run llama3 --num-ctx 2048

Problem 3: Inferenz ist sehr langsam

Wenn die Inferenz mehrere Sekunden pro Token braucht, läuft Ollama wahrscheinlich auf dem CPU statt der GPU.

Diagnose

Starte Ollama mit Debug-Logs und lade ein Modell:

OLLAMA_DEBUG=1 ollama serve

Suche in den Logs nach library=cuda oder library=cpu. Steht dort cpu, nutzt Ollama die GPU nicht.

Lösungen

  1. GPU-Offloading prüfen: Ollama lagert Modell-Schichten auf die GPU aus. Prüfe, ob genug VRAM für alle Schichten vorhanden ist. Mehr dazu im Artikel GPU-Offloading.
  2. GPU-Layer erzwingen: Mit --num-gpu steuerst Du, wie viele Schichten auf die GPU wandern:
ollama run llama3 --num-gpu 35
  1. Bandbreite begrenzen: Falls mehrere Programme die GPU nutzen, beende diese, um Bandbreite freizugeben.
  2. Treiber aktualisieren: Veraltete Treiber bremsen die GPU-Leistung.

Problem 4: Verbindung zur API schlägt fehl

Ollama stellt eine API auf Port 11434 bereit. Wenn Verbindungen fehlschlagen, liegt es oft am Port, an der Firewall oder an der Host-Konfiguration.

Diagnose

Teste, ob die API lokal reagiert:

curl http://localhost:11434/api/version

Kommt eine Antwort mit der Versionsnummer, läuft die API. Falls nicht, ist Ollama nicht gestartet oder der Port ist blockiert.

Lösungen

  1. Port prüfen: Stelle sicher, dass Port 11434 frei ist. Belegte Ports zeigen sich mit:
lsof -i :11434
  1. OLLAMA_HOST setzen: Falls Du von einem anderen Rechner zugreifst, setze OLLAMA_HOST auf 0.0.0.0:
export OLLAMA_HOST=0.0.0.0:11434

Details dazu im Artikel Netzwerkzugriff.

  1. Firewall konfigurieren: Öffne Port 11434 in Deiner Firewall, falls Du remote zugreifst.
  2. Service neu starten: Starte den Ollama-Service neu, falls die API nicht reagiert.

Problem 5: Modell antwortet nicht oder halluziniert

Manchmal läuft ein Modell, aber die Antworten sind falsch, sinnlos oder gar nicht vorhanden.

Ursachen

  • Falsches Modell: Ein kleines oder schlecht trainiertes Modell halluziniert häufiger.
  • System Prompt fehlt: Ohne klare Anweisung weiss das Modell nicht, was Du erwartest.
  • Kontext zu lang: Wenn der Kontext das Limit überschreitet, schneidet Ollama ältere Nachrichten ab, was zu Verwirrung führt.

Lösungen

  1. Grösseres Modell nutzen: Wechsle zu einem Modell mit mehr Parametern, falls Dein Speicher es zulässt.
  2. System Prompt setzen: Gib dem Modell eine klare Rolle und Aufgabenbeschreibung.
  3. Kontextlänge anpassen: Reduziere num_ctx, falls der Kontext zu lang wird.
  4. Modell neu herunterladen: Falls die Modell-Datei beschädigt ist, lösche und lade sie neu:
ollama rm llama3
ollama pull llama3

Mehr zum Verwalten von Modellen im Artikel Modelle verwalten.

Problem 6: Festplatte voll

Modelle sind gross. Ein 70B-Modell belegt leicht 40 GB. Wenn Du mehrere Modelle speicherst, wird die Festplatte schnell knapp.

Diagnose

Prüfe, wo Ollama Modelle speichert. Standardmässig ist das:

  • Linux: ~/.ollama/models
  • Windows: C:\Users\DeinName\.ollama\models
  • macOS: ~/.ollama/models

Lösungen

  1. Modelle auflisten und löschen: Zeige alle installierten Modelle an und entferne ungenutzte:
ollama list
ollama rm ungenutztes-modell
  1. Speicherort ändern: Setze OLLAMA_MODELS auf einen Pfad mit mehr Platz:
export OLLAMA_MODELS=/mnt/grosse_platte/ollama/models
  1. Speicherplatz überwachen: Prüfe regelmässig den Speicherplatz, besonders wenn Du oft neue Modelle testest.

Problem 7: Ollama startet nicht

Wenn Ollama gar nicht startet, liegt es meist am Service, am Port oder an Berechtigungen.

Diagnose

Prüfe den Service-Status auf Linux:

systemctl status ollama

Auf Windows und macOS schaue in den Logs nach Fehlermeldungen beim Start.

Lösungen

  1. Port-Konflikt prüfen: Falls ein anderes Programm Port 11434 nutzt, beende es oder ändere den Ollama-Port.
  2. Berechtigungen prüfen: Der Ollama-Service braucht Leserechte auf das Modellverzeichnis. Auf Linux gehört der Service oft dem User ollama.
  3. Service neu installieren: Falls der Service defekt ist, installiere ihn neu:
sudo systemctl daemon-reload
sudo systemctl restart ollama
  1. Logs prüfen: Schau in die Logs, um die genaue Fehlermeldung zu finden. Mehr dazu im nächsten Abschnitt.

Logs und Diagnose

Logs sind Dein wichtigstes Werkzeug bei der Fehlerbehebung. Ollama schreibt detaillierte Meldungen, die Dir die Ursache zeigen.

Linux

Ollama läuft als Systemd-Service. Die Logs liest Du mit:

journalctl -u ollama -f

Das -f folgt dem Log live. Für detailliertere Meldungen setze OLLAMA_DEBUG=1 in der Service-Datei.

Windows

Auf Windows öffnest Du den Event Viewer. Suche nach Ereignissen mit der Quelle ollama oder Ollama. Zusätzlich findest Du Logs im Verzeichnis %LOCALAPPDATA%\Ollama\.

macOS

Auf macOS nutzt Du die Console-App. Suche nach ollama im Filter. Alternativ im Terminal:

log stream --predicate 'process == "ollama"'

Typische Stolpersteine bei der Fehlerbehebung

  1. Logs ignorieren: Viele Anwender suchen im Dunkeln, statt die Logs zu lesen. Die Logs enthalten fast immer die Ursache.
  2. Treiber vergessen: Ohne aktuellen GPU-Treiber nutzt Ollama nur den CPU. Das ist ein häufiger Grund für langsame Inferenz.
  3. VRAM überschätzen: Auch wenn die GPU viel VRAM hat, braucht der Kontext zusätzlichen Speicher. Plane Puffer ein.
  4. Falsche Umgebungsvariablen: Variablen wie OLLAMA_HOST oder OLLAMA_MODELS müssen korrekt gesetzt und beim Service-Neustart übernommen werden.
  5. Veraltete Ollama-Version: Bugs in älteren Versionen sind oft schon behoben. Halte Ollama aktuell.
  6. Gleichzeitige Modelle: Mehrere Modelle gleichzeitig überlasten VRAM und Bandbreite. Beende ungenutzte Modelle.
  7. Firewall vergessen: Bei Remote-Zugriff blockiert oft die Firewall den Port. Prüfe sie, bevor Du tiefer suchst.

Hardware, Kosten und Sicherheit bei der Fehlerbehebung

Hardware: Für die Fehlerbehebung brauchst Du keinen speziellen Rechner. Ein System mit GPU, aktuellem Treiber und genug VRAM reicht. Falls Du oft Modelle testest, lohnt sich eine GPU mit 16 GB VRAM oder mehr.

Kosten: Ollama selbst ist kostenlos. Kosten entstehen nur durch Hardware, falls Du aufrüsten musst. Eine gebrauchte GPU mit 12 bis 16 GB VRAM ist oft schon ausreichend für 8B- und 13B-Modelle.

Sicherheit: Wenn Du Ollama im Netzwerk freigibst, sichere die API ab. Setze OLLAMA_HOST nicht auf 0.0.0.0, ohne eine Firewall zu konfigurieren. Sonst kann jeder im Netzwerk auf Deine Modelle zugreifen. Mehr dazu im Artikel Netzwerkzugriff.

FAQ: Ollama Fehlerbehebung - Typische Fragen

Warum wird meine GPU nicht erkannt? Meistens fehlt der aktuelle NVIDIA-Treiber oder CUDA ist nicht korrekt installiert. Prüfe mit nvidia-smi, ob die GPU vom System erkannt wird, und starte Ollama mit OLLAMA_DEBUG=1, um die GPU-Erkennung in den Logs zu sehen.

Was bedeutet der OOM-Fehler? OOM steht für Out of Memory. Dein VRAM oder RAM reicht nicht aus, um das Modell zu laden. Wähle ein kleineres Modell, reduziere die Quantisierung oder verringere die Kontextlänge.

Warum ist die Inferenz so langsam? Wahrscheinlich nutzt Ollama den CPU statt der GPU. Prüfe die Logs auf library=cuda und stelle sicher, dass der GPU-Treiber aktuell ist. Falls die GPU erkannt wird, prüfe das GPU-Offloading mit --num-gpu.

Wie ändere ich den Port von Ollama? Setze die Umgebungsvariable OLLAMA_HOST auf den gewünschten Port, zum Beispiel OLLAMA_HOST=0.0.0.0:8080. Starte danach den Ollama-Service neu.

Wo speichert Ollama die Modelle? Standardmässig unter ~/.ollama/models auf Linux und macOS, unter C:\Users\DeinName\.ollama\models auf Windows. Du änderst den Pfad mit der Variable OLLAMA_MODELS.

Wie lese ich die Ollama Logs auf Linux? Nutze journalctl -u ollama -f, um die Logs live zu verfolgen. Für detailliertere Meldungen setze OLLAMA_DEBUG=1 in der Service-Konfiguration.

Was tun, wenn Ollama nach einem Update nicht startet? Prüfe den Service-Status mit systemctl status ollama und schau in die Logs. Oft liegt es an einem Port-Konflikt oder geänderten Berechtigungen. Ein Neuinstallieren des Services hilft häufig.

Warum halluziniert mein Modell? Halluzinationen entstehen oft durch zu kleine Modelle, fehlende System-Prompts oder zu lange Kontexte. Wähle ein grösseres Modell, gib klare Anweisungen und reduziere die Kontextlänge.

Kann ich mehrere Modelle gleichzeitig laufen lassen? Ja, aber das überlastet schnell VRAM und Bandbreite. Beende ungenutzte Modelle und starte sie nur, wenn Du sie wirklich brauchst.

Wie reserviere ich zusätzlichen VRAM für Overhead? Setze OLLAMA_GPU_OVERHEAD auf einen höheren Wert, zum Beispiel OLLAMA_GPU_OVERHEAD=2000000000. Das verhindert Abstürze, wenn der VRAM knapp wird.

Quellen und weiterführende Literatur

Zurück zum KI Blog
Share:

Ähnliche Beiträge