Skip to content
BotServBotServ
OllamaBefehleCLILokale KICheat Sheet

Die wichtigsten Ollama-Befehle

Ollama CLI schnell im Überblick. Modelle herunterladen, starten, verwalten und mit der API arbeiten.

S

schutzgeist

3 min read
Die wichtigsten Ollama-Befehle

Die wichtigsten Ollama-Befehle

Was dieser Artikel über Ollama-Befehle behandelt

  • Die wichtigsten Befehle für den Einstieg in Ollama.
  • Modelle herunterladen, starten und löschen.
  • Informationen über laufende und installierte Modelle.
  • Erstellung eigener Modelle mit Modelfiles.
  • Wichtige API-Endpoints kurz erklärt.

Einleitung: Die wichtigsten Ollama-Befehle

Ollama wird primär über die Kommandozeile bedient. Ob man ein neues Modell herunterladen, ein bestehendes anpassen oder den Status prüfen möchte: die CLI bietet dafür übersichtliche Befehle. Dieser Artikel fasst die wichtigsten Ollama-Befehle zusammen, die im täglichen Gebrauch am häufigsten benötigt werden.

Für alle Befehle gilt: eine vollständige Hilfe erhält man mit ollama --help oder ollama <befehl> --help.

Wichtige Begriffe

  • CLI: Kommandozeileninterface von Ollama.
  • Model: Ein heruntergeladenes Sprachmodell.
  • Tag: Versions- oder Grössenkennung, zum Beispiel :8b oder :70b.
  • Modelfile: Rezept zum Erstellen oder Anpassen eines Modells.
  • Parameter: Einstellung wie Temperatur oder Kontextlänge.
  • Serve: Ollama-Server starten.

Modell-Management

BefehlZweck
ollama pull <modell>Modell herunterladen oder aktualisieren.
ollama run <modell>Modell starten und interaktiv chatten.
ollama listAlle installierten Modelle anzeigen.
ollama psAktuell geladene Modelle anzeigen.
ollama rm <modell>Modell entfernen.
ollama cp <quelle> <ziel>Modell kopieren.
ollama show <modell>Details zu einem Modell anzeigen.

Beispiele:

ollama pull llama3.1
ollama pull llama3.1:70b
ollama pull qwen2.5:14b
ollama pull nomic-embed-text

Interaktives Chatten

ollama run llama3.1

Nach dem Start kann man direkt Prompts eingeben. Mit /bye oder Strg+D verlässt man den Chat.

Einmalige Frage

ollama run llama3.1 "Erkläre Quantisierung."

Modell-Informationen

ollama show llama3.1
ollama ps

ollama ps zeigt unter anderem, welches Modell geladen ist und ob es auf CPU oder GPU läuft.

Modelfiles

BefehlZweck
ollama create <name> -f ModelfileEigenes Modell aus Modelfile erstellen.
ollama show <modell> --modelfileModelfile eines bestehenden Modells anzeigen.

Beispiel-Modelfile:

FROM llama3.1

SYSTEM """
Du bist ein präziser Assistent für lokale KI.
"""

PARAMETER temperature 0.5
PARAMETER num_ctx 4096

Erstellen:

ollama create mein-assistent -f Modelfile
ollama run mein-assistent

Server-Betrieb

BefehlZweck
ollama serveOllama-Server starten.
ollama serve --host 0.0.0.0An alle Schnittstellen binden.

In der Regel läuft Ollama als Dienst im Hintergrund. Bei manueller Entwicklung startet man ollama serve im Terminal.

API-Endpoints

EndpointZweck
POST /api/generateEinzelne Textgenerierung.
POST /api/chatChat mit Nachrichtenverlauf.
POST /api/embedEmbeddings erzeugen.
GET /api/tagsInstallierte Modelle auflisten.
POST /v1/chat/completionsOpenAI-kompatibler Chat.

Beispiel:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1",
  "prompt": "Erkläre Ollama in drei Sätzen."
}'

Nützliche Optionen

BefehlZweck
ollama run llama3.1 --verboseZusätzliche Informationen anzeigen.
ollama run llama3.1 --nowordwrapZeilenumbruch deaktivieren.

Häufige Befehlsfolgen

Ein neues Modell testen

ollama pull qwen2.5:14b
ollama run qwen2.5:14b

Modell für RAG kopieren und anpassen

ollama cp llama3.1 mein-rag-modell
ollama create mein-rag-modell -f Modelfile
ollama run mein-rag-modell

Speicher freigeben

ollama ps
ollama rm llama3.1:70b
ollama rm alteres-modell

Tipps zur Nutzung

  • Modellnamen immer mit passendem Tag verwenden.
  • Vor Updates prüfen, ob das Modell aktiv genutzt wird.
  • ollama ps hilft, den GPU- oder CPU-Betrieb zu erkennen.
  • Mit Modelfiles können eigene Assistenten erstellt werden.

Typische Stolpersteine

  • Falsches Tag: llama3.1 lädt 8b, nicht automatisch 70b.
  • Modell nicht geladen: ollama pull vor ollama run ausführen.
  • Zu wenig VRAM: Modell startet langsam oder bricht ab.
  • Server nicht erreichbar: OLLAMA_HOST prüfen und Dienststatus prüfen.
  • Falsche API-URL: OpenAI-kompatibler Endpunkt ist /v1/chat/completions.

FAQ: Ollama-Befehle

Wie sehe ich alle installierten Modelle? Mit ollama list.

Wie starte ich Ollama im Hintergrund? Über ollama serve oder als Systemd-Dienst.

Wie erstelle ich ein eigenes Modell? Mit einem Modelfile und ollama create.

Wie prüfe ich, ob ein Modell auf GPU läuft? Mit ollama ps oder nvidia-smi.

Was ist der Unterschied zwischen pull und run? pull lädt das Modell herunter, run startet es.

Quellen und weiterführende Literatur

Zusammenfassung: Die wichtigsten Ollama-Befehle

Ollama wird über eine übersichtliche CLI gesteuert. Die wichtigsten Befehle sind pull, run, list, ps, rm und create. Mit Modelfiles kann man Modelle individuell anpassen. Die REST API ermöglicht die Einbindung in eigene Anwendungen. Wer Tags, Server-Modus und API-Endpoints beherrscht, kann Ollama effizient für Chat, RAG, Coding und Embedding nutzen.

Zurück zum KI Blog
Share:

Ähnliche Beiträge