Die wichtigsten Ollama-Befehle
Was dieser Artikel über Ollama-Befehle behandelt
- Die wichtigsten Befehle für den Einstieg in Ollama.
- Modelle herunterladen, starten und löschen.
- Informationen über laufende und installierte Modelle.
- Erstellung eigener Modelle mit Modelfiles.
- Wichtige API-Endpoints kurz erklärt.
Einleitung: Die wichtigsten Ollama-Befehle
Ollama wird primär über die Kommandozeile bedient. Ob man ein neues Modell herunterladen, ein bestehendes anpassen oder den Status prüfen möchte: die CLI bietet dafür übersichtliche Befehle. Dieser Artikel fasst die wichtigsten Ollama-Befehle zusammen, die im täglichen Gebrauch am häufigsten benötigt werden.
Für alle Befehle gilt: eine vollständige Hilfe erhält man mit ollama --help oder ollama <befehl> --help.
Wichtige Begriffe
- CLI: Kommandozeileninterface von Ollama.
- Model: Ein heruntergeladenes Sprachmodell.
- Tag: Versions- oder Grössenkennung, zum Beispiel
:8boder:70b. - Modelfile: Rezept zum Erstellen oder Anpassen eines Modells.
- Parameter: Einstellung wie Temperatur oder Kontextlänge.
- Serve: Ollama-Server starten.
Modell-Management
| Befehl | Zweck |
|---|---|
ollama pull <modell> | Modell herunterladen oder aktualisieren. |
ollama run <modell> | Modell starten und interaktiv chatten. |
ollama list | Alle installierten Modelle anzeigen. |
ollama ps | Aktuell geladene Modelle anzeigen. |
ollama rm <modell> | Modell entfernen. |
ollama cp <quelle> <ziel> | Modell kopieren. |
ollama show <modell> | Details zu einem Modell anzeigen. |
Beispiele:
ollama pull llama3.1
ollama pull llama3.1:70b
ollama pull qwen2.5:14b
ollama pull nomic-embed-text
Interaktives Chatten
ollama run llama3.1
Nach dem Start kann man direkt Prompts eingeben. Mit /bye oder Strg+D verlässt man den Chat.
Einmalige Frage
ollama run llama3.1 "Erkläre Quantisierung."
Modell-Informationen
ollama show llama3.1
ollama ps
ollama ps zeigt unter anderem, welches Modell geladen ist und ob es auf CPU oder GPU läuft.
Modelfiles
| Befehl | Zweck |
|---|---|
ollama create <name> -f Modelfile | Eigenes Modell aus Modelfile erstellen. |
ollama show <modell> --modelfile | Modelfile eines bestehenden Modells anzeigen. |
Beispiel-Modelfile:
FROM llama3.1
SYSTEM """
Du bist ein präziser Assistent für lokale KI.
"""
PARAMETER temperature 0.5
PARAMETER num_ctx 4096
Erstellen:
ollama create mein-assistent -f Modelfile
ollama run mein-assistent
Server-Betrieb
| Befehl | Zweck |
|---|---|
ollama serve | Ollama-Server starten. |
ollama serve --host 0.0.0.0 | An alle Schnittstellen binden. |
In der Regel läuft Ollama als Dienst im Hintergrund. Bei manueller Entwicklung startet man ollama serve im Terminal.
API-Endpoints
| Endpoint | Zweck |
|---|---|
POST /api/generate | Einzelne Textgenerierung. |
POST /api/chat | Chat mit Nachrichtenverlauf. |
POST /api/embed | Embeddings erzeugen. |
GET /api/tags | Installierte Modelle auflisten. |
POST /v1/chat/completions | OpenAI-kompatibler Chat. |
Beispiel:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1",
"prompt": "Erkläre Ollama in drei Sätzen."
}'
Nützliche Optionen
| Befehl | Zweck |
|---|---|
ollama run llama3.1 --verbose | Zusätzliche Informationen anzeigen. |
ollama run llama3.1 --nowordwrap | Zeilenumbruch deaktivieren. |
Häufige Befehlsfolgen
Ein neues Modell testen
ollama pull qwen2.5:14b
ollama run qwen2.5:14b
Modell für RAG kopieren und anpassen
ollama cp llama3.1 mein-rag-modell
ollama create mein-rag-modell -f Modelfile
ollama run mein-rag-modell
Speicher freigeben
ollama ps
ollama rm llama3.1:70b
ollama rm alteres-modell
Tipps zur Nutzung
- Modellnamen immer mit passendem Tag verwenden.
- Vor Updates prüfen, ob das Modell aktiv genutzt wird.
ollama pshilft, den GPU- oder CPU-Betrieb zu erkennen.- Mit Modelfiles können eigene Assistenten erstellt werden.
Typische Stolpersteine
- Falsches Tag:
llama3.1lädt8b, nicht automatisch70b. - Modell nicht geladen:
ollama pullvorollama runausführen. - Zu wenig VRAM: Modell startet langsam oder bricht ab.
- Server nicht erreichbar:
OLLAMA_HOSTprüfen und Dienststatus prüfen. - Falsche API-URL: OpenAI-kompatibler Endpunkt ist
/v1/chat/completions.
Weiterführende Links und Infos
- BotServ.de Ollama Funktionen
- BotServ.de Ollama Performance
- BotServ.de Ollama REST API
- BotServ.de Ollama Systemd
- BotServ.de Ollama Modell-Lebenszyklus
FAQ: Ollama-Befehle
Wie sehe ich alle installierten Modelle?
Mit ollama list.
Wie starte ich Ollama im Hintergrund?
Über ollama serve oder als Systemd-Dienst.
Wie erstelle ich ein eigenes Modell?
Mit einem Modelfile und ollama create.
Wie prüfe ich, ob ein Modell auf GPU läuft?
Mit ollama ps oder nvidia-smi.
Was ist der Unterschied zwischen pull und run?
pull lädt das Modell herunter, run startet es.
Quellen und weiterführende Literatur
- Ollama Library: https://ollama.com/library
- Ollama Docs: https://github.com/ollama/ollama/blob/main/docs/
- Ollama Modelfile: https://github.com/ollama/ollama/blob/main/docs/modelfile.md
Zusammenfassung: Die wichtigsten Ollama-Befehle
Ollama wird über eine übersichtliche CLI gesteuert. Die wichtigsten Befehle sind pull, run, list, ps, rm und create. Mit Modelfiles kann man Modelle individuell anpassen. Die REST API ermöglicht die Einbindung in eigene Anwendungen. Wer Tags, Server-Modus und API-Endpoints beherrscht, kann Ollama effizient für Chat, RAG, Coding und Embedding nutzen.


