Skip to content
BotServBotServ
OllamaLokale KIAPIModellverwaltungInstallation

Ollama

Ollama ist eine Laufzeitumgebung für offene Sprachmodelle. Modelle herunterladen, starten, chatten und über eine API nutzen.

S

schutzgeist

3 min read
Ollama Laufzeitumgebung für lokale KI

Ollama

Was dieser Artikel behandelt

  • Was Ollama ist und warum man es braucht.
  • Welche Alternativen es für lokal laufende Sprachmodelle gibt.
  • Wie man Ollama installiert und ein erstes Modell startet.
  • Wie man Ollama über die Kommandozeile und die API nutzt.
  • Verweise auf detaillierte Anleitungen.

Einleitung

Offene Sprachmodelle wie Llama, Qwen oder Mistral sind frei verfügbar. Trotzdem braucht man eine Software, die sie ausführt. Diese Software nennt man Laufzeitumgebung oder Inferenz-Engine. Ollama ist eine solche Laufzeitumgebung. Es lädt die Modell-Dateien herunter, verwaltet sie und bietet sowohl ein Chat-Interface als auch eine API an. Dadurch kannst Du mit Modellen sprechen oder sie in eigene Programme einbinden, ohne Cloud-Dienste zu nutzen.

Warum braucht man Ollama?

Ein großes Sprachmodell ist im Grunde eine riesige Datei. Um daraus Antworten zu bekommen, muss sie in einen sogenannten Inference-Runner geladen werden. Dieser Runner nimmt den Prompt, berechnet die passende Antwort und gibt sie aus. Ollama verpackt genau diesen Runner, die Modellverwaltung und eine API in einem einfach zu bedienenden Tool.

Alternativen dazu sind:

  • llama.cpp - Schnelle C++-Laufzeit, sehr flexibel, aber komplexer.
  • LM Studio - Grafische Anwendung mit Bedienoberfläche.
  • vLLM - Hochperformante Laufzeit für Server-Einsatz.
  • Text Generation Inference (TGI) - Von Hugging Face, eher für Produktivumgebungen.
  • KoboldCpp - Fokus auf Rollenspiel und kreative Texte.

Ollama sticht besonders durch Einfachheit hervor. Ein Befehl reicht, um ein Modell laufen zu haben.

Installation

Für Linux installierst Du Ollama mit einem Skript:

curl -fsSL https://ollama.com/install.sh | sh

Für macOS und Windows gibt es offizielle Installer auf der Ollama-Webseite. Nach der Installation läuft Ollama als Dienst im Hintergrund und ist über die Kommandozeile verfügbar.

Erste Schritte

Ein Modell herunterladen und starten:

ollama pull llama3.1
ollama run llama3.1

pull lädt das Modell aus dem Ollama-Repository herunter. run startet die Chat-Oberfläche im Terminal. Du kannst sofort loschatten. Zum Beenden der Session drückst Du Strg + D oder gibst /bye ein.

Ollama als API nutzen

Ollama stellt eine API zur Verfügung, die wie die OpenAI-API aufgebaut ist. Das macht den Umstieg leicht. Beispiel mit curl:

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama3.1",
    "messages": [
      {"role": "user", "content": "Erkläre Ollama in drei Sätzen."}
    ]
  }'

Die Antwort kommt als JSON zurück. Eigene Anwendungen, Agenten-Frameworks oder Chat-Frontends können diese API direkt nutzen.

Was kann Ollama alles?

FunktionNutzen
ModellverwaltungModelle herunterladen, auflisten, löschen
ChatDirekt im Terminal mit Modellen sprechen
APIProgramme oder Frameworks anbinden
ModelfilesEigene Modellkonfigurationen erstellen
SpeicherModelle bleiben lokal auf dem Rechner

Wann Ollama wählen?

  • Du suchst eine einfache Lösung für lokale KI.
  • Du willst Programme über eine API mit lokalen Modellen verbinden.
  • Du arbeitest mit Agenten-Frameworks wie LangGraph, CrewAI oder AutoGen.
  • Datenschutz und Unabhängigkeit von Cloud-APIs sind wichtig.

Inhalt und detaillierte Anleitungen

FAQ - Häufige Fragen

Ist Ollama kostenlos?

Ja, Ollama selbst ist Open Source und kostenlos. Kosten entstehen nur für Hardware und Strom.

Kann ich Ollama ohne Grafikkarte nutzen?

Ja, Ollama läuft auch auf der CPU. Große Modelle werden dadurch langsamer, aber kleine 7B-Modelle sind oft ausreichend schnell.

Ist die Ollama-API mit OpenAI kompatibel?

Ja, Ollama bietet einen Endpunkt unter /v1, der mit der OpenAI-Chat-API kompatibel ist. Viele Tools und Frameworks können ihn direkt nutzen.

Welche Modelle laufen mit Ollama?

Viele offene Modelle wie Llama 3.1, Qwen 2.5, Mistral, Code Llama und viele weitere. Die Liste findest Du in der Ollama-Bibliothek.

Quellen

Zurück zum KI Blog
Share:

Ähnliche Beiträge