LLM lokal betreiben
Was dieser Artikel über lokalen LLM-Betrieb behandelt
- Welche Hardware und Software Du für einen lokalen LLM-Betrieb brauchst
- Wie Du Ollama auf Linux, macOS und Windows installierst
- Wie Du ein passendes Einsteigermodell auswählst und startest
- Wie Du die Ollama API mit curl und Python ansprichst
- Welche Alternativen wie LM Studio und Docker es gibt
Einleitung: LLM lokal betreiben verständlich erklärt
Ein Large Language Model, kurz LLM, ist die Grundlage für Chatbots, Textassistenten und KI-Agenten. Normalerweise greifst Du über eine API auf solche Modelle zu, zahlst pro Token und schickst Deine Daten an einen Cloud-Anbieter. Das funktioniert, kostet Geld und wirft Datenschutzfragen auf.
Mit der passenden Software und etwas Hardware kannst Du ein LLM aber auch lokal betreiben. Das Modell läuft auf Deinem Rechner, Du behältst die Kontrolle über Deine Daten und zahlst keine API-Gebühren. Dieser Artikel zeigt, wie Du das mit Ollama als einfachste Einstiegslösung umsetzt. Mehr Hintergrund dazu findest Du unter Was ist lokale KI?.
Warum brauche ich lokalen LLM-Betrieb?
Es gibt vier konkrete Gründe, warum sich der lokale Betrieb lohnt:
- Keine API-Kosten: Du zahlst nichts pro Anfrage. Einmal installiert, läuft das Modell ohne laufende Gebühren. Das macht es attraktiv für Experimente, Prototypen und regelmäßige Nutzung.
- Datenschutz: Sensible Dokumente, internen Code oder persönliche Texte bleiben auf Deinem Rechner. Nichts verlässt Dein Netzwerk, solange Du Ollama lokal betreibst.
- Keine Rate Limits: Cloud-Anbieter begrenzen, wie viele Anfragen Du pro Minute senden darfst. Lokal gibt es keine solchen Limits. Du kannst hunderte Prompts nacheinander absetzen.
- Offline-Fähigkeit: Ohne Internetverbindung funktioniert das Modell trotzdem. Das ist nützlich auf Reisen, in abgesicherten Netzwerken oder bei Ausfällen.
Einen ausführlichen Vergleich findest Du im Artikel Lokale KI vs. Cloud KI.
LLM lokal betreiben - In A Nutshell
Ein LLM lokal zu betreiben bedeutet, dass die Modelldatei und die Inferenzumgebung auf Deinem Rechner laufen. Du gibst einen Prompt ein, Dein Rechner verarbeitet ihn und gibt eine Antwort aus. Der Vorgang erfordert drei Dinge: passende Hardware, eine Laufzeitumgebung und ein Modell im kompatiblen Format.
Ollama ist ein beliebter Einstieg, weil es Modellverwaltung, API und Chat-Oberfläche in einem Paket bietet. Für den Start reicht ein Befehl wie ollama run llama3.1. Ollama lädt das Modell herunter, entpackt es und startet einen lokalen Server, auf den Du über das Terminal, einen Browser oder eine eigene Anwendung zugreifen kannst.
Für wen ist das gedacht?
Der lokale LLM-Betrieb richtet sich an mehrere Zielgruppen:
- Entwickler, die Modelle ohne API-Schlüssel testen und in eigene Anwendungen einbauen wollen
- Datenschützer und Unternehmen, die sensible Dokumente verarbeiten, ohne Daten nach außen zu geben
- KI-Interessierte, die mit eigenen Workflows experimentieren und verstehen wollen, wie Modelle funktionieren
- Self-Hoster, die ihre Infrastruktur selbst kontrollieren und unabhängig von Cloud-Anbietern sein wollen
Vorkenntnisse in der Kommandozeile helfen, sind aber nicht zwingend erforderlich. Ollama reduziert den Einstieg auf wenige Befehle.
Wichtige Begriffe
| Begriff | Bedeutung |
|---|---|
| LLM | Large Language Model, ein Sprachmodell mit vielen Parametern |
| Inferenz | Die Verarbeitung eines Prompts zur Erzeugung einer Antwort |
| Ollama | Laufzeitumgebung zum Herunterladen und Ausführen lokaler Modelle |
| GGUF | Ein verbreitetes Format für quantisierte lokale Modelle |
| Parameter | Gewichte des Modells, typischerweise in Milliarden angegeben |
| Token | Ein Textabschnitt, den das Modell verarbeitet, etwa ein Wort oder ein Teil eines Wortes |
| Quantisierung | Verkleinerung eines Modells durch Reduzierung der Speichertiefe pro Parameter |
| Modelfile | Eine Konfigurationsdatei für Ollama, die Modell, Parameter und System-Prompt festlegt |
| Context Window | Die maximale Textmenge, die das Modell gleichzeitig verarbeiten kann |
Mehr zu Quantisierung findest Du im Artikel Quantisierung, Details zum Context Window unter Kontextlänge.
Voraussetzungen für lokalen LLM-Betrieb
Hardware
Die Hardware entscheidet darüber, welche Modelle Du laufen lassen kannst und wie schnell die Antworten kommen. Hier eine Übersicht für typische Einsteiger-Setups:
| Setup | RAM / VRAM | Geeignete Modelle | Geschwindigkeit |
|---|---|---|---|
| Mindestsetup | 8 GB | phi3 (3.8B), kleine Modelle | Langsam, nur CPU |
| Standardsetup | 16 GB | llama3.1 (8B), qwen2.5 (7B) | Brauchbar, schneller mit GPU |
| Komfortsetup | 32 GB | mistral (7B) quantisiert, llama3.1 (8B) flüssig | Schnell mit GPU |
| Leistungsssetup | 64 GB+ | Größere Modelle bis 70B quantisiert | Sehr schnell mit starker GPU |
Eine GPU beschleunigt die Inferenz deutlich. Nvidia-Karten werden am besten unterstützt, Apple Silicon (M1 bis M4) funktioniert ebenfalls sehr gut dank des Unified Memory. Ohne GPU läuft alles auf der CPU, was bei kleinen Modellen noch akzeptabel ist, bei größeren aber frustrierend langsam wird.
Detaillierte Anforderungen findest Du unter RAM und VRAM Anforderungen und KI-Hardware Grundlagen.
Software
- Betriebssystem: Linux, macOS oder Windows 10/11
- Ollama: Die Laufzeitumgebung, kostenlos verfügbar
- Optional: Docker, falls Du Ollama containerisiert betreiben willst
- Optional: Python 3.8 oder neuer, falls Du die API per Skript ansprechen willst
Schritt 1: Hardware prüfen
Bevor Du Ollama installierst, prüfe, was Dein Rechner hergibt. Das vermeidet Enttäuschungen, wenn ein Modell später nicht flüssig läuft.
RAM prüfen
Unter Linux und macOS:
free -h
Unter macOS alternativ über das Apple-Menü: “Über diesen Mac” öffnen, dort steht der Arbeitsspeicher.
Unter Windows:
wmic memorychip get capacity
Oder öffne den Task-Manager, Reiter “Leistung”, dort siehst Du den verwendeten und gesamten Arbeitsspeicher.
VRAM prüfen
Falls Du eine Nvidia-GPU hast, nutze nvidia-smi:
nvidia-smi
Das Kommando zeigt den GPU-Namen, den VRAM und die aktuelle Auslastung. Bei AMD-GPUs hilft rocm-smi, bei Apple Silicon zeigt system_profiler SPDisplaysDataType die Details.
Festplattenplatz
Modelle brauchen Speicherplatz. Ein 8B-Modell in quantisierter Form belegt etwa 4 bis 6 GB. Rechne mit mindestens 20 GB freiem Speicher, falls Du mehrere Modelle ausprobieren willst.
Schritt 2: Ollama installieren
Ollama ist für Linux, macOS und Windows verfügbar. Die Installation unterscheidet sich leicht je nach Plattform. Eine ausführliche Anleitung findest Du unter Ollama Installation.
Linux
Der schnellste Weg ist das offizielle Installationsskript:
curl -fsSL https://ollama.com/install.sh | sh
Das Skript lädt die aktuelle Version herunter, richtet den Dienst ein und startet ihn automatisch. Prüfe danach, ob Ollama läuft:
ollama --version
Falls Du Ollama manuell installieren willst, lade das Binary von der Ollama-Website herunter, verschiebe es nach /usr/local/bin/ und richte einen systemd-Dienst ein.
macOS
Lade den Installer von ollama.com herunter, öffne die .dmg-Datei und ziehe Ollama in den Programme-Ordner. Starte Ollama einmal, danach läuft es im Hintergrund. Prüfe im Terminal:
ollama --version
macOS mit Apple Silicon nutzt den Unified Memory automatisch. Du musst nichts extra konfigurieren.
Windows
Lade den Installer von ollama.com herunter und führe ihn aus. Ollama richtet sich als Hintergrunddienst ein. Öffne danach die Eingabeaufforderung oder PowerShell und prüfe:
ollama --version
Falls Du WSL2 nutzt, kannst Du Ollama auch innerhalb von WSL2 installieren, wie oben unter Linux beschrieben.
Schritt 3: Modell wählen
Die Modellauswahl hängt von Deiner Hardware ab. Für den Einstieg empfiehlt sich ein kleines Modell, das flüssig läuft und schnell Antworten liefert. Eine Übersicht aller verfügbaren Modelle findest Du unter Modelle verwalten.
Empfohlene Einsteigermodelle
| Modell | Parameter | RAM-Bedarf (quantisiert) | Stärken |
|---|---|---|---|
llama3.1 | 8B | ca. 5 GB | Allrounder, gute Deutschkenntnisse |
qwen2.5 | 7B | ca. 4,5 GB | Stark in Code und Logik |
mistral | 7B | ca. 4,5 GB | Kompakt, schnell, zuverlässig |
phi3 | 3.8B | ca. 2,5 GB | Sehr klein, läuft auf schwacher Hardware |
Starte mit llama3.1 oder phi3, falls Dein Rechner wenig RAM hat. Du kannst jederzeit mehrere Modelle installieren und vergleichen.
Schritt 4: Modell starten
Sobald Ollama installiert ist, startest Du ein Modell mit einem einzigen Befehl:
ollama run llama3.1
Beim ersten Aufruf lädt Ollama das Modell herunter. Das dauert je nach Internetverbindung einige Minuten. Danach startet ein interaktiver Chat im Terminal. Gib einen Prompt ein, drücke Enter und warte auf die Antwort.
Beispiel-Prompt:
Erkläre mir in drei Sätzen, was ein LLM ist.
Um den Chat zu beenden, tippe /bye oder drücke Ctrl+D.
Falls Du das Modell nur herunterladen, aber nicht direkt starten willst:
ollama pull llama3.1
Das ist nützlich, wenn Du mehrere Modelle im Voraus laden willst.
Schritt 5: API nutzen
Ollama startet automatisch einen lokalen Server unter http://localhost:11434. Darüber sprichst Du das Modell aus eigenen Anwendungen an. Mehr Details findest Du unter Ollama API.
curl-Beispiel
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1",
"prompt": "Was ist lokale KI?",
"stream": false
}'
Mit "stream": false bekommst Du die komplette Antwort auf einmal. Ohne den Parameter streamt Ollama die Antwort in kleinen JSON-Chunks, was für Live-Ausgaben nützlich ist.
Python-Beispiel
import requests
response = requests.post(
"http://localhost:11434/api/generate",
json={
"model": "llama3.1",
"prompt": "Was ist lokale KI?",
"stream": False
}
)
print(response.json()["response"])
Für komfortableren Zugriff gibt es die offizielle Python-Bibliothek ollama:
pip install ollama
import ollama
response = ollama.generate(
model="llama3.1",
prompt="Was ist lokale KI?"
)
print(response["response"])
Alternative: LM Studio
LM Studio ist eine grafische Alternative zu Ollama. Es bietet eine Desktop-Oberfläche für Windows, macOS und Linux, in der Du Modelle per Klick herunterlädst, startest und im Chat testest.
Vorteile von LM Studio:
- Intuitive Oberfläche ohne Kommandozeile
- Modell-Suche direkt in der App über Hugging Face
- Eingebauter Chat mit Markdown-Unterstützung
- Kompatibler API-Server, den Du wie Ollama ansprechen kannst
Nachteile:
- Closed Source, im Gegensatz zu Ollama
- Weniger Kontrolle über Modellparameter
- Schwerer zu automatisieren
Für Anfänger, die sich nicht mit der Kommandozeile anfreunden wollen, ist LM Studio eine gute Wahl. Wer Skripte und Automatisierung plant, ist mit Ollama besser bedient.
Alternative: Docker
Falls Du Ollama containerisiert betreiben willst, etwa auf einem Server oder NAS, nutze das offizielle Docker-Image:
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
Danach lädst Du ein Modell in den Container:
docker exec -it ollama ollama pull llama3.1
Und startest es:
docker exec -it ollama ollama run llama3.1
Für GPU-Unterstützung füge --gpus all hinzu:
docker run -d --gpus all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
Docker eignet sich besonders, wenn Du Ollama dauerhaft auf einem Server betreiben willst oder bereits andere Dienste containerisiert laufen.
Ollama Befehle im Überblick
| Befehl | Beschreibung |
|---|---|
ollama run modell | Modell herunterladen und interaktiv starten |
ollama pull modell | Modell herunterladen, ohne es zu starten |
ollama list | Alle installierten Modelle anzeigen |
ollama rm modell | Modell vom Rechner löschen |
ollama show modell | Details zu einem Modell anzeigen |
ollama ps | Laufende Modelle anzeigen |
ollama serve | API-Server starten |
ollama create | Eigenes Modell aus einem Modelfile erstellen |
ollama stop modell | Laufendes Modell stoppen |
ollama --version | Installierte Version anzeigen |
Eine vollständige Übersicht findest Du unter Ollama Übersicht.
Typische Stolpersteine beim lokalen LLM-Betrieb
- Zu wenig RAM: Ein 8B-Modell braucht mindestens 5 GB freien RAM. Wenn Dein System schon viel Speicher belegt, bricht die Inferenz ab oder wird extrem langsam. Schließe andere Programme, bevor Du ein Modell startest.
- Falsche Modellgröße: Anfänger greifen oft zu großen Modellen wie 70B, die auf normaler Hardware nicht flüssig laufen. Starte klein und steigere Dich.
- Kein GPU-Support unter Docker: Ohne den
--gpus all-Parameter läuft Ollama im Container nur auf der CPU. Prüfe, ob das Nvidia Container Toolkit installiert ist. - Verwechslung von pull und run:
ollama pulllädt nur herunter,ollama runstartet den Chat. Werpullausführt und dann auf eine Antwort wartet, wartet vergeblich. - API nicht erreichbar: Wenn der Server nicht läuft, schlägt jeder API-Aufruf fehl. Starte Ollama mit
ollama serveoder stelle sicher, dass der Hintergrunddienst läuft. - Voll Festplatte: Modelle sind groß. Mehrere 8B-Modelle belegen schnell 20 GB und mehr. Räume alte Modelle mit
ollama rmweg. - Streaming verwirrt Anfänger: Die API sendet standardmäßig viele kleine JSON-Chunks. Setze
"stream": false, wenn Du die komplette Antwort auf einmal brauchst.
Hardware, Kosten und Sicherheit beim lokalen LLM-Betrieb
Hardware
Für den Einstieg ist oft keine neue Hardware nötig. Viele handelsübliche Rechner mit 16 GB RAM oder ein Mac mit M-Serie Prozessor eignen sich bereits. Wer regelmäßig größere Modelle nutzt, sollte in eine dedizierte GPU investieren. Eine Nvidia-Karte mit 12 GB VRAM, etwa eine RTX 3060, ist ein solider Mittelweg.
Kosten
Die Kosten bleiben überschaubar. Ollama ist kostenlos, ebenso die meisten Open-Source-Modelle. Hauptkostenfaktoren sind Strom und gegebenenfalls eine Neuanschaffung. Eine GPU verbraucht unter Last deutlich mehr Strom, was bei dauerhaftem Betrieb ins Geld geht.
Sicherheit
Aus Sicherheitssicht bleiben alle Daten lokal, solange Du Ollama im eigenen Netzwerk betreibst. Kein Prompt, keine Antwort verlässt Deinen Rechner. Das ist ein großer Vorteil gegenüber Cloud-Anbietern. Falls Du Ollama im Docker-Container betreibst und den Port nach außen freigibst, sichere die Verbindung mit einer Firewall oder einem Reverse Proxy ab.
Weiterführende Links und Infos zum lokalen LLM-Betrieb
- Was ist lokale KI? - Grundlagenartikel zum Thema
- Lokale KI vs. Cloud KI - Direkter Vergleich
- Quantisierung - Wie Modelle kleiner werden
- Kontextlänge - Was das Context Window bedeutet
- RAM und VRAM Anforderungen - Hardware im Detail
- Ollama Übersicht - Alles zu Ollama
- Ollama Installation - Detaillierte Installationsanleitung
- Ollama API - API-Dokumentation
- Modelle verwalten - Modelle laden, wechseln, löschen
- KI-Hardware Grundlagen - Hardware für KI verstehen
FAQ - Typische Fragen zum lokalen LLM-Betrieb
Kann ich mehrere Modelle installiert haben?
Ja. Ollama verwaltet beliebig viele Modelle. Du wechselst mit ollama run modellname zwischen ihnen. Mit ollama list siehst Du alle installierten Modelle.
Muss ich jedes Mal neu herunterladen?
Nein. Ein Modell bleibt nach dem ersten Download lokal gespeichert. Nur Aktualisierungen oder neue Modelle müssen erneut geladen werden.
Läuft Ollama auch ohne Grafikkarte?
Ja, auf der CPU. Die Antwortgeschwindigkeit ist dann deutlich langsamer als auf einer GPU. Für kleine Modelle wie phi3 ist das noch akzeptabel, für größere Modelle wird es frustrierend.
Wo finde ich passende Modelle?
Ollama bietet eine Modellbibliothek auf der eigenen Website an. Alternativ findest Du Modelle bei Hugging Face, oft im GGUF-Format. Mit ollama pull modellname lädst Du sie direkt herunter.
Kann ich Ollama in Docker nutzen?
Ja. Es gibt offizielle Docker-Images, die besonders für Server- oder NAS-Umgebungen praktisch sind. Für GPU-Unterstützung brauchst Du das Nvidia Container Toolkit und den Parameter —gpus all.
Wie viel RAM brauche ich mindestens?
Für kleine Modelle wie phi3 reichen 8 GB. Für 8B-Modelle wie llama3.1 solltest Du 16 GB haben, damit das Betriebssystem und das Modell gleichzeitig laufen können.
Was ist der Unterschied zwischen pull und run?
ollama pull lädt das Modell nur herunter. ollama run lädt es herunter, falls es noch nicht vorhanden ist, und startet direkt den interaktiven Chat.
Kann ich Ollama von anderen Geräten im Netzwerk erreichen?
Ja. Standardmäßig lauscht Ollama auf localhost. Du kannst die Umgebungsvariable OLLAMA_HOST auf 0.0.0.0:11434 setzen, damit Ollama aus dem Netzwerk erreichbar ist. Sichere den Zugriff mit einer Firewall ab.
Wie aktualisiere ich ein Modell?
Führe ollama pull modellname erneut aus. Ollama lädt die neueste Version herunter, falls eine verfügbar ist. Die alte Version wird überschrieben.
Was bedeutet Quantisierung und brauche ich sie?
Quantisierung verkleinert ein Modell, indem die Speichertiefe pro Parameter reduziert wird. Ollama nutzt standardmäßig quantisierte Modelle, Du musst Dich darum nicht kümmern. Mehr dazu im Artikel Quantisierung.
Kann ich eigene Modelle erstellen?
Ja. Mit einem Modelfile legst Du Basis-Modell, System-Prompt und Parameter fest. Erstelle eine Datei namens Modelfile und führe ollama create meinmodell -f Modelfile aus.
Wie stoppe ich ein laufendes Modell?
Mit ollama stop modellname entlädst Du das Modell aus dem Arbeitsspeicher. Es bleibt auf der Festplatte gespeichert und kann jederzeit wieder gestartet werden.
Werden meine Daten an einen Server gesendet?
Nein. Alle Verarbeitung passiert lokal auf Deinem Rechner. Weder Prompts noch Antworten verlassen Dein System, solange Du Ollama nicht absichtlich im Netzwerk freigibst.
Kann ich Ollama mit einer AMD-GPU nutzen?
Ja, mit Einschränkungen. Ollama unterstützt AMD-GPUs über ROCm, vor allem unter Linux. Unter Windows ist die Unterstützung eingeschränkt. Prüfe die aktuelle Dokumentation für kompatible Modelle.
Quellen und weiterführende Literatur
- Ollama Dokumentation: ollama.com
- Hugging Face GGUF-Modelle: huggingface.co
- llama.cpp Projektseite: github.com/ggerganov/llama.cpp
- LM Studio: lmstudio.ai


