Ollama API nutzen
Einleitung
Ollama bietet neben der Kommandozeile auch eine lokale HTTP-API. Sie ermöglicht es, Ollama aus eigenen Anwendungen, Skripten oder Workflows zu nutzen. Das ist der Schlüssel, um lokal betriebene Sprachmodelle in Chatbots, Agenten oder Automatisierungen einzubinden.
Ollama API - In A Nutshell
Der Ollama-Server läuft nach der Installation im Hintergrund und bietet einen Endpunkt unter http://localhost:11434 an. Du kannst damit Modelle abfragen, Chatverläufe führen und generierte Antworten empfangen. Die API folgt einem einfachen HTTP-Schema. Fast jede Programmiersprache kann damit umgehen.
Wichtige Begriffe und Komponenten
| Begriff | Bedeutung |
|---|---|
| API-Endpoint | Adresse, unter der Ollama erreichbar ist |
| generate | Endpunkt für einzelne Textgenerierungen |
| chat | Endpunkt für Chatverläufe mit Rollen |
| stream | Option für Antworten in Echtzeit, Chunk für Chunk |
| prompt | Eingabe, die Du an das Modell sendest |
Praxisrelevanz
Wann nutzt man die API?
Sobald Du Ollama nicht nur im Terminal, sondern in einer eigenen Anwendung nutzen willst. Beispiele sind ein eigener Chat-Client, ein KI-Agent, ein Skript zur automatisierten Textverarbeitung oder eine Integration in n8n.
Ollama Server starten
Falls der Server nicht läuft, startest Du ihn mit:
ollama serve
Danach steht die API unter http://localhost:11434 bereit. Achte darauf, dass das Modell bereits heruntergeladen ist, das Du nutzen willst:
ollama pull llama3
API-Aufruf mit curl
Eine einfache Anfrage ohne Chatverlauf sieht so aus:
curl http://localhost:11434/api/generate -d '{
"model": "llama3",
"prompt": "Was ist lokale KI?",
"stream": false
}'
Für gestreamte Antworten setzt Du "stream": true. Dann liefert Ollama die Antwort in mehreren Teilen, was flüssiger wirkt.
API-Aufruf mit Python
import requests
response = requests.post(
"http://localhost:11434/api/generate",
json={
"model": "llama3",
"prompt": "Erkläre Quantisierung in zwei Sätzen.",
"stream": False
}
)
print(response.json()["response"])
Mit stream=True liest Du die Antwort in einer Schleife aus:
import requests
import json
response = requests.post(
"http://localhost:11434/api/generate",
json={"model": "llama3", "prompt": "Was ist ein KV-Cache?", "stream": True},
stream=True
)
for line in response.iter_lines():
if line:
data = json.loads(line)
print(data.get("response", ""), end="")
API-Aufruf mit JavaScript
const response = await fetch('http://localhost:11434/api/generate', {
method: 'POST',
headers: { 'Content-Type': 'application/json' },
body: JSON.stringify({
model: 'llama3',
prompt: 'Was sind Tokens?',
stream: false,
}),
});
const data = await response.json();
console.log(data.response);
Chat-Endpunkt nutzen
Der Chat-Endpunkt eignet sich, wenn Du Gespräche mit Rollen führen willst:
curl http://localhost:11434/api/chat -d '{
"model": "llama3",
"messages": [
{"role": "user", "content": "Erkläre lokale KI kurz."}
],
"stream": false
}'
Dieses Format ist kompatibel mit vielen OpenAI-ähnlichen Clients und eignet sich besonders für Chatbots.
Hardware-, Kosten- und Sicherheitsbetrachtung
Die API läuft standardmäßig nur lokal. Wer sie im Netzwerk oder über das Internet erreichbar machen will, muss Reverse-Proxy, Firewall und Authentifizierung einrichten. Mehr dazu findest Du im Artikel Ollama Netzwerkzugriff.
Kosten entstehen keine, solange Ollama lokal betrieben wird. Die Geschwindigkeit hängt von der Hardware ab. CPU-betrieb ist langsam, GPU-betrieb deutlich flüssiger.
Weitere KI Infos und Themen
- Der Ollama-Server läuft unter
http://localhost:11434. api/generateist für einfache Prompts,api/chatfür Gespräche.- Mit
stream: trueerhältst Du Antworten in Echtzeit. - Die API ist OpenAI-ähnlich und lässt sich leicht in bestehende Tools einbinden.
Mehr zur Installation findest Du in Ollama installieren und zur Modellverwaltung in Ollama Modelle verwalten.
FAQ - Typische Fragen zur Ollama API
Muss ich den Server immer manuell starten?
Nein. Auf Linux und macOS startet Ollama nach der Installation automatisch als Dienst. Auf Windows läuft es ebenfalls im Hintergrund. Nur bei Docker musst Du den Container starten.
Kann ich die API über das Netzwerk erreichbar machen?
Ja, über die Umgebungsvariable OLLAMA_HOST=0.0.0.0:11434 oder ein Reverse-Proxy. Achte auf Authentifizierung und Firewall.
Welches Format haben Chat-Nachrichten?
Der Chat-Endpunkt erwartet ein Array aus Objekten mit role und content, beispielsweise {"role": "user", "content": "Hallo"}.
Kann ich Open WebUI mit Ollama nutzen?
Ja. Open WebUI verbindet sich standardmäßig mit der lokalen Ollama-API und bietet eine moderne Chat-Oberfläche im Browser.
Wie schnell ist die API?
Die Geschwindigkeit hängt von Modellgröße, Quantisierung und Hardware ab. Auf einer GPU mit ausreichend VRAM sind Antworten oft innerhalb weniger Sekunden verfügbar.
Tools und Weiterführendes
Für den API-Test eignen sich curl, Postman oder Insomnia. In Python helfen requests und httpx. Für JavaScript reicht ein einfacher fetch-Aufruf.
Quellen
- Ollama API-Dokumentation
- Open WebUI Projektseite
- MDN Fetch-Dokumentation


