Ollama-Modell-Vergleich
Was dieser Artikel über Modell-Vergleich behandelt
- Welche Kriterien für einen Vergleich wichtig sind.
- Wie man schnelle und langsame Aspekte bewertet.
- Benchmark-Methoden.
- Praktische Vergleichsabläufe.
- Tipps für aussagekräftige Ergebnisse.
Einleitung: Ollama-Modell-Vergleich
Die Ollama-Bibliothek wächst ständig. Modelle unterscheiden sich in Grösse, Geschwindigkeit, Fähigkeiten und Hardwarebedarf. Wer das passende Modell für einen Anwendungsfall sucht, sollte nicht nur auf Benchmark-Werte vertrauen, sondern eigene Tests durchführen. Ein systematischer Vergleich hilft, das beste Modell für die eigene Hardware und den konkreten Anwendungsfall zu finden.
Dieser Artikel zeigt, wie man Ollama-Modelle vergleicht.
Wichtige Begriffe
- Benchmark: Standardisierter Test.
- Latency: Zeit bis zur ersten Antwort.
- Throughput: Tokens pro Sekunde.
- Accuracy: Korrektheit der Antworten.
- Hallucination: Erfundene Informationen.
- Quant: Quantisierungsvariante.
- Task-Specific: Spezialisierte Aufgabe.
- Gold-Standard: Referenzantwort.
Vergleichskriterien
| Kriterium | Bedeutung |
|---|---|
| Geschwindigkeit | Tokens pro Sekunde, Startzeit |
| Qualität | Korrektheit, Vollständigkeit |
| VRAM-Bedarf | Speicheranforderungen |
| Kontext | Maximale Token-Länge |
| Sprache | Deutscb, Englisch, Multilingual |
| Spezialisierung | Coding, Chat, Vision, Reasoning |
| Lizenz | Kommerzielle Nutzung |
Vorgehen
- Anwendungsfall definieren.
- Kandidaten auswählen.
- Testaufgaben erstellen.
- Jeden Kandidaten gleich bewerten.
- Geschwindigkeit messen.
- Qualität bewerten.
- VRAM- und RAM-Bedarf dokumentieren.
- Besten Kompromiss wählen.
Geschwindigkeit messen
ollama run llama3.1:8b --verbose
Oder mit einem Skript:
import time, requests
for model in ["llama3.1:8b", "qwen2.5:7b"]:
start = time.time()
response = requests.post("http://localhost:11434/api/generate", json={
"model": model,
"prompt": "Erkläre Docker.",
"stream": False
})
duration = time.time() - start
eval_count = response.json().get("eval_count", 0)
print(f"{model}: {eval_count/duration:.2f} tokens/s")
Qualität testen
Vorbereitete Fragen mit bekannten Antworten:
- Zusammenfassung.
- Übersetzung.
- Rechnen.
- Faktenabfrage.
- Coding-Aufgabe.
- Logikrätsel.
Jede Antwort wird gegen ein Gold-Standard oder manuelle Bewertung geprüft.
Prompt identisch halten
ollama run llama3.1:8b "Fasse Docker in drei Sätzen zusammen."
ollama run qwen2.5:7b "Fasse Docker in drei Sätzen zusammen."
Parameternormalisierung
Gleiche temperature, num_predict und num_ctx für alle Kandidaten:
{
"options": {
"temperature": 0.1,
"num_predict": 200,
"num_ctx": 4096
}
}
Tipps
- Mehrere Durchläufe je Modell.
- Prompts identisch halten.
- Modelle nach Anwendungsfall bewerten.
- Auf Halluzinationen achten.
- Quantisierung pro Modell notieren.
- Keine einzelne Antwort überbewerten.
- Bias vermeiden.
Werkzeuge
ollama-befehle.curlundjq.- Python-Skripte.
vram-rechner.- MTEB für Embeddings.
- LMSYS Chatbot Arena als Referenz.
Weiterführende Links und Infos
- BotServ.de Ollama Modell-Benchmarks
- BotServ.de Ollama Modell-Empfehlungen
- BotServ.de Ollama Modell-Galerie
- BotServ.de Tools Modell-Finder
FAQ: Ollama-Modell-Vergleich
Wie viele Modelle sollte ich testen? 2-5 passende Kandidaten reichen meist.
Welches ist das objektiv beste Modell? Es gibt keines. Es kommt auf Anwendung und Hardware an.
Brauche ich Benchmarks? Ja, aber eigene Aufgaben sind oft aussagekräftiger.
Wie vergleiche ich Geschwindigkeit? Tokens pro Sekunde bei gleichem Prompt messen.
Soll ich verschiedene Quantisierungen testen? Ja, Q4 vs. Q5 kann grosse Unterschiede in Qualität und Geschwindigkeit bringen.
Quellen und weiterführende Literatur
- LMSYS Arena: https://chat.lmsys.org/
- MTEB: https://huggingface.co/spaces/mteb/leaderboard
- Ollama Library: https://ollama.com/library
Zusammenfassung: Ollama-Modell-Vergleich
Ein guter Modell-Vergleich berücksichtigt Geschwindigkeit, Qualität, VRAM-Bedarf, Kontextlänge und Spezialisierung. Identische Prompts und Parameter sind entscheidend. Benchmarks helfen, eigene Anwendungstests geben aber die realistischsten Ergebnisse. Wer 2-5 passende Kandidaten auf eigenen Aufgaben testet, findet den besten Kompromiss für seine Hardware und sein Projekt.


