Skip to content
BotServBotServ
OllamaModelleVergleichBenchmarkTest

Ollama-Modell-Vergleich

Modelle für Ollama systematisch vergleichen. Kriterien, Benchmarks, Aufgaben und praktische Testmethoden.

S

schutzgeist

2 min read
Ollama-Modell-Vergleich

Ollama-Modell-Vergleich

Was dieser Artikel über Modell-Vergleich behandelt

  • Welche Kriterien für einen Vergleich wichtig sind.
  • Wie man schnelle und langsame Aspekte bewertet.
  • Benchmark-Methoden.
  • Praktische Vergleichsabläufe.
  • Tipps für aussagekräftige Ergebnisse.

Einleitung: Ollama-Modell-Vergleich

Die Ollama-Bibliothek wächst ständig. Modelle unterscheiden sich in Grösse, Geschwindigkeit, Fähigkeiten und Hardwarebedarf. Wer das passende Modell für einen Anwendungsfall sucht, sollte nicht nur auf Benchmark-Werte vertrauen, sondern eigene Tests durchführen. Ein systematischer Vergleich hilft, das beste Modell für die eigene Hardware und den konkreten Anwendungsfall zu finden.

Dieser Artikel zeigt, wie man Ollama-Modelle vergleicht.

Wichtige Begriffe

  • Benchmark: Standardisierter Test.
  • Latency: Zeit bis zur ersten Antwort.
  • Throughput: Tokens pro Sekunde.
  • Accuracy: Korrektheit der Antworten.
  • Hallucination: Erfundene Informationen.
  • Quant: Quantisierungsvariante.
  • Task-Specific: Spezialisierte Aufgabe.
  • Gold-Standard: Referenzantwort.

Vergleichskriterien

KriteriumBedeutung
GeschwindigkeitTokens pro Sekunde, Startzeit
QualitätKorrektheit, Vollständigkeit
VRAM-BedarfSpeicheranforderungen
KontextMaximale Token-Länge
SpracheDeutscb, Englisch, Multilingual
SpezialisierungCoding, Chat, Vision, Reasoning
LizenzKommerzielle Nutzung

Vorgehen

  1. Anwendungsfall definieren.
  2. Kandidaten auswählen.
  3. Testaufgaben erstellen.
  4. Jeden Kandidaten gleich bewerten.
  5. Geschwindigkeit messen.
  6. Qualität bewerten.
  7. VRAM- und RAM-Bedarf dokumentieren.
  8. Besten Kompromiss wählen.

Geschwindigkeit messen

ollama run llama3.1:8b --verbose

Oder mit einem Skript:

import time, requests

for model in ["llama3.1:8b", "qwen2.5:7b"]:
    start = time.time()
    response = requests.post("http://localhost:11434/api/generate", json={
        "model": model,
        "prompt": "Erkläre Docker.",
        "stream": False
    })
    duration = time.time() - start
    eval_count = response.json().get("eval_count", 0)
    print(f"{model}: {eval_count/duration:.2f} tokens/s")

Qualität testen

Vorbereitete Fragen mit bekannten Antworten:

  • Zusammenfassung.
  • Übersetzung.
  • Rechnen.
  • Faktenabfrage.
  • Coding-Aufgabe.
  • Logikrätsel.

Jede Antwort wird gegen ein Gold-Standard oder manuelle Bewertung geprüft.

Prompt identisch halten

ollama run llama3.1:8b "Fasse Docker in drei Sätzen zusammen."
ollama run qwen2.5:7b "Fasse Docker in drei Sätzen zusammen."

Parameternormalisierung

Gleiche temperature, num_predict und num_ctx für alle Kandidaten:

{
  "options": {
    "temperature": 0.1,
    "num_predict": 200,
    "num_ctx": 4096
  }
}

Tipps

  • Mehrere Durchläufe je Modell.
  • Prompts identisch halten.
  • Modelle nach Anwendungsfall bewerten.
  • Auf Halluzinationen achten.
  • Quantisierung pro Modell notieren.
  • Keine einzelne Antwort überbewerten.
  • Bias vermeiden.

Werkzeuge

  • ollama-befehle.
  • curl und jq.
  • Python-Skripte.
  • vram-rechner.
  • MTEB für Embeddings.
  • LMSYS Chatbot Arena als Referenz.

FAQ: Ollama-Modell-Vergleich

Wie viele Modelle sollte ich testen? 2-5 passende Kandidaten reichen meist.

Welches ist das objektiv beste Modell? Es gibt keines. Es kommt auf Anwendung und Hardware an.

Brauche ich Benchmarks? Ja, aber eigene Aufgaben sind oft aussagekräftiger.

Wie vergleiche ich Geschwindigkeit? Tokens pro Sekunde bei gleichem Prompt messen.

Soll ich verschiedene Quantisierungen testen? Ja, Q4 vs. Q5 kann grosse Unterschiede in Qualität und Geschwindigkeit bringen.

Quellen und weiterführende Literatur

Zusammenfassung: Ollama-Modell-Vergleich

Ein guter Modell-Vergleich berücksichtigt Geschwindigkeit, Qualität, VRAM-Bedarf, Kontextlänge und Spezialisierung. Identische Prompts und Parameter sind entscheidend. Benchmarks helfen, eigene Anwendungstests geben aber die realistischsten Ergebnisse. Wer 2-5 passende Kandidaten auf eigenen Aufgaben testet, findet den besten Kompromiss für seine Hardware und sein Projekt.

Zurück zum KI Blog
Share:

Ähnliche Beiträge