Ollama-Modell-Empfehlungen nach Anwendungsfall
Was dieser Artikel über Modell-Empfehlungen behandelt
- Empfohlene Modelle für typische Anwendungsfälle.
- Unterschiede zwischen Chat-, Coding-, Reasoning- und Vision-Modellen.
- Wie man die richtige Modellgrösse wählt.
- Quantisierungs-Empfehlungen.
- Hinweise zur Hardware.
Einleitung: Ollama-Modell-Empfehlungen nach Anwendungsfall
Die Modellauswahl ist eine der wichtigsten Entscheidungen bei Ollama. Nicht jedes Modell ist für jeden Zweck geeignet. Einige sind allgemein und schnell, andere spezialisiert auf Coding, Reasoning oder Vision. Die Hardware legt zudem fest, welche Modellgrösse und Quantisierung überhaupt funktionieren. Wer die passenden Modelle kennt, spart sich viel Zeit und Frust.
Dieser Artikel gibt praktische Modell-Empfehlungen für gängige Anwendungsfälle.
Wichtige Begriffe
- 7B, 13B, 70B: Modellgrösse in Milliarden Parametern.
- Instruct: Modell für Anweisungen optimiert.
- Chat: Modell für Dialoge.
- Coder: Modell für Programmieraufgaben.
- Vision: Modell, das Bilder verarbeitet.
- Reasoning: Modell für logisches Schlussfolgern.
- Embedding: Modell für Vektordarstellungen.
- Quant: Quantisierungsstufe.
Allgemeiner Chat
| Modell | Grösse | Einsatz |
|---|---|---|
| llama3.1:8b | 8B | Schnell, gute Allrounder-Qualität |
| qwen2.5:7b | 7B | Schnell, gut für Deutsch |
| mistral:7b | 7B | Flott, kompakt |
| llama3.1:70b | 70B | Hochwertiger, braucht viel VRAM |
Für Alltagsfragen reichen 7B- bis 8B-Modelle mit Q4-K-Quantisierung.
Coding
| Modell | Einsatz |
|---|---|
| qwen2.5-coder:14b | Code-Vervollständigung |
| codellama:7b | Leichte Aufgaben |
| deepseek-coder:6.7b | Schnell und kompetent |
| qwen2.5-coder:32b | Bessere Qualität |
Für Coding sollte num_predict hoch genug sein, da Antworten länger werden.
Vision und Bildanalyse
| Modell | Einsatz |
|---|---|
| llava:13b | Bildbeschreibung |
| llava-llama3:8b | Kompromiss aus Grösse und Qualität |
| bakllava | Besseres Vision-Verständnis |
Vision-Modelle brauchen zusätzliches RAM/VRAM.
Reasoning
| Modell | Einsatz |
|---|---|
| qwen2.5:14b | Logik und Mathe |
| deepseek-r1 | Reasoning mit ausführlicher Begründung |
| phi4 | Kleineres Reasoning-Modell |
Reasoning-Modelle antworten oft länger, da sie Schritt für Schritt denken.
RAG
| Modell | Einsatz |
|---|---|
| llama3.1:8b | Standard-RAG |
| qwen2.5:7b | Gute Kontextnutzung |
| mistral:7b | Schnell |
Für RAG ist der Embedding-Modell ebenso wichtig.
Übersetzungen und Zusammenfassungen
| Modell | Einsatz |
|---|---|
| qwen2.5:7b | Deutsch/Englisch, Zusammenfassungen |
| mixtral:8x7b | Mehrsprachige Aufgaben |
| gemma2:9b | Qualität bei mittlerem Bedarf |
Embedding-Modelle
Für RAG und semantische Suche:
nomic-embed-textmxbai-embed-largesnowflake-arctic-embed
Modellgrösse wählen
| VRAM | Modellgrösse |
|---|---|
| 8 GB | 7B Q4 |
| 12 GB | 13B Q4 |
| 24 GB | 13B Q5/Q6 oder 70B Q4 mit CPU-Offload |
| 48 GB+ | 70B Q4 oder grösser |
Falls ein Modell nicht in den VRAM passt, wird es langsamer oder stürzt ab.
Quantisierung wählen
| Anspruch | Empfehlung |
|---|---|
| Maximale Geschwindigkeit | Q4_0 |
| Gute Balance | Q4_K_M |
| Bessere Qualität | Q5_K_M |
| Höchste Qualität | Q8_0 |
Anfänger-Empfehlung
Wer mit Ollama startet, sollte mit llama3.1:8b oder qwen2.5:7b beginnen. Beide sind schnell, qualitativ gut und laufen auf 8 GB VRAM.
Hardware-Orientierung
- Mini-PC/Notebook: 3B bis 7B Modelle.
- KI-PC mit 16-24 GB VRAM: 7B bis 13B.
- Workstation mit 48 GB+: 70B Modelle möglich.
- CPU-only: 3B bis 7B mit Q4.
Tipps
- Mit der Modell Library auf Ollama.com starten.
- Mehrere Modelle testen.
- Auf Quantisierung achten.
- Für jeden Anwendungsfall ein passendes Modell wählen.
- Benchmarks fahren.
Weiterführende Links und Infos
- BotServ.de Ollama Modell-Benchmarks
- BotServ.de Ollama Kontextlänge
- BotServ.de Ollama Quantisierung Praxis
- BotServ.de Ollama Coding
FAQ: Ollama-Modell-Empfehlungen
Was ist das beste allgemeine Modell? Llama 3.1 8B oder Qwen 2.5 7B sind gute Allrounder.
Welches Modell für Coding? Qwen 2.5 Coder oder DeepSeek Coder.
Kann ich Bilder mit Ollama analysieren? Ja, mit Vision-Modellen wie Llava.
Brauche ich 70B Modelle? Nur, wenn höchste Qualität und genug VRAM vorhanden sind.
Welches Modell für RAG? Ein solides 7B-Chat-Modell reicht meist.
Quellen und weiterführende Literatur
- Ollama Library: https://ollama.com/library
- Hugging Face: https://huggingface.co/
- LMSYS Chatbot Arena: https://chat.lmsys.org/
Zusammenfassung: Ollama-Modell-Empfehlungen nach Anwendungsfall
Die Modellauswahl in Ollama hängt vom Anwendungsfall, der Hardware und der gewünschten Quantisierung ab. Llama 3.1 und Qwen 2.5 sind gute Allrounder, Qwen Coder und DeepSeek Coder eignen sich für Programmierung, Llava für Vision. Für RAG und einfache Aufgaben reichen 7B-Modelle. Wer auf Quantisierung und VRAM achtet, findet schnell ein Modell, das flüssig läuft und gute Ergebnisse liefert.


