Textmodelle im Vergleich
Was dieser Artikel über Textmodelle behandelt
- Die wichtigsten lokalen Textmodelle im Vergleich.
- Stärken und Schwächen von Llama, Mistral, Qwen, Gemma und DeepSeek.
- Welches Modell für welchen Anwendungsfall.
- Hardware-Anforderungen und Geschwindigkeit.
- Wie Du das richtige Modell für Deine Bedürfnisse wählst.
Einleitung: Textmodelle verständlich erklärt
Textmodelle sind die Workhorses der lokalen KI. Sie schreiben Texte, beantworten Fragen, fassen zusammen, übersetzen. Aber nicht alle Modelle sind gleich: Einige sind besser für Deutsch, andere für Code, wieder andere für Reasoning. Dieser Vergleich hilft Dir, das richtige Modell zu wählen.
Warum brauche ich einen Textmodell-Vergleich?
Es gibt Dutzende Textmodelle. Ohne Vergleich wählst Du vielleicht ein Modell, das für Deine Aufgabe ungeeignet ist, zu langsam, zu schlecht in Deutsch oder zu groß für Deine Hardware. Dieser Artikel zeigt, welches Modell für welchen Zweck passt.
Textmodelle im Vergleich kurz erklärt
Die Top-Modelle für lokale Nutzung: Llama 3.1/3.2 (Meta), Mistral (französisch), Qwen 2.5 (Alibaba), Gemma 2 (Google), DeepSeek. Alle laufen lokal via Ollama. Unterschiede: Sprachqualität, Geschwindigkeit, Tool-Calling, Kontextlänge, Lizenz.
Der Kerngedanke lautet: Nicht das beste Modell, sondern das beste für Deine Aufgabe.
Für wen ist dieser Artikel gedacht?
- Einsteiger, die ein erstes Modell wählen.
- Fortgeschrittene, die für spezifische Aufgaben optimieren.
- Entwickler, die Tool-Calling brauchen.
- Mehrsprachige Nutzer, die Deutsch brauchen.
Wichtige Begriffe
- Ollama - Modellserver. Wann nützlich: zum Ausführen.
- Quantisierung - Modell-Kompression. Wann nützlich: für weniger VRAM.
- Context Length - Maximale Textlänge. Wann nützlich: für lange Dokumente.
- Function Calling - Tool-Use. Wann nützlich: für Agenten.
- Instruct - Instruction-tuned. Wann nützlich: für Chat/Assistent.
- Base - Untuned. Wann nützlich: für Fine-Tuning.
Die großen Fünf im Vergleich
| Modell | Entwickler | Größen | Stärke | Schwäche | Best für |
|---|---|---|---|---|---|
| Llama 3.1/3.2 | Meta | 1B-405B | Allround, Tool-Calling | Deutsch okay, nicht top | General Purpose, Agenten |
| Mistral | Mistral AI | 7B-123B | Effizienz, Deutsch gut | Weniger Tools | Chat, effiziente Nutzung |
| Qwen 2.5 | Alibaba | 0.5B-72B | Mehrsprachig, Tool-Calling | Weniger bekannt | Mehrsprachigkeit, Code |
| Gemma 2 | 2B-27B | Effizient, sicher | Kleinere Auswahl | Einfache Tasks, Edge | |
| DeepSeek | DeepSeek | 1.5B-236B | Reasoning, Code | Komplexes Lizenz | Mathe, Programmierung |
Detaillierter Vergleich
1. Llama 3.1 / 3.2 (Meta)
Stärken:
- Bestes Allround-Modell für lokale Nutzung
- Sehr gutes Tool-Calling (wichtig für Agenten)
- Große Community, viele Fine-Tunes
- Llama 3.2: Kompakte Modelle (1B, 3B) für Edge
Schwächen:
- Deutsch ist gut, aber nicht herausragend
- Größere Modelle brauchen viel VRAM
Empfehlung: llama3.1:8b für die meisten Anwendungen.
2. Mistral (Mistral AI)
Stärken:
- Sehr effizient (schnell bei wenig VRAM)
- Gute Deutsch-Qualität
- Mistral Nemo: Starkes 12B-Modell
Schwächen:
- Tool-Calling weniger ausgereift als Llama
- Weniger Modelle zur Auswahl
Empfehlung: mistral-nemo für Chat und deutsche Texte.
3. Qwen 2.5 (Alibaba)
Stärken:
- Exzellente Mehrsprachigkeit (inkl. Deutsch)
- Sehr gutes Tool-Calling
- Qwen 2.5-Coder: Top für Programmierung
Schwächen:
- Weniger bekannt, kleinere Community
- Alibaba-Modell (Datenschutz-Bedenken möglich)
Empfehlung: qwen2.5:14b für mehrsprachige Anwendungen.
4. Gemma 2 (Google)
Stärken:
- Sehr effizient (klein, schnell)
- Gute Sicherheit (weniger Jailbreaks)
- 2B-Modell für Edge/IoT
Schwächen:
- Kleinere Modelle = weniger Fähigkeiten
- Weniger Fine-Tunes
Empfehlung: gemma2:2b für einfache Tasks, gemma2:9b für mehr.
5. DeepSeek (DeepSeek)
Stärken:
- Exzellent für Reasoning und Mathe
- DeepSeek-Coder: Top für Programmierung
- DeepSeek-R1: Reasoning wie o1
Schwächen:
- Komplexes Lizenzmodell
- Chinesisches Modell (Datenschutz beachten)
Empfehlung: deepseek-r1 für Reasoning, deepseek-coder für Code.
Größen-Vergleich
| Größe | VRAM (Q4) | Geschwindigkeit | Qualität | Für wen |
|---|---|---|---|---|
| 1-3B | 2-3 GB | Sehr schnell | Einfach | Edge, IoT, schnelle Tests |
| 7-9B | 5-6 GB | Schnell | Gut | Standard-Nutzung |
| 12-14B | 8-10 GB | Mittel | Sehr gut | Qualitäts-Anwendungen |
| 30-70B | 20-40 GB | Langsam | Exzellent | Professionelle Nutzung |
| 100B+ | 60+ GB | Sehr langsam | Maximum | Nur für Server |
Deutsch-Qualität
| Modell | Deutsch | Anmerkung |
|---|---|---|
| Mistral | ⭐⭐⭐⭐ | Sehr gut, europäisch |
| Qwen 2.5 | ⭐⭐⭐⭐ | Sehr gut, mehrsprachig |
| Llama 3.1 | ⭐⭐⭐ | Gut, aber nicht top |
| Gemma 2 | ⭐⭐⭐ | Okay |
| DeepSeek | ⭐⭐ | Eher englisch/chinesisch |
Tool-Calling-Fähigkeit
| Modell | Tool-Calling | Anmerkung |
|---|---|---|
| Llama 3.1 | ⭐⭐⭐⭐⭐ | Bestes Tool-Calling |
| Qwen 2.5 | ⭐⭐⭐⭐ | Sehr gut |
| Mistral | ⭐⭐⭐ | Gut |
| Gemma 2 | ⭐⭐ | Begrenzt |
| DeepSeek | ⭐⭐⭐ | Gut für Reasoning |
Welches Modell für welchen Zweck?
| Zweck | Empfehlung | Alternative |
|---|---|---|
| Allround-Chat | llama3.1:8b | mistral-nemo |
| Deutsch | mistral-nemo | qwen2.5:14b |
| Agenten/Tools | llama3.1:8b | qwen2.5:14b |
| Mehrsprachig | qwen2.5:14b | mistral-nemo |
| Reasoning | deepseek-r1 | qwen2.5:32b |
| Edge/IoT | gemma2:2b | llama3.2:1b |
| Code | deepseek-coder | qwen2.5-coder |
Sicherheitshinweise
- Lizenz prüfen: Nicht alle Modelle sind für kommerzielle Nutzung frei.
- Datenschutz: Lokale Modelle = keine Daten raus. Bei Cloud-Modellen prüfen.
- Jailbreaks: Größere Modelle können leichter jailbreaked werden. Siehe Prompt Injection.
- Bias: Alle Modelle haben Bias. Für kritische Anwendungen testen.
Typische Stolpersteine
- Zu großes Modell: 70B auf 8GB VRAM = OOM. Quantisiere oder wähle kleiner.
- Falsche Quantisierung: Q4 ist gut, Q2 verliert viel Qualität. Siehe Quantisierung.
- Base statt Instruct: Base-Modelle folgen nicht Anweisungen. Immer Instruct für Chat.
- Kein Tool-Calling: Nicht jedes Modell kann Tools aufrufen. Für Agenten: llama3.1 oder qwen2.5.
Weiterführende Links
- Ollama - Modelle lokal ausführen.
- Modell-Galerie - Alle Ollama-Modelle.
- Modell-Empfehlungen - Empfehlungen.
- Quantisierung - Modell-Kompression.
- VRAM-Rechner - Speicherbedarf berechnen.
- Coding-Modelle - Speziell für Code.
- Reasoning-Modelle - Für komplexes Denken.
Key Takeaways:
- llama3.1:8b = bester Allrounder für lokale KI.
- mistral-nemo = bestes Deutsch-Modell.
- qwen2.5:14b = bestes Mehrsprachig + Tool-Calling.
- deepseek-r1 = bestes Reasoning.
- gemma2:2b = bestes Edge-Modell.
- Für Agenten: immer Tool-Calling-fähige Modelle wählen.
FAQ
Welches Textmodell soll ich wählen?
Welches Modell ist am besten für Deutsch?
Wie viel VRAM brauche ich?
Welches Modell kann Tools aufrufen?
Instruct oder Base?
Welche Kontextlänge?
Welche Quantisierung?
Kann ich mehrere Modelle parallel nutzen?
Quellen und weiterführende Literatur
- Llama - Meta-Modelle.
- Mistral - Mistral-Modelle.
- Qwen - Alibaba-Modelle.
- Gemma - Google-Modelle.
- Ollama Library - Verfügbare Modelle.


