Reasoning-Modelle im Vergleich
Was dieser Artikel über Reasoning-Modelle behandelt
- Was Reasoning-Modelle sind und wie sie funktionieren.
- DeepSeek-R1, QwQ und andere Reasoning-Modelle im Vergleich.
- Wann sich Reasoning lohnt und wann nicht.
- Hardware-Anforderungen und Geschwindigkeit.
- Praxisbeispiele für Mathe, Logik und komplexe Probleme.
Einleitung: Reasoning-Modelle verständlich erklärt
Normale Modelle antworten direkt. Reasoning-Modelle denken erst nach: Sie zeigen ihre Gedanken (Chain-of-Thought), prüfen Annahmen, korrigieren sich selbst und kommen dann zur Antwort. Das macht sie langsamer, aber deutlich besser für Mathe, Logik und komplexe Probleme.
Dieser Artikel richtet sich an Anwender, die Reasoning-Modelle verstehen und nutzen wollen. Grundlagen findest Du in Textmodelle und Ollama.
Warum brauche ich Reasoning-Modelle?
Stell Dir vor, Du fragst: „Wenn ich 3 Äpfel habe, 2 esse und 5 dazukaufe, wie viele habe ich?” Ein normales Modell antwortet vielleicht falsch. Ein Reasoning-Modell denkt: „3 - 2 = 1, 1 + 5 = 6. Antwort: 6.” Es zeigt den Denkprozess und kommt zuverlässiger zur richtigen Antwort.
Reasoning-Modelle im Vergleich kurz erklärt
Reasoning-Modelle nutzen Chain-of-Thought: Sie denken Schritt für Schritt, zeigen ihre Gedanken und kommen dann zur Antwort. DeepSeek-R1 ist das bekannteste lokale Reasoning-Modell. QwQ (Alibaba) ist ein weiteres. Beide laufen via Ollama.
Der Kerngedanke lautet: Denken vor Antworten.
Für wen ist dieser Artikel gedacht?
- Entwickler, die komplexe Probleme lösen.
- Analysten, die Daten und Logik brauchen.
- Forscher, die Reasoning verstehen wollen.
- Power-User, die maximale Qualität brauchen.
Vorkenntnisse in LLMs sind hilfreich.
Wichtige Begriffe
- Reasoning - Nachdenken vor Antworten. Wann nützlich: für komplexe Probleme.
- Chain-of-Thought - Gedanken zeigen. Wann nützlich: für Transparenz.
- Self-Correction - Sich selbst korrigieren. Wann nützlich: für Genauigkeit.
- DeepSeek-R1 - Lokales Reasoning-Modell. Wann nützlich: das bekannteste.
- QwQ - Alibabas Reasoning-Modell. Wann nützlich: Alternative.
- Ollama - Modellserver. Wann nützlich: zum Ausführen.
Wie Reasoning funktioniert
Normales Modell:
Frage → Antwort
Reasoning-Modell:
Frage → Denkprozess → Antwort
Beispiel:
Frage: "Ein Zug fährt 120 km/h, wie lange für 300 km?"
Denkprozess:
- Geschwindigkeit = 120 km/h
- Strecke = 300 km
- Zeit = Strecke / Geschwindigkeit
- Zeit = 300 / 120 = 2,5 Stunden
- Antwort: 2,5 Stunden
Antwort: 2,5 Stunden
Die Modelle im Vergleich
| Modell | Entwickler | Größen | Reasoning | Geschwindigkeit | Best für |
|---|---|---|---|---|---|
| DeepSeek-R1 | DeepSeek | 1.5B-70B | Exzellent | Langsam | Mathe, Logik, Code |
| QwQ-32B | Alibaba | 32B | Sehr gut | Mittel | Reasoning + Agenten |
| DeepSeek-R1-Distill | DeepSeek | 1.5B-70B | Gut | Schneller | Kompakte Reasoning |
| Marco-o1 | Alibaba | 7B | Gut | Mittel | Einfachere Reasoning |
| Sky-T1 | NovaSky | 32B | Gut | Mittel | Open Reasoning |
Detaillierter Vergleich
1. DeepSeek-R1
Stärken:
- Bestes lokales Reasoning-Modell
- Zeigt vollständigen Denkprozess
- Selbstkorrektur während des Denkens
- Stark für Mathe, Logik, komplexe Probleme
- Distill-Versionen für weniger VRAM
Schwächen:
- Langsam (Denken braucht Zeit)
- Overkill für einfache Fragen
- Große Modelle brauchen viel VRAM
Empfehlung: deepseek-r1:14b für gute Balance, deepseek-r1:7b für schneller.
2. QwQ-32B (Alibaba)
Stärken:
- Sehr gutes Reasoning
- Tool-Calling-fähig (für Agenten)
- 32B: Gute Balance aus Qualität und Größe
- Schneller als DeepSeek-R1 bei ähnlicher Qualität
Schwächen:
- Nur 32B verfügbar
- Alibaba-Modell (Datenschutz prüfen)
Empfehlung: qwq:32b für Reasoning + Agenten.
3. DeepSeek-R1-Distill
Stärken:
- Kompakte Versionen (1.5B-70B)
- Schneller als Original
- Gutes Reasoning für die Größe
- Llama/Qwen-basiert (vertraute Architektur)
Schwächen:
- Nicht so gut wie Original R1
- Kleine Versionen (1.5B) limitiert
Empfehlung: deepseek-r1:7b für schnelle Reasoning, deepseek-r1:14b für Qualität.
Wann Reasoning, wann nicht?
| Aufgabe | Reasoning nötig? | Empfehlung |
|---|---|---|
| Mathe-Aufgaben | Ja | deepseek-r1 |
| Logik-Puzzles | Ja | deepseek-r1 |
| Code-Debugging | Ja | deepseek-r1 |
| Architektur-Entscheidungen | Ja | deepseek-r1 |
| Einfache Fragen | Nein | llama3.1 |
| Chat/Assistent | Nein | mistral-nemo |
| Texte schreiben | Nein | llama3.1 |
| Schnelle Antworten | Nein | kleine Modelle |
Geschwindigkeits-Vergleich
| Modell | Denkzeit | Antwortzeit | Gesamt |
|---|---|---|---|
| deepseek-r1:7b | 5-15s | 2-5s | 7-20s |
| deepseek-r1:14b | 10-30s | 5-10s | 15-40s |
| qwq:32b | 15-40s | 5-15s | 20-55s |
| llama3.1:8b | - | 2-5s | 2-5s |
Reasoning-Modelle sind 3-10x langsamer als normale Modelle.
Praxisbeispiel: Mathe-Problem
# Ollama API mit DeepSeek-R1
import requests
response = requests.post("http://ollama:11434/api/chat", json={
"model": "deepseek-r1:14b",
"messages": [
{"role": "user", "content": "Ein Unternehmen hat 150 Mitarbeiter. 60% arbeiten remote. Von den Remote-Mitarbeitern nutzen 40% Linux, 35% Windows, 25% Mac. Wie viele nutzen Mac?"}
],
"stream": False
})
# Antwort enthält Denkprozess + Antwort
print(response.json()["message"]["content"])
# Output:
# <think>
# 150 * 0.6 = 90 remote
# 90 * 0.25 = 22.5
# ≈ 23 Mitarbeiter nutzen Mac
# </think>
# Antwort: ca. 23 Mitarbeiter
Praxisbeispiel: Code-Debugging
# DeepSeek-R1 für Debugging
response = requests.post("http://ollama:11434/api/chat", json={
"model": "deepseek-r1:14b",
"messages": [
{"role": "user", "content": """Debugge diesen Code:
def fibonacci(n):
if n <= 1:
return n
return fibonacci(n-1) + fibonacci(n-2)
print(fibonacci(50))
Der Code ist sehr langsam. Warum und wie fixen?"""}
],
"stream": False
})
Das Modell denkt über den exponentiellen Zeitaufwand nach und schlägt Memoization vor.
Sicherheitshinweise
- Denkprozess zeigen: Der Denkprozess kann sensible Überlegungen enthalten. Prüfe, ob Du ihn zeigen willst.
- Langsam = nicht immer besser: Für einfache Fragen ist Reasoning Overkill.
- Kosten: Längere Denkzeit = mehr Strom. Für Produktion Kosten-Nutzen abwägen.
- Halluzinationen: Auch Reasoning-Modelle können falsch liegen. Validierung wichtig.
Typische Stolpersteine
- Für einfache Fragen nutzen: Reasoning ist Overkill für „Wie heißt du?”. Nutze es für komplexe Probleme.
- Zu ungeduldig: Reasoning braucht Zeit. Warte auf den Denkprozess.
- Denkprozess ignorieren: Der Denkprozess ist der Mehrwert. Lies ihn, nicht nur die Antwort.
- Zu großes Modell: 70B Reasoning auf 8GB = OOM. Nutze Distill-Versionen.
- Kein Fallback: Wenn Reasoning zu lange dauert, Fallback auf normales Modell.
Weiterführende Links
- Textmodelle - Allgemeine Modelle.
- Coding-Modelle - Für Programmierung.
- Ollama - Modellserver.
- KI-Agenten - Agenten mit Reasoning.
- Chain-of-Thought - Prompting-Technik.
- VRAM-Rechner - Speicherbedarf.
Key Takeaways:
- Reasoning-Modelle denken vor Antworten (Chain-of-Thought).
- deepseek-r1 = bestes lokales Reasoning-Modell.
- QwQ = gut für Reasoning + Agenten.
- Reasoning = langsamer, aber besser für Mathe, Logik, komplexe Probleme.
- Für einfache Fragen: normale Modelle sind schneller und ausreichend.
FAQ
Was ist ein Reasoning-Modell?
Welches Reasoning-Modell lokal?
Wann sollte ich Reasoning nutzen?
Warum sind Reasoning-Modelle langsamer?
Wie viel VRAM brauche ich?
Was ist der Denkprozess?
Reasoning oder normales Modell?
Kann ich Reasoning-Modelle für Agenten nutzen?
Quellen und weiterführende Literatur
- DeepSeek-R1 - Reasoning-Modell.
- QwQ - Alibaba Reasoning.
- Chain-of-Thought - Paper.
- Ollama - Modellserver.


