Skip to content
BotServBotServ
Reasoning-ModelleDeepSeek-R1QwQo1Chain-of-ThoughtVergleich

Reasoning-Modelle im Vergleich

Reasoning-Modelle für lokale KI im Vergleich. DeepSeek-R1, QwQ, o1-ähnliche Modelle: Denken vor Antworten.

S

schutzgeist

4 min read
Reasoning-Modelle im Vergleich

Reasoning-Modelle im Vergleich

Was dieser Artikel über Reasoning-Modelle behandelt

  • Was Reasoning-Modelle sind und wie sie funktionieren.
  • DeepSeek-R1, QwQ und andere Reasoning-Modelle im Vergleich.
  • Wann sich Reasoning lohnt und wann nicht.
  • Hardware-Anforderungen und Geschwindigkeit.
  • Praxisbeispiele für Mathe, Logik und komplexe Probleme.

Einleitung: Reasoning-Modelle verständlich erklärt

Normale Modelle antworten direkt. Reasoning-Modelle denken erst nach: Sie zeigen ihre Gedanken (Chain-of-Thought), prüfen Annahmen, korrigieren sich selbst und kommen dann zur Antwort. Das macht sie langsamer, aber deutlich besser für Mathe, Logik und komplexe Probleme.

Dieser Artikel richtet sich an Anwender, die Reasoning-Modelle verstehen und nutzen wollen. Grundlagen findest Du in Textmodelle und Ollama.

Warum brauche ich Reasoning-Modelle?

Stell Dir vor, Du fragst: „Wenn ich 3 Äpfel habe, 2 esse und 5 dazukaufe, wie viele habe ich?” Ein normales Modell antwortet vielleicht falsch. Ein Reasoning-Modell denkt: „3 - 2 = 1, 1 + 5 = 6. Antwort: 6.” Es zeigt den Denkprozess und kommt zuverlässiger zur richtigen Antwort.

Reasoning-Modelle im Vergleich kurz erklärt

Reasoning-Modelle nutzen Chain-of-Thought: Sie denken Schritt für Schritt, zeigen ihre Gedanken und kommen dann zur Antwort. DeepSeek-R1 ist das bekannteste lokale Reasoning-Modell. QwQ (Alibaba) ist ein weiteres. Beide laufen via Ollama.

Der Kerngedanke lautet: Denken vor Antworten.

Für wen ist dieser Artikel gedacht?

  • Entwickler, die komplexe Probleme lösen.
  • Analysten, die Daten und Logik brauchen.
  • Forscher, die Reasoning verstehen wollen.
  • Power-User, die maximale Qualität brauchen.

Vorkenntnisse in LLMs sind hilfreich.

Wichtige Begriffe

  • Reasoning - Nachdenken vor Antworten. Wann nützlich: für komplexe Probleme.
  • Chain-of-Thought - Gedanken zeigen. Wann nützlich: für Transparenz.
  • Self-Correction - Sich selbst korrigieren. Wann nützlich: für Genauigkeit.
  • DeepSeek-R1 - Lokales Reasoning-Modell. Wann nützlich: das bekannteste.
  • QwQ - Alibabas Reasoning-Modell. Wann nützlich: Alternative.
  • Ollama - Modellserver. Wann nützlich: zum Ausführen.

Wie Reasoning funktioniert

Normales Modell:
Frage → Antwort

Reasoning-Modell:
Frage → Denkprozess → Antwort

Beispiel:
Frage: "Ein Zug fährt 120 km/h, wie lange für 300 km?"

Denkprozess:
- Geschwindigkeit = 120 km/h
- Strecke = 300 km
- Zeit = Strecke / Geschwindigkeit
- Zeit = 300 / 120 = 2,5 Stunden
- Antwort: 2,5 Stunden

Antwort: 2,5 Stunden

Die Modelle im Vergleich

ModellEntwicklerGrößenReasoningGeschwindigkeitBest für
DeepSeek-R1DeepSeek1.5B-70BExzellentLangsamMathe, Logik, Code
QwQ-32BAlibaba32BSehr gutMittelReasoning + Agenten
DeepSeek-R1-DistillDeepSeek1.5B-70BGutSchnellerKompakte Reasoning
Marco-o1Alibaba7BGutMittelEinfachere Reasoning
Sky-T1NovaSky32BGutMittelOpen Reasoning

Detaillierter Vergleich

1. DeepSeek-R1

Stärken:

  • Bestes lokales Reasoning-Modell
  • Zeigt vollständigen Denkprozess
  • Selbstkorrektur während des Denkens
  • Stark für Mathe, Logik, komplexe Probleme
  • Distill-Versionen für weniger VRAM

Schwächen:

  • Langsam (Denken braucht Zeit)
  • Overkill für einfache Fragen
  • Große Modelle brauchen viel VRAM

Empfehlung: deepseek-r1:14b für gute Balance, deepseek-r1:7b für schneller.

2. QwQ-32B (Alibaba)

Stärken:

  • Sehr gutes Reasoning
  • Tool-Calling-fähig (für Agenten)
  • 32B: Gute Balance aus Qualität und Größe
  • Schneller als DeepSeek-R1 bei ähnlicher Qualität

Schwächen:

  • Nur 32B verfügbar
  • Alibaba-Modell (Datenschutz prüfen)

Empfehlung: qwq:32b für Reasoning + Agenten.

3. DeepSeek-R1-Distill

Stärken:

  • Kompakte Versionen (1.5B-70B)
  • Schneller als Original
  • Gutes Reasoning für die Größe
  • Llama/Qwen-basiert (vertraute Architektur)

Schwächen:

  • Nicht so gut wie Original R1
  • Kleine Versionen (1.5B) limitiert

Empfehlung: deepseek-r1:7b für schnelle Reasoning, deepseek-r1:14b für Qualität.

Wann Reasoning, wann nicht?

AufgabeReasoning nötig?Empfehlung
Mathe-AufgabenJadeepseek-r1
Logik-PuzzlesJadeepseek-r1
Code-DebuggingJadeepseek-r1
Architektur-EntscheidungenJadeepseek-r1
Einfache FragenNeinllama3.1
Chat/AssistentNeinmistral-nemo
Texte schreibenNeinllama3.1
Schnelle AntwortenNeinkleine Modelle

Geschwindigkeits-Vergleich

ModellDenkzeitAntwortzeitGesamt
deepseek-r1:7b5-15s2-5s7-20s
deepseek-r1:14b10-30s5-10s15-40s
qwq:32b15-40s5-15s20-55s
llama3.1:8b-2-5s2-5s

Reasoning-Modelle sind 3-10x langsamer als normale Modelle.

Praxisbeispiel: Mathe-Problem

# Ollama API mit DeepSeek-R1
import requests

response = requests.post("http://ollama:11434/api/chat", json={
    "model": "deepseek-r1:14b",
    "messages": [
        {"role": "user", "content": "Ein Unternehmen hat 150 Mitarbeiter. 60% arbeiten remote. Von den Remote-Mitarbeitern nutzen 40% Linux, 35% Windows, 25% Mac. Wie viele nutzen Mac?"}
    ],
    "stream": False
})

# Antwort enthält Denkprozess + Antwort
print(response.json()["message"]["content"])
# Output:
# <think>
# 150 * 0.6 = 90 remote
# 90 * 0.25 = 22.5
# ≈ 23 Mitarbeiter nutzen Mac
# </think>
# Antwort: ca. 23 Mitarbeiter

Praxisbeispiel: Code-Debugging

# DeepSeek-R1 für Debugging
response = requests.post("http://ollama:11434/api/chat", json={
    "model": "deepseek-r1:14b",
    "messages": [
        {"role": "user", "content": """Debugge diesen Code:

def fibonacci(n):
    if n <= 1:
        return n
    return fibonacci(n-1) + fibonacci(n-2)

print(fibonacci(50))

Der Code ist sehr langsam. Warum und wie fixen?"""}
    ],
    "stream": False
})

Das Modell denkt über den exponentiellen Zeitaufwand nach und schlägt Memoization vor.

Sicherheitshinweise

  • Denkprozess zeigen: Der Denkprozess kann sensible Überlegungen enthalten. Prüfe, ob Du ihn zeigen willst.
  • Langsam = nicht immer besser: Für einfache Fragen ist Reasoning Overkill.
  • Kosten: Längere Denkzeit = mehr Strom. Für Produktion Kosten-Nutzen abwägen.
  • Halluzinationen: Auch Reasoning-Modelle können falsch liegen. Validierung wichtig.

Typische Stolpersteine

  • Für einfache Fragen nutzen: Reasoning ist Overkill für „Wie heißt du?”. Nutze es für komplexe Probleme.
  • Zu ungeduldig: Reasoning braucht Zeit. Warte auf den Denkprozess.
  • Denkprozess ignorieren: Der Denkprozess ist der Mehrwert. Lies ihn, nicht nur die Antwort.
  • Zu großes Modell: 70B Reasoning auf 8GB = OOM. Nutze Distill-Versionen.
  • Kein Fallback: Wenn Reasoning zu lange dauert, Fallback auf normales Modell.

Key Takeaways:

  • Reasoning-Modelle denken vor Antworten (Chain-of-Thought).
  • deepseek-r1 = bestes lokales Reasoning-Modell.
  • QwQ = gut für Reasoning + Agenten.
  • Reasoning = langsamer, aber besser für Mathe, Logik, komplexe Probleme.
  • Für einfache Fragen: normale Modelle sind schneller und ausreichend.

FAQ

Was ist ein Reasoning-Modell?

Ein Modell, das vor der Antwort nachdenkt. Es zeigt seinen Denkprozess (Chain-of-Thought), prüft Annahmen und korrigiert sich. Das macht es langsamer, aber genauer für komplexe Probleme.

Welches Reasoning-Modell lokal?

DeepSeek-R1 ist das beste lokale Reasoning-Modell. QwQ-32B ist eine gute Alternative für Reasoning + Agenten. Beide laufen via Ollama.

Wann sollte ich Reasoning nutzen?

Für Mathe, Logik, komplexe Probleme, Code-Debugging und Architektur-Entscheidungen. Für einfache Fragen, Chat und Texte: normale Modelle sind schneller und ausreichend.

Warum sind Reasoning-Modelle langsamer?

Weil sie erst denken (5-40 Sekunden Denkprozess), dann antworten. Der Denkprozess ist der Mehrwert, er macht die Antwort zuverlässiger.

Wie viel VRAM brauche ich?

deepseek-r1:7b Q4: ~5 GB. deepseek-r1:14b Q4: ~10 GB. qwq:32b Q4: ~20 GB. Nutze Distill-Versionen für weniger VRAM.

Was ist der Denkprozess?

Die Schritt-für-Schritt-Überlegungen des Modells vor der Antwort. Er zeigt, wie das Modell zur Lösung kommt. Wichtig für Verständnis und Vertrauen.

Reasoning oder normales Modell?

Reasoning für komplexe Probleme (Mathe, Logik, Debugging). Normales Modell für einfache Fragen, Chat, Texte. Reasoning ist 3-10x langsamer.

Kann ich Reasoning-Modelle für Agenten nutzen?

Ja, QwQ und DeepSeek-R1 unterstützen Tool-Calling. Reasoning-Agenten können komplexe Probleme lösen, sind aber langsamer als normale Agenten.

Quellen und weiterführende Literatur

Zurück zum KI Blog
Share:

Ähnliche Beiträge