DeepSeek Modelle: Reasoning und Coding aus China
Was dieser Artikel behandelt
- Was DeepSeek ist und welche Modelle die Familie umfasst
- Wie DeepSeek-R1 Reasoning auf einem ganz neuen Niveau erreicht
- Welche distillierten Versionen für den lokalen Betrieb geeignet sind
- Wie viel VRAM Du für die verschiedenen DeepSeek-Modelle brauchst
- Wo die Stärken und Schwächen der Modellfamilie liegen
Einleitung
DeepSeek ist ein chinesisches KI-Unternehmen, das in kurzer Zeit einige der bemerkenswertesten Open-Source-Modelle veröffentlicht hat. Die Modellfamilie umfasst drei Hauptlinien: DeepSeek-V3 als Generalist, DeepSeek-R1 als Reasoning-Spezialist und DeepSeek-Coder für Programmieraufgaben. Was diese Modelle besonders macht, ist ihre Architektur als Mixture-of-Experts-Modelle (MoE), die enorme Gesamtparameterzahlen mit effizienter Ausführung kombiniert.
Für den lokalen Betrieb sind besonders die distillierten Versionen von DeepSeek-R1 interessant. Diese basieren auf kleineren Basismodellen wie Qwen oder Llama, wurden aber mit den Reasoning-Fähigkeiten von DeepSeek-R1 trainiert. Dadurch bekommst Du Reasoning-Qualität in Größen, die auf Consumer-Hardware laufen. In diesem Artikel lernst Du, welche DeepSeek-Modelle es gibt, welche für Deinen Anwendungsfall passen und wie Du sie lokal mit Ollama startest.
Wenn Du noch neu beim Thema bist, schau Dir zuerst die Modell-Übersicht und den Artikel Modell finden an.
Warum brauche ich DeepSeek?
Stell Dir vor, Du musst ein komplexes mathematisches Problem lösen oder einen schwierigen Code-Bug finden. Normale Chat-Modelle geben Dir oft eine schnelle Antwort, die aber bei komplexen Aufgaben falsch oder unvollständig sein kann. DeepSeek-R1 geht anders vor: Es denkt laut nach, zerlegt das Problem in Zwischenschritte und prüft seine eigene Lösung, bevor es antwortet. Das nennt man Reasoning oder Chain-of-Thought.
Wenn Du schon einmal Llama-Modelle oder Qwen-Modelle für Programmieraufgaben genutzt hast und festgestellt hast, dass sie bei komplexer Logik an Grenzen stoßen, dann ist DeepSeek genau die nächste Stufe. DeepSeek-Coder wurde speziell auf Programmieraufgaben trainiert und liefert bei vielen Coding-Benchmarks Ergebnisse, die mit kommerziellen Modellen mithalten können.
Für den lokalen Betrieb sind die distillierten R1-Modelle besonders attraktiv. Ein DeepSeek-R1 7B Distill auf Deiner Grafikkarte kann Aufgaben lösen, für die Du sonst ein 70B-Modell bräuchtest. Das spart Dir Hardware-Kosten und liefert trotzdem bessere Ergebnisse bei logischen Aufgaben.
DeepSeek Modelle kurz erklärt
DeepSeek hat mehrere Modelllinien veröffentlicht, die sich in Architektur und Zweck unterscheiden. Hier ist ein Überblick:
DeepSeek-V3 ist das Flaggschiff-Modell mit 671 Milliarden Parametern. Es nutzt eine Mixture-of-Experts-Architektur, bei der bei jedem Token nur 37 Milliarden Parameter aktiv sind. Das macht es effizienter als ein vergleichbar großes Dense-Modell. DeepSeek-V3 ist ein Generalist, der bei Text, Code und Mathematik starke Leistungen zeigt.
DeepSeek-R1 ist das Reasoning-Modell. Es wurde mit Reinforcement Learning trainiert, um komplexe Probleme Schritt für Schritt zu lösen. Das Modell gibt einen ausführlichen Denkprozess aus, bevor es die finale Antwort liefert. R1 basiert auf DeepSeek-V3 und erreicht bei Mathematik- und Coding-Benchmarks Ergebnisse auf dem Niveau von OpenAI o1.
DeepSeek-R1 Distill sind komprimierte Versionen, bei denen die Reasoning-Fähigkeiten von R1 auf kleinere Basismodelle übertragen wurden. Diese gibt es in Größen von 1,5B bis 70B, basierend auf Qwen und Llama Architekturen. Sie sind die wichtigsten Modelle für den lokalen Betrieb.
DeepSeek-Coder ist eine ältere Modelllinie, die speziell auf Programmieraufgaben trainiert wurde. Sie gibt es in Größen von 1,3B bis 33B. Für neue Projekte sind die R1-Distills meist die bessere Wahl, aber DeepSeek-Coder bleibt relevant für reine Coding-Aufgaben.
Für wen ist dieser Artikel gedacht?
Dieser Artikel richtet sich an Dich, wenn Du:
- ein lokales Modell für mathematische oder logische Aufgaben suchst
- programmierst und ein starkes Coding-Modell lokal betreiben willst
- Dich für Reasoning-Modelle interessierst und Chain-of-Thought ausprobieren möchtest
- wissen willst, welche DeepSeek-Variante auf Deiner Hardware läuft
- bereits Erfahrung mit Ollama hast und das nächste Level ausprobieren willst
Du brauchst keine tiefen Vorkenntnisse. Wenn Du weißt, was ein LLM ist und wie Du Ollama bedienst, reicht das vollkommen.
Wichtige Begriffe
| Begriff | Bedeutung |
|---|---|
| MoE | Mixture-of-Experts, Architektur bei der nur ein Teil der Parameter pro Token aktiv ist |
| Reasoning | Fähigkeit eines Modells, Probleme in Zwischenschritten zu lösen |
| Chain-of-Thought | Schrittweiser Denkprozess, den das Modell vor der Antwort ausgibt |
| Distill | Übertragung von Fähigkeiten eines großen Modells auf ein kleineres |
| Reinforcement Learning | Trainingsmethode, bei der das Modell durch Belohnung lernt |
| Active Parameters | Parameter, die bei einem MoE-Modell pro Token tatsächlich berechnet werden |
| Dense Model | Modell ohne MoE, bei dem alle Parameter bei jedem Token aktiv sind |
| Benchmark | Standardisierter Test zum Vergleich von Modellfähigkeiten |
| Token | Ein Textabschnitt, den das Modell verarbeitet, etwa ein Wort oder Teil eines Wortes |
| Inference | Ausführung eines Modells zur Generierung von Text |
DeepSeek-V3: Das MoE-Flaggschiff
DeepSeek-V3 ist mit 671 Milliarden Parametern eines der größten Open-Source-Modelle, die es gibt. Die Besonderheit ist die MoE-Architektur: Das Modell besteht aus vielen Experten, aber bei jedem Token werden nur 37 Milliarden Parameter aktiviert. Das bedeutet, die Rechenleistung pro Token entspricht einem 37B-Dense-Modell, aber das Modell hat das Wissen eines 671B-Modells.
Für den lokalen Betrieb auf Consumer-Hardware ist DeepSeek-V3 nicht geeignet. Selbst in starker Quantisierung braucht es über 350 GB Speicher. Das ist nur auf Server-Hardware oder Apple Silicon Macs mit 128 GB oder mehr Unified Memory möglich. Für die meisten Nutzer ist DeepSeek-V3 eher ein Modell, das man über API nutzt, nicht lokal.
Trotzdem ist DeepSeek-V3 wichtig zu verstehen, weil DeepSeek-R1 darauf basiert. Die Reasoning-Fähigkeiten von R1 wurden durch Reinforcement Learning auf der V3-Architektur trainiert.
DeepSeek-R1: Reasoning der nächsten Generation
DeepSeek-R1 ist das Modell, das die KI-Welt aufmerksam gemacht hat. Es löst komplexe Probleme nicht mit einer schnellen Antwort, sondern mit einem ausführlichen Denkprozess. Das Modell schreibt seine Gedanken auf, prüft Zwischenergebnisse, korrigiert sich selbst und kommt erst dann zur finalen Antwort.
Ein Beispiel: Wenn Du R1 fragst, wie viele R in “Erdbeere” vorkommen, gibt es nicht einfach eine Zahl zurück. Es zählt Buchstabe für Buchstabe durch, prüft das Ergebnis und begründet seine Antwort. Das klingt umständlich, ist aber genau der Grund, warum R1 bei Mathematik, Logik und Coding so stark ist.
DeepSeek-R1 erreicht bei Benchmarks wie MMLU, HumanEval und mathematischen Aufgaben Ergebnisse, die mit kommerziellen Modellen wie OpenAI o1 konkurrieren. Das Besondere: Das Modell ist Open Source und kann frei genutzt werden.
Das volle R1-Modell hat wie V3 671 Milliarden Parameter und ist für den lokalen Betrieb auf Consumer-Hardware zu groß. Aber hier kommen die distillierten Versionen ins Spiel.
DeepSeek-R1 Distill: Reasoning für Consumer-Hardware
Die distillierten Versionen sind der wichtigste Teil der DeepSeek-Familie für lokale Nutzer. Bei der Distillation wurden die Reasoning-Fähigkeiten von R1 auf kleinere, bereits vorhandene Modelle übertragen. Das Ergebnis sind kompakte Modelle mit erstaunlich guter Reasoning-Qualität.
Folgende Distill-Versionen gibt es:
| Modell | Basis | Parameter | VRAM (Q4_K_M) | Eignung |
|---|---|---|---|---|
| DeepSeek-R1 1.5B | Qwen 2.5 | 1,5B | ca. 1,5 GB | Experimente, sehr einfache Aufgaben |
| DeepSeek-R1 7B | Qwen 2.5 | 7B | ca. 5 GB | Einsteiger, einfache Reasoning-Aufgaben |
| DeepSeek-R1 8B | Llama 3.1 | 8B | ca. 5,5 GB | Einsteiger, gute Allround-Qualität |
| DeepSeek-R1 14B | Qwen 2.5 | 14B | ca. 9 GB | Mittelklasse, solide Reasoning |
| DeepSeek-R1 32B | Qwen 2.5 | 32B | ca. 20 GB | Fortgeschrittene, starke Reasoning |
| DeepSeek-R1 70B | Llama 3.3 | 70B | ca. 40 GB | High-End, nahe an R1-Qualität |
Die 7B und 8B Versionen laufen auf Grafikkarten mit 8 GB VRAM und sind der beste Einstieg. Die 14B-Version ist ein guter Kompromiss aus Leistung und Hardware-Bedarf. Die 32B-Version braucht eine RTX 4090 oder einen Mac mit 32 GB Unified Memory. Die 70B-Version erreicht bereits eine Qualität, die dem vollen R1 erstaunlich nahe kommt, braucht aber entsprechende Hardware.
Mehr zu den Speicheranforderungen findest Du im Artikel RAM und VRAM Anforderungen und im Artikel Modellgroesse und Speicherbedarf.
DeepSeek-Coder: Programmierung lokal
DeepSeek-Coder ist eine eigenständige Modelllinie, die speziell auf Programmieraufgaben trainiert wurde. Die Modelle gibt es in Größen von 1,3B bis 33B und sie unterstützen zahlreiche Programmiersprachen.
Für den lokalen Betrieb sind besonders die 6,7B und 33B Versionen interessant. Die 6,7B-Version läuft auf einer 8-GB-Grafikkarte und ist ein solides Coding-Modell für alltägliche Aufgaben. Die 33B-Version braucht etwa 20 GB VRAM in Q4_K_M und liefert deutlich bessere Ergebnisse bei komplexen Programmieraufgaben.
Wenn Du jedoch bereits die R1-Distills nutzt, decken diese viele Coding-Aufgaben ab. DeepSeek-Coder bleibt relevant, wenn Du ein reines Coding-Modell ohne den langen Reasoning-Output von R1 bevorzugst. R1 denkt lange nach, was bei schnellen Code-Fragen unnötig sein kann. DeepSeek-Coder gibt direktere Antworten.
DeepSeek lokal mit Ollama starten
Der einfachste Weg, DeepSeek-Modelle lokal auszuführen, geht über Ollama. Hier sind die wichtigsten Befehle:
# DeepSeek-R1 7B Distill starten
ollama run deepseek-r1:7b
# DeepSeek-R1 8B Distill (Llama Basis) starten
ollama run deepseek-r1:8b
# DeepSeek-R1 14B Distill starten
ollama run deepseek-r1:14b
# DeepSeek-R1 32B Distill starten
ollama run deepseek-r1:32b
# DeepSeek-Coder 6.7B starten
ollama run deepseek-coder:6.7b
Ollama lädt automatisch die Q4_K_M-Variante herunter, was für die meisten Nutzer der beste Kompromiss aus Qualität und Speicherbedarf ist. Mehr zu Quantisierung findest Du im Artikel Quantisierung.
Eine Besonderheit bei R1-Modellen: Der Output enthält einen Thinking-Block, der mit <think> beginnt und mit </think> endet. Darin schreibt das Modell seinen Denkprozess auf. Danach kommt die eigentliche Antwort. In Ollama siehst Du beide Teile im Terminal. Manche Oberflächen wie Open WebUI blenden den Thinking-Block separat ein.
Typische Stolpersteine
1. Thinking-Output als Antwort missverstanden: DeepSeek-R1 gibt einen langen Denkprozess aus, bevor die Antwort kommt. Wenn Du den Thinking-Block für die Antwort hältst, wirkst Du verwirrt. Die eigentliche Antwort steht nach dem schließenden Tag des Thinking-Blocks.
2. Zu großes Modell für die Hardware gewählt: Das volle DeepSeek-R1 mit 671B läuft nicht auf Consumer-Hardware. Wähle stattdessen eine Distill-Version, die zu Deinem VRAM passt. Eine RTX 3060 mit 12 GB schafft die 7B-Version problemlos.
3. Reasoning für einfache Aufgaben genutzt: R1 denkt bei jeder Frage nach, auch bei einfachen. Wenn Du nur einen kurzen Text zusammenfassen willst, ist ein Standard-Modell wie Llama 3 schneller und effizienter. Nutze R1 für komplexe Aufgaben, nicht für alles.
4. DeepSeek-Coder mit R1 verwechselt: DeepSeek-Coder ist eine eigenständige, ältere Modelllinie. R1-Distills sind neuer und bei den meisten Aufgaben besser. Prüfe, welches Modell Du eigentlich brauchst.
5. Kontextlänge beim Thinking unterschätzt: Der Denkprozess von R1 kann sehr lang werden und damit viel Kontext verbrauchen. Plane genug VRAM für den KV-Cache ein, besonders bei komplexen Aufgaben. Mehr dazu im Artikel Kontextlaenge.
6. Deutsche Antworten schwächer als englische: DeepSeek-Modelle wurden primär auf Englisch und Chinesisch trainiert. Deutsche Antworten sind gut, aber nicht so stark wie bei Modellen wie Qwen, die mehrsprachig optimiert sind. Für reine Deutsch-Anwendungen teste Qwen als Alternative.
7. MoE-Architektur missverstanden: Bei DeepSeek-V3 und R1 sind 671B Parameter vorhanden, aber nur 37B aktiv pro Token. Das bedeutet nicht, dass das Modell so schnell läuft wie ein 37B-Dense-Modell. Alle Parameter müssen im Speicher liegen, auch die inaktiven.
Hardware, Kosten und Sicherheit
Hardware: Die distillierten R1-Modelle sind erstaunlich genügsam. Die 7B-Version läuft auf einer Grafikkarte mit 8 GB VRAM, die 14B-Version braucht etwa 12 GB. Für die 32B-Version empfiehlt sich eine RTX 4090 mit 24 GB oder ein Mac mit 32 GB Unified Memory. Die 70B-Version braucht 48 GB oder mehr. Das volle R1 mit 671B ist nur auf Server-Hardware oder Macs mit 128 GB Unified Memory lauffähig.
Kosten: Alle DeepSeek-Modelle sind Open Source und kostenlos. Die API-Nutzung des vollen Modells ist vergleichsweise günstig. Für den lokalen Betrieb fallen nur die Hardwarekosten an. Eine RTX 3060 mit 12 GB für unter 300 EUR reicht für die 7B- und 14B-Distills.
Sicherheit: Wie bei allen lokalen Modellen bleiben Deine Daten auf Deinem Rechner. Das ist besonders bei DeepSeek relevant, weil viele Nutzer bei chinesischen Modellen Bedenken haben. Bei lokaler Ausführung werden keine Daten an DeepSeek gesendet. Prüfe dennoch, ob Deine Software (Ollama, LM Studio) Telemetrie-Funktionen hat und schalte sie bei Bedarf ab.
Weiterführende Links
- Modell-Übersicht - Alle Modell-Artikel im Überblick
- Modell finden - Wie Du das passende Modell findest
- Llama-Modelle - Metas Modellfamilie im Vergleich
- Qwen-Modelle - Alibabas multilinguale Modelle
- Ollama - Die einfachste Methode für lokale Modelle
- Quantisierung - Wie Modelle kleiner werden
- RAM und VRAM Anforderungen - Wie viel Speicher Du brauchst
- Modellgroesse und Speicherbedarf - Zusammenhang von Größe und Speicher
FAQ
Was ist der Unterschied zwischen DeepSeek-R1 und DeepSeek-V3?
DeepSeek-V3 ist das Basis-Modell, ein Generalist mit 671B Parametern. DeepSeek-R1 basiert auf V3, wurde aber mit Reinforcement Learning auf Reasoning trainiert. R1 denkt Schritt für Schritt, V3 antwortet direkt.
Kann ich DeepSeek-R1 lokal auf meinem PC laufen lassen?
Das volle R1 mit 671B Parametern ist für Consumer-Hardware zu groß. Die distillierten Versionen von 1,5B bis 70B sind aber für den lokalen Betrieb gemacht und laufen mit Ollama auf normalen Grafikkarten.
Welche R1-Distill-Version soll ich wählen?
Mit 8 GB VRAM nimm die 7B-Version. Mit 12 GB VRAM nimm die 14B-Version. Mit 24 GB VRAM nimm die 32B-Version. Die 32B-Version bietet das beste Verhältnis aus Reasoning-Qualität und Hardware-Bedarf.
Was bedeutet der Thinking-Block bei R1?
R1 gibt vor der eigentlichen Antwort einen Denkprozess aus, der von speziellen Tags umschlossen wird. Darin zerlegt das Modell das Problem in Zwischenschritte, prüft Annahmen und korrigiert sich. Die finale Antwort steht danach.
Ist DeepSeek-Coder besser als DeepSeek-R1 fürs Programmieren?
Für schnelle Code-Fragen ist DeepSeek-Coder direkter, weil es keinen langen Denkprozess ausgibt. Für komplexe Programmieraufgaben mit Logik ist R1 meist besser. Wenn Du schnelle Antworten willst, nimm Coder, für schwierige Probleme R1.
Sind DeepSeek-Modelle kostenlos nutzbar?
Ja, alle DeepSeek-Modelle sind Open Source und kostenlos. Die Modellgewichte stehen auf Hugging Face zur Verfügung. Für kommerzielle Nutzung prüfe die jeweilige Lizenz, die meisten erlauben sie.
Wie gut sind DeepSeek-Modelle auf Deutsch?
DeepSeek-Modelle wurden primär auf Englisch und Chinesisch trainiert. Deutsch funktioniert, ist aber nicht so stark wie bei Modellen wie Qwen, die gezielt mehrsprachig optimiert wurden. Für rein deutsche Anwendungen teste Qwen als Alternative.
Was bedeutet Mixture-of-Experts bei DeepSeek?
MoE bedeutet, dass das Modell aus vielen Teilmodellen (Experten) besteht, aber bei jedem Token nur die relevantesten aktiviert. DeepSeek-V3 hat 671B Parameter insgesamt, aber nur 37B sind pro Token aktiv. Das spart Rechenleistung, aber alle Parameter müssen im Speicher liegen.
Kann ich DeepSeek-R1 mit LM Studio nutzen?
Ja, LM Studio unterstützt DeepSeek-Modelle. Du suchst in LM Studio nach “deepseek-r1” und wählst die passende Distill-Version in der gewünschten Quantisierung. LM Studio lädt die GGUF-Datei automatisch herunter.
Brauche ich eine Nvidia-GPU für DeepSeek?
Nein. DeepSeek-Modelle laufen auch auf CPU, Apple Silicon und AMD-GPUs. Ollama unterstützt alle diese Plattformen. Eine Nvidia-GPU ist am schnellsten, aber für die kleinen Distill-Versionen reicht auch ein Mac mit 16 GB Unified Memory.
Wie unterscheiden sich die R1-Distills von den Basismodellen?
Die Distills basieren auf Modellen wie Qwen 2.5 oder Llama 3.1, wurden aber mit den Reasoning-Fähigkeiten von R1 nachtrainiert. Sie verhalten sich wie R1 mit Thinking-Block, haben aber die Architektur und Größe des kleineren Basismodells.
Quellen
- DeepSeek offizielle Website und Modellveröffentlichungen
- DeepSeek-R1 Technical Report auf arXiv
- DeepSeek-V3 Technical Report auf arXiv
- Ollama Modellbibliothek: DeepSeek-Modelle
- Hugging Face: DeepSeek Modellkarten und Gewichte
- DeepSeek-Coder GitHub-Repository


