Ollama Hardware-Anforderungen: Was brauchst Du wirklich?
Was dieser Artikel über Ollama Hardware-Anforderungen behandelt
- Welche VRAM- und RAM-Mengen verschiedene Modellgrößen benötigen, von 3B bis 70B Parametern
- Wann eine GPU sinnvoll ist und wann CPU-only ausreicht
- Empfohlene Setups für verschiedene Budgets, von unter 500 bis über 2000 Euro
- Wie Du mit einfachen Befehlen prüfst, ob Deine Hardware für ein bestimmtes Modell ausreicht
- Typische Stolpersteine, die verhindern, dass ein Modell trotz scheinbar ausreichender Hardware läuft
Einleitung: Ollama Hardware-Anforderungen verständlich erklärt
Ollama macht es einfach, lokale Sprachmodelle auszuführen. Du lädst ein Modell herunter, startest es, und los geht’s. Doch zwischen dem ersten ollama run und einer flüssigen Antwort liegen einige Hardware-Fragen, die über Erfolg oder Frust entscheiden. Ein 7B-Modell auf einem Laptop ohne GPU kann Minuten für eine einzige Antwort brauchen. Ein 70B-Modell auf einer Grafikkarte mit zu wenig VRAM bricht ab oder quält sich im CPU-Fallback.
Dieser Artikel gibt Dir konkrete Zahlen, Empfehlungen und Praxiswerte, damit Du genau die Hardware kaufst oder nutzt, die Du brauchst. Nicht mehr, nicht weniger. Wenn Du Ollama noch nicht installiert hast, findest Du in der Ollama Installation die passenden Schritte.
Warum brauche ich diese Anforderungen?
Stell Dir vor, Du kaufst eine RTX 4060 mit 8 GB VRAM, weil ein Forum empfohlen hat, eine Grafikkarte sei wichtig für lokale KI. Du installierst Ollama, lädst llama3:70b herunter und startest das Modell. Die Antwort kommt nicht. Der VRAM ist voll, Ollama lagert Teile auf den System-RAM aus, und die Token-Produktion sinkt auf 1 bis 2 Token pro Sekunde. Du wartest, brichst ab und fragst Dich, was schiefgelaufen ist.
Das Problem: Niemand hat Dir gesagt, dass ein 70B-Modell bei 4-bit Quantisierung etwa 40 GB Speicher benötigt. Deine 8 GB VRAM reichen für ein 7B-Modell, nicht für 70B. Ohne Kenntnis der Anforderungen kaufst Du blind, und das Modell läuft entweder gar nicht oder quälend langsam. Genau das soll dieser Artikel verhindern.
Ollama Hardware-Anforderungen kurz erklärt
Ollama benötigt drei Dinge: ausreichend Speicher für das Modell, ausreichend Rechenleistung für die Inferenz und genug Festplattenplatz für die Modelldateien. Der wichtigste Faktor ist der Speicher. Ein Modell muss in den VRAM (bei GPU) oder in den System-RAM (bei CPU) passen, damit es mit akzeptabler Geschwindigkeit läuft. Die Faustregel: Ein Modell in 4-bit Quantisierung braucht etwa 0,7 GB Speicher pro Milliarde Parameter. Ein 7B-Modell also rund 5 GB, ein 13B-Modell etwa 9 GB.
GPU-Offloading beschleunigt die Inferenz massiv, ist aber nur möglich, wenn das Modell oder zumindest ein Großteil davon in den VRAM passt. Reste wandern in den System-RAM und werden von der CPU berechnet, was deutlich langsamer ist. Mehr zur theoretischen Seite findest Du unter RAM und VRAM Anforderungen und Quantisierung.
Für wen ist dieser Artikel gedacht?
Dieser Artikel richtet sich an Einsteiger, die Ollama ausprobieren oder ihr Setup erweitern wollen. Du musst kein Informatiker sein, um die Tabellen und Empfehlungen zu verstehen. Wenn Du jedoch tiefer in die Grundlagen einsteigen willst, lohnt sich ein Blick in die KI-Hardware Grundlagen.
Wichtige Begriffe rund um Ollama Hardware
| Begriff | Bedeutung |
|---|---|
| VRAM | Videospeicher auf der Grafikkarte, entscheidend für GPU-Inferenz |
| RAM | Arbeitsspeicher des Systems, genutzt bei CPU-Inferenz oder GPU-Offloading-Resten |
| GPU | Grafikkarte, die die Modellberechnung beschleunigt |
| CPU | Hauptprozessor, berechnet das Modell, wenn keine GPU vorhanden ist oder VRAM nicht reicht |
| SSD | Solid State Drive, deutlich schneller als HDD beim Laden von Modellen |
| NVMe | Sehr schnelle SSD-Schnittstelle, empfohlen für große Modelle |
| Quantisierung | Komprimierung eines Modells auf z.B. 4-bit, reduziert Speicherbedarf erheblich |
| GPU-Offloading | Auslagerung von Modell-Schichten auf die GPU, beschleunigt die Inferenz |
| Unified Memory | Gemeinsamer Speicher bei Apple Silicon, teilt RAM und VRAM auf einem Chip |
| OLLAMA_GPU_LAYERS | Umgebungsvariable, die steuert, wie viele Modell-Schichten auf die GPU geladen werden |
Minimalanforderungen
Damit Ollama überhaupt läuft, brauchst Du nicht viel. Die absoluten Minimalanforderungen:
- CPU: Ein moderner x86-64 Prozessor oder Apple Silicon, mindestens 4 Kerne
- RAM: 8 GB, besser 16 GB, um nicht sofort an die Grenze zu stoßen
- Festplatte: 10 GB freier Speicher für Ollama selbst und ein kleines Modell
- GPU: Nicht zwingend erforderlich, Ollama läuft auch rein auf der CPU
- Betriebssystem: Linux, macOS oder Windows
Mit diesem Minimum kannst Du kleine Modelle wie qwen2.5:3b oder phi3 ausführen. Die Geschwindigkeit ist moderat, aber es funktioniert. Ein 7B-Modell lädt zwar, wird aber auf einem reinen CPU-System mit 8 GB RAM spürbar langsam sein.
Empfohlene Hardware nach Modellgröße
Die folgende Tabelle zeigt, wie viel VRAM und RAM Du für verschiedene Modellgrößen brauchst. Die Werte beziehen sich auf 4-bit Quantisierung, die Ollama standardmäßig verwendet.
| Modellgröße | VRAM (GPU) | RAM (CPU-only) | Empfohlene GPU | Empfohlener RAM |
|---|---|---|---|---|
| 3B | 3 GB | 6 GB | Nicht zwingend | 8 GB |
| 7B | 5 GB | 10 GB | RTX 3060 12 GB | 16 GB |
| 8B | 6 GB | 12 GB | RTX 3060 12 GB | 16 GB |
| 13B | 9 GB | 18 GB | RTX 4060 Ti 16 GB | 32 GB |
| 30B | 20 GB | 36 GB | RTX 4090 24 GB | 64 GB |
| 70B | 40 GB | 72 GB | 2x RTX 4090 | 128 GB |
Diese Werte sind Richtwerte. Tatsächlich hängt der Bedarf von der konkreten Quantisierung und der Architektur ab. Ein Mistral-7B braucht etwas weniger als ein Llama-3-8B, aber die Größenordnung stimmt. Mehr Details zum Dimensionieren findest Du unter Hardware richtig dimensionieren.
Ollama auf CPU: Was ist möglich?
Ollama auf einer CPU zu betreiben ist völlig legitim, besonders für kleinere Modelle und Tests. Die Geschwindigkeit hängt stark vom Prozessor und der Modellgröße ab. Mit einem modernen 6-Kern-CPU und 32 GB RAM erreichst Du folgende Werte:
- 3B-Modell: 15 bis 25 Token pro Sekunde, flüssig nutzbar
- 7B-Modell: 5 bis 10 Token pro Sekunde, akzeptabel für Chat
- 13B-Modell: 2 bis 4 Token pro Sekunde, nur mit Geduld
- 30B und größer: Unter 1 Token pro Sekunde, praktisch nicht nutzbar
Wenn Du nur gelegentlich mit einem 7B-Modell chattest und keine GPU hast, ist CPU-only eine funktionierende Lösung. Für regelmäßige Nutzung oder größere Modelle lohnt sich eine GPU. Mehr zum Vergleich findest Du unter CPU vs. GPU.
Ollama mit GPU: Welche Grafikkarte?
Eine GPU beschleunigt die Inferenz um ein Vielfaches. Die wichtigste Kennzahl ist der VRAM, nicht die reine Rechenleistung. Eine RTX 3060 mit 12 GB VRAM ist für Ollama oft besser als eine RTX 4060 mit 8 GB, weil sie größere Modelle vollständig in den VRAM laden kann.
RTX 3060 12 GB: Einsteiger-Empfehlung. Genug VRAM für 7B und 8B Modelle mit etwas Puffer. Kosten rund 300 Euro gebraucht. Erreicht 40 bis 60 Token pro Sekunde bei einem 7B-Modell.
RTX 4060 Ti 16 GB: Mittelklasse mit großem VRAM. Passt 13B-Modelle vollständig in den VRAM. Kosten rund 450 Euro. Eine gute Wahl, wenn Du mehr als nur kleine Modelle laufen willst.
RTX 4090 24 GB: High-End für ernsthafte Nutzer. Bewältigt 30B-Modelle vollständig und 70B-Modelle mit teilweise CPU-Offloading. Kosten ab 1700 Euro. Erreicht über 100 Token pro Sekunde bei einem 7B-Modell.
Apple Silicon: Siehe den nächsten Abschnitt, da hier Unified Memory die Rechnung verändert.
Weitere Empfehlungen nach Budget findest Du in der Kaufberatung und beim KI-PC Einsteiger.
Ollama auf Apple Silicon
Apple Silicon nutzt Unified Memory, was bedeutet, dass RAM und VRAM physisch derselbe Speicher sind. Ein Mac mit 32 GB RAM stellt theoretisch fast 32 GB für Modelle zur Verfügung, abzüglich des Speichers für das Betriebssystem und andere Programme. Das macht Macs besonders attraktiv für große Modelle.
Mac Mini M4 mit 24 GB: Gut für 7B und 8B Modelle, flüssig bei 30 bis 50 Token pro Sekunde. 13B-Modelle laufen mit reduzierter Geschwindigkeit. Kosten ab 700 Euro.
Mac Studio M2 Max mit 64 GB: Bewältigt 30B-Modelle vollständig im Unified Memory. 70B-Modelle sind mit etwas Offloading möglich. Kosten ab 2200 Euro.
MacBook Pro M4 Pro mit 48 GB: Mobil und leistungsstark. Gut für 13B und 30B Modelle. Kosten ab 2000 Euro.
Der Vorteil von Apple Silicon ist, dass Du keine separate GPU kaufen musst. Der Nachteil ist der Preis und die Tatsache, dass Nvidia-GPUs bei vergleichbarem VRAM oft schneller sind. Mehr zum Thema Speicher findest Du unter RAM vs. VRAM.
Festplattenplatz für Modelle
Modelle nehmen erheblichen Platz ein. Ollama speichert sie standardmäßig unter ~/.ollama/models. Die Größe einer Modelldatei entspricht in etwa dem Speicherbedarf zur Laufzeit:
- 3B-Modell: 2 bis 3 GB
- 7B-Modell: 4 bis 5 GB
- 13B-Modell: 7 bis 9 GB
- 30B-Modell: 17 bis 20 GB
- 70B-Modell: 38 bis 42 GB
Wenn Du mehrere Modelle installierst, summiert sich das schnell. Eine NVMe-SSD ist empfohlen, da das Laden eines 70B-Modells von einer HDD mehrere Minuten dauern kann. Mit NVMe dauert es Sekunden. Du kannst den Speicherort über die Umgebungsvariable OLLAMA_MODELS ändern, mehr dazu in der Ollama Konfiguration.
Empfohlene Setups nach Budget
Unter 500 Euro
Ein vorhandener PC oder Laptop mit 16 GB RAM und einer NVMe-SSD. Keine separate GPU. Du betreibst 3B und 7B Modelle auf der CPU. Geschwindigkeit ist moderat, aber funktional. Ideal zum Ausprobieren und Lernen.
500 bis 1000 Euro
Ein PC mit 32 GB RAM und einer gebrauchten RTX 3060 12 GB. Damit läufst Du 7B und 8B Modelle vollständig auf der GPU und erreichst 40 bis 60 Token pro Sekunde. 13B-Modelle sind mit teilweise CPU-Offloading möglich.
1000 bis 2000 Euro
Ein PC mit 64 GB RAM und einer RTX 4060 Ti 16 GB oder einer gebrauchten RTX 4090. Du betreibst 13B-Modelle vollständig auf der GPU und 30B-Modelle mit teilweise Offloading. Dieses Setup deckt die meisten Anwendungsfälle ab.
Über 2000 Euro
Ein System mit 128 GB RAM und zwei RTX 4090 oder ein Mac Studio mit 64 GB Unified Memory. Du betreibst 70B-Modelle, wenn auch mit teilweise Offloading. Dieses Setup ist für ernsthafte Nutzer, die große Modelle regelmäßig einsetzen.
Wie prüfe ich ob meine Hardware reicht?
Bevor Du ein Modell lädst, kannst Du Deine Hardware überprüfen. Auf Linux und Windows mit Nvidia-GPU:
nvidia-smi
Das zeigt Dir den VRAM-Verbrauch und die GPU-Auslastung. Nach dem Start eines Modells prüfst Du, wie viel VRAM es belegt:
ollama ps
Das listet alle laufenden Modelle mit ihrem Speicherverbrauch. Auf Linux zeigt free -h den System-RAM:
free -h
Auf macOS öffnest Du den Activity Monitor oder nutzt im Terminal:
vm_stat
Wenn der VRAM nach dem Laden eines Modells zu 100% belegt ist und die Token-Produktion trotzdem langsam ist, lagert Ollama Teile auf den RAM aus. In diesem Fall brauchst Du mehr VRAM oder ein kleineres Modell.
Typische Stolpersteine bei den Hardware-Anforderungen
-
VRAM falsch eingeschätzt: Viele kaufen eine GPU mit 8 GB VRAM und wundern sich, dass 13B-Modelle langsam laufen. 8 GB reichen für 7B, nicht für 13B.
-
Quantisierung ignoriert: Ein unquantisiertes 7B-Modell braucht etwa 14 GB, das gleiche Modell in 4-bit nur 5 GB. Wer die Standardwerte nicht kennt, überschätzt oder unterschätzt den Bedarf massiv.
-
RAM zu knapp: Auch bei CPU-only braucht der System-RAM Platz für das Betriebssystem. 16 GB RAM mit einem 13B-Modell, das 9 GB braucht, lässt nur 7 GB für alles andere. Das kann zu Swapping und extremen Verlangsamungen führen.
-
Festplatte zu langsam: Modelle von einer HDD zu laden dauert bei großen Modellen Minuten. Das ist kein Dauerproblem, aber es frustriert beim Ausprobieren verschiedener Modelle.
-
GPU-Treiber fehlen: Ollama erkennt die GPU nur, wenn die Treiber korrekt installiert sind. Ohne Treiber läuft alles auf der CPU, auch wenn eine teure GPU eingebaut ist.
-
OLLAMA_GPU_LAYERS nicht gesetzt: Standardmäßig versucht Ollama, so viele Schichten wie möglich auf die GPU zu laden. Bei manchen Modellen hilft es, die Anzahl manuell zu begrenzen, um Abstürze bei vollem VRAM zu vermeiden.
-
Unified Memory bei Apple Silicon vergessen: Ein Mac mit 16 GB RAM hat nicht 16 GB für Modelle. Das Betriebssystem braucht einen Teil, realistisch bleiben 10 bis 12 GB.
-
Mehrere Modelle gleichzeitig: Wenn Du zwei Modelle parallel laufen lässt, teilen sie sich den VRAM. Was einzeln passt, kann zusammen zu viel sein.
Hardware, Kosten und Sicherheit bei Ollama
Lokale KI bedeutet, dass Deine Daten auf Deinem Rechner bleiben. Keine API-Aufrufe an externe Server, keine Cloud-Abhängigkeit. Das ist ein Sicherheitsvorteil, bringt aber die Verantwortung für die Hardware mit sich. Ein 2000-Euro-System für 70B-Modelle lohnt sich nur, wenn Du diese Modelle regelmäßig brauchst. Für gelegentliche Nutzung reicht ein 500-Euro-Setup.
Die Hardware-Kosten sind einmalig, anders als bei Cloud-APIs, wo Du pro Token zahlst. Bei intensiver Nutzung amortisiert sich ein lokales Setup schnell. Die Ollama Übersicht gibt Dir einen Überblick über alle Funktionen.
Weiterführende Links und Infos zu Hardware-Anforderungen
- Ollama Übersicht - Alle Funktionen von Ollama auf einen Blick
- Ollama Installation - So installierst Du Ollama
- Ollama Konfiguration - Pfade, Ports und Umgebungsvariablen
- RAM und VRAM Anforderungen - Grundlagen zum Speicherbedarf
- Quantisierung - Wie Komprimierung den Speicherbedarf senkt
- KI-Hardware Grundlagen - Allgemeine Grundlagen
- CPU vs. GPU - Wann welche Option sinnvoll ist
- RAM vs. VRAM - Unterschiede und Gemeinsamkeiten
- Hardware richtig dimensionieren - Praxisnahe Dimensionierung
- Kaufberatung - Empfehlungen nach Budget
- KI-PC Einsteiger - Der erste KI-PC
FAQ: Ollama Hardware-Anforderungen - Typische Fragen
Kann ich Ollama ohne GPU nutzen?
Ja, Ollama läuft vollständig auf der CPU. Kleine Modelle bis 7B sind mit moderater Geschwindigkeit nutzbar. Größere Modelle werden sehr langsam.
Wie viel VRAM brauche ich für ein 7B-Modell?
Etwas 5 GB bei 4-bit Quantisierung. Eine RTX 3060 mit 12 GB VRAM hat genug Reserve und ist eine solide Wahl.
Reicht 8 GB RAM für Ollama?
Für kleine Modelle wie 3B ja. Für 7B-Modelle wird es knapp, besonders wenn das Betriebssystem auch RAM braucht. 16 GB sind das empfohlene Minimum.
Läuft ein 70B-Modell auf einer einzelnen RTX 4090?
Nicht vollständig. Ein 70B-Modell braucht etwa 40 GB, die RTX 4090 hat 24 GB VRAM. Ollama lagert den Rest auf den System-RAM aus, was die Geschwindigkeit stark reduziert.
Ist Apple Silicon besser als Nvidia für Ollama?
Bei vergleichbarem Speicher ist Nvidia oft schneller. Apple Silicon hat aber den Vorteil des Unified Memory, das sehr große Modelle ermöglicht, ohne mehrere GPUs zu kaufen.
Wie viel Festplattenplatz brauche ich?
Pro Modell rechnest Du mit 2 bis 42 GB je nach Größe. Für mehrere Modelle solltest Du mindestens 100 GB freien Speicher auf einer NVMe-SSD einplanen.
Was ist GPU-Offloading?
GPU-Offloading bedeutet, dass Teile des Modells auf die GPU geladen werden und der Rest im System-RAM verbleibt. Je mehr Schichten auf die GPU passen, desto schneller läuft das Modell.
Brauche ich CUDA für Ollama?
Auf Linux mit Nvidia-GPUs ja, die CUDA-Treiber müssen installiert sein. Ollama erkennt sie automatisch. Auf macOS und bei CPU-only-Betrieb ist CUDA nicht nötig.
Kann ich Ollama auf einem Laptop nutzen?
Ja, wenn der Laptop genug RAM oder VRAM hat. Laptops mit dedizierter GPU wie einer RTX 4060 sind gut geeignet. Ohne GPU funktionieren kleine Modelle auf der CPU.
Was bedeutet OLLAMA_GPU_LAYERS?
Das ist eine Umgebungsvariable, mit der Du steuerst, wie viele Modell-Schichten auf die GPU geladen werden. Bei VRAM-Problemen kannst Du den Wert reduzieren, um Abstürze zu vermeiden.
Wie schnell ist Ollama auf der CPU?
Bei einem 7B-Modell auf einem modernen 6-Kern-CPU erreichst Du etwa 5 bis 10 Token pro Sekunde. Das ist für Chat nutzbar, aber nicht flüssig wie mit einer GPU.
Lohnt sich eine gebrauchte GPU?
Ja, besonders eine gebrauchte RTX 3060 12 GB bietet viel VRAM für wenig Geld. Achte darauf, dass die Karte funktioniert und die Treiber aktuell sind.
Quellen und weiterführende Literatur
- Ollama offizielle Dokumentation
- Nvidia CUDA-Toolkit Dokumentation
- Apple Developer Dokumentation zu Unified Memory
- Praxiswerte aus eigenen Messungen mit verschiedenen Modellen und Hardware-Konfigurationen


