PC für Ollama: Optimale Hardware für lokale Modelle
Was dieser Artikel über Hardware für Ollama behandelt
- Welche Hardware-Komponenten für flüssige Ollama-Inferenz wirklich zählen
- Wie viel VRAM und RAM Du für 3B, 7B, 13B, 30B und 70B Modelle brauchst
- Welche GPUs sich für Ollama lohnen, von der RTX 3060 bis zur RTX 4090
- Wie Apple Silicon als Ollama-Plattform abschneidet
- Drei konkrete Builds mit Preisen für jedes Budget
Einleitung: PC für Ollama verständlich erklärt
Ollama hat das lokale Ausführen von Sprachmodellen enorm vereinfacht. Ein Befehl genügt, und ein Modell lädt und startet. Die Frage ist nur: Auf welcher Hardware? Wer Ollama auf einem normalen Laptop ohne GPU startet, wartet manchmal Sekunden auf jedes Wort. Mit der richtigen Grafikkarte kommen dieselben Modelle flüssig wie ein Chatbot daher.
Dieser Artikel erklärt, welcher PC für Ollama sinnvoll ist, wie viel VRAM und RAM Du für welche Modellgröße brauchst und welche Builds sich für verschiedene Budgets eignen. Wer sich generell für KI-Hardware interessiert, findet im Bereich Kaufberatung weitere Empfehlungen.
Warum brauche ich spezielle Hardware für Ollama?
Ollama kann auf jedem modernen Rechner laufen. Das bedeutet aber nicht, dass es schnell ist. Ein 7B-Modell wie Llama 3.1 auf einer reinen CPU auszuführen, liefert typischerweise 5 bis 15 Token pro Sekunde. Das fühlt sich an wie ein langsamer Tipper.
Dasselbe Modell auf einer RTX 3060 mit 12 GB VRAM erreicht 40 bis 80 Token pro Sekunde. Das ist ein Unterschied, den Du sofort merkst. Die GPU übernimmt die Berechnung der Modelllayer, die CPU rückt in den Hintergrund. Sobald das Modell vollständig in den VRAM passt, wird die Inferenz richtig schnell.
Der Grund ist simpel: LLM-Inferenz ist speicherbandbreitenbegrenzt. Eine GPU wie die RTX 4090 bietet über 1.000 GB/s Speicherbandbreite, ein typischer DDR5-Workstation-Speicher kommt auf etwa 80 bis 100 GB/s. Mehr Bandbreite bedeutet mehr Token pro Sekunde. Details dazu findest Du im Artikel CPU vs. GPU.
PC für Ollama kurz erklärt
Für Ollama brauchst Du vor allem zwei Dinge: ausreichend Speicherplatz für das Modell und genug Bandbreite, um es schnell zu verarbeiten. Konkret: Eine GPU mit 12 GB VRAM führt 7B- und 8B-Modelle in Q4-K Quantisierung flüssig aus. 24 GB VRAM ermöglichen 13B- und teilweise 30B-Modelle. Wer 70B-Modelle lokal betreiben will, braucht 48 GB VRAM oder mehr, alternativ einen Mac mit 64 GB Unified Memory oder mehr.
RAM ist die zweite wichtige Größe. Wenn das Modell nicht vollständig in den VRAM passt, lagert Ollama Teile auf die CPU aus. Das funktioniert, wird aber langsamer. Als Faustregel: Mindestens so viel RAM wie VRAM, besser das Doppelte. Mehr dazu im Artikel RAM und VRAM Anforderungen.
Für wen ist dieser Artikel gedacht?
Dieser Artikel richtet sich an Einsteiger und Fortgeschrittene, die einen PC für Ollama planen oder aufrüsten wollen. Du musst kein KI-Experte sein. Wenn Du weißt, was RAM und VRAM sind, reicht das. Wer ganz neu einsteigt, findet im Artikel KI-PC Einsteiger eine breitere Übersicht.
Wichtige Begriffe rund um Ollama-Hardware
| Begriff | Bedeutung |
|---|---|
| VRAM | Videospeicher der GPU. Entscheidend dafür, wie viel vom Modell auf der Grafikkarte liegt. |
| RAM | Arbeitsspeicher des Systems. Wird genutzt, wenn das Modell nicht vollständig in den VRAM passt. |
| GPU | Grafikkarte, die die Inferenz beschleunigt. Bei Ollama meist NVIDIA mit CUDA. |
| CPU | Hauptprozessor. Führt Modelllayer aus, die nicht auf die GPU passen. |
| Quantisierung | Reduziert die Genauigkeit des Modells, um Speicher zu sparen. Mehr dazu unter Quantisierung. |
| GPU-Offloading | Verschieben von Modelllayern von der CPU auf die GPU. Details im Artikel GPU-Offloading. |
| OLLAMA_GPU_LAYERS | Umgebungsvariable, die angibt, wie viele Layer auf die GPU verschoben werden. |
| KV-Cache | Speichert bereits berechnete Attention-Werte während der Inferenz. Wächst mit dem Kontext. |
| Token/s | Geschwindigkeitsmaß: Wie viele Token pro Sekunde generiert werden. |
| NVMe | Schneller SSD-Speicher. Wichtig für kurze Ladezeiten beim Start großer Modelle. |
Ollama Hardware-Anforderungen nach Modell
Die folgende Tabelle zeigt typische Anforderungen für gängige Modellgrößen in Q4-K Quantisierung. Die Werte sind Richtwerte, konkreter Bedarf hängt vom Modell und Kontext ab.
| Modellgröße | VRAM (Q4) | RAM (Minimum) | Empfohlene GPU |
|---|---|---|---|
| 3B | 3 bis 4 GB | 8 GB | RTX 3050, integrierte GPU |
| 7B | 5 bis 6 GB | 16 GB | RTX 3060 12 GB |
| 8B | 6 bis 7 GB | 16 GB | RTX 3060 12 GB, RTX 4060 |
| 13B | 9 bis 10 GB | 32 GB | RTX 3060 12 GB, RTX 4070 |
| 30B | 20 bis 22 GB | 32 GB | RTX 3090 24 GB, RTX 4090 |
| 70B | 40 bis 48 GB | 64 GB | 2x RTX 3090, Mac mit 64 GB+ |
Wer sich tiefer in die Anforderungen einlesen will, findet mehr im Artikel Ollama Hardware-Anforderungen.
Ollama auf CPU: Was ist möglich?
Ollama auf der CPU funktioniert, ist aber langsam. Kleine Modelle bis 3B sind auf einem modernen Prozessor noch brauchbar, etwa 10 bis 20 Token pro Sekunde. 7B-Modelle kommen auf 5 bis 15 Token pro Sekunde, je nach CPU und RAM-Geschwindigkeit. 13B und größer werden unkomfortabel, Du wartest mehrere Sekunden auf jeden Satz.
Wichtig: Auch auf der CPU hilft schneller RAM. DDR5 mit hoher Taktrate bringt spürbar mehr Tempo als älterer DDR4. Wer keine GPU hat, sollte mindestens 32 GB RAM einplanen, besser 64 GB, damit auch größere Modelle überhaupt geladen werden können.
Ollama mit GPU: Welche Grafikkarte?
Eine dedizierte GPU ist der größte Hebel für Ollama. NVIDIA-Karten mit CUDA sind der Standard, da die meisten Modelle dafür optimiert sind.
- RTX 3060 12 GB: Der Preis-Leistungs-Einstieg. 12 GB VRAM reichen für 7B, 8B und 13B in Q4. Gebraucht oft günstig zu haben.
- RTX 4070 12 GB: Schneller als die 3060, gleicher VRAM. Gut, wenn Du mehr Leistung pro Token willst.
- RTX 4090 24 GB: Das High-End für Enthusiasten. 24 GB VRAM passen 30B-Modelle vollständig, 70B nur mit Offloading auf CPU.
- Apple Silicon: Keine klassische GPU, aber Unified Memory macht Macs zu einer starken Ollama-Plattform. Mehr dazu im nächsten Abschnitt.
Wer mehrere GPUs kombiniert, kann den VRAM addieren. Zwei RTX 3090 mit jeweils 24 GB ergeben 48 GB VRAM, genug für 70B-Modelle in Q4. Das ist eine beliebte Konfiguration im gebrauchten Markt.
Ollama auf Apple Silicon
Apple Silicon ist für Ollama eine sehr interessante Plattform. Der Unified Memory Ansatz bedeutet, dass CPU und GPU denselben Speicher teilen. Ein Mac mit 64 GB Unified Memory kann davon einen großen Teil als VRAM nutzen. Das ist bei klassischen PCs mit dedizierter GPU so nicht möglich.
- Mac mini M4 mit 24 GB: Gut für 7B und 8B, knapp für 13B.
- Mac Studio M2 Ultra mit 128 GB: Führt 70B-Modelle in Q4 flüssig aus, eine der kompaktesten Lösungen für große Modelle.
- MacBook Pro M4 Pro mit 48 GB: Mobil und stark, gut für 13B und 30B.
Nachteil: Apple Silicon ist teuer und nicht aufrüstbar. Wer später mehr Speicher will, braucht ein neues Gerät. Dafür sind Macs leise, effizient und kompakt.
Empfohlene Hardware im Amazon Shop
Hardware für Ollama im Amazon Shop
Bei Amazon ansehenAffiliate-Link: Bei einem Kauf erhalten wir möglicherweise eine Provision.
Build-Vorschläge für Ollama
Build 1: Budget, etwa 600 bis 800 EUR
- CPU: AMD Ryzen 5 5600 oder Intel Core i5-12400F
- RAM: 32 GB DDR4
- GPU: RTX 3060 12 GB (gebraucht oder neu)
- Speicher: 1 TB NVMe SSD
- Netzteil: 550 W, 80+ Bronze
Dieser Build führt 7B und 8B flüssig aus. 13B passt mit Q4 knapp in den VRAM. Ideal für den Einstieg und erste Experimente mit Agenten.
Build 2: Mittelklasse, etwa 1.200 bis 1.800 EUR
- CPU: AMD Ryzen 5 7600 oder Intel Core i5-13600K
- RAM: 64 GB DDR5
- GPU: RTX 4070 12 GB oder gebrauchte RTX 3090 24 GB
- Speicher: 2 TB NVMe SSD
- Netzteil: 750 W, 80+ Gold
Mit 24 GB VRAM (RTX 3090) laufen 13B und 30B gut. 64 GB RAM geben Dir Luft für Offloading und parallele Prozesse. Ein solider Allrounder für ernsthaftes Arbeiten mit lokaler KI.
Build 3: High-End, etwa 3.000 bis 5.000 EUR
- CPU: AMD Ryzen 9 7950X oder Intel Core i9-14900K
- RAM: 128 GB DDR5
- GPU: 2x RTX 4090 24 GB oder 2x RTX 3090 24 GB
- Speicher: 4 TB NVMe SSD
- Netzteil: 1.200 W, 80+ Platinum
48 GB VRAM ermöglichen 70B-Modelle in Q4. 128 GB RAM sorgen dafür, dass auch lange Kontexte und mehrere parallele Modelle kein Problem sind. Wer das Maximum aus Ollama herausholen will, ist hier richtig.
Ollama Performance-Tipps
- GPU-Layer maximieren: Setze
OLLAMA_GPU_LAYERSauf einen hohen Wert oder auf-1, damit Ollama so viele Layer wie möglich auf die GPU legt. Konfigurationsdetails findest Du unter Ollama Konfiguration. - Quantisierung wählen: Q4_K_M ist ein guter Standard. Q8 ist genauer, braucht aber deutlich mehr VRAM. Q3 spart Speicher, verliert aber an Qualität.
- Kontextlänge begrenzen: Der KV-Cache wächst mit dem Kontext. Ein Kontext von 32k Tokens kann mehrere GB VRAM zusätzlich verbrauchen. Reduziere den Kontext, wenn Du Geschwindigkeit brauchst.
- NVMe statt SATA SSD: Große Modelle laden schneller von einer NVMe. Das spart beim Start und beim Wechseln zwischen Modellen Zeit.
- Andere Programme schließen: Browser mit vielen Tabs und andere Apps konkurrieren um RAM und VRAM. Schließe sie, bevor Du große Modelle startest.
Typische Stolpersteine bei Ollama-Hardware
- VRAM zu knapp bemessen: Wer genau 8 GB VRAM hat und ein 8B-Modell in Q8 laden will, wird enttäuscht. Q4 passt, Q8 nicht. Plane immer einen Puffer für den KV-Cache ein.
- RAM vergessen: Wenn das Modell nicht in den VRAM passt, braucht Ollama RAM. Wer 16 GB RAM und eine 12 GB GPU hat, kommt bei 13B-Modellen schnell an die Grenze.
- CPU-Offloading unterschätzt: Wenn nur ein Teil der Layer auf die GPU passt, wird die Inferenz deutlich langsamer. Ein 30B-Modell halb auf CPU ist frustrierend langsam.
- Netzteil zu schwach: Zwei RTX 3090 ziehen unter Last über 700 W allein. Ein schwaches Netzteil führt zu Abstürzen oder schaltet den Rechner ab.
- Gehäuse zu klein: Große GPUs passen nicht in jedes Gehäuse. Miss vorher nach, besonders bei Dual-GPU-Setups.
- Kühlung vernachlässigt: Zwei GPUs im engen Gehäuse werden heiß. Lüftersteuerung und Airflow sind wichtig, sonst drosselt die Karte.
- Apple Silicon Speicher nicht aufrüstbar: Wer einen Mac mit 16 GB kauft, ist später festgefahren. Überlege vorher, welche Modellgrößen Du ausführen willst.
- AMD-GPUs mit ROCm: Ollama unterstützt AMD, aber CUDA ist besser optimiert. Wer auf maximale Kompatibilität Wert legt, wählt NVIDIA.
Hardware, Kosten und Sicherheit bei Ollama
Lokale Inferenz mit Ollama bedeutet, dass Deine Daten Deinen Rechner nicht verlassen. Das ist ein großer Vorteil gegenüber Cloud-Diensten. Chats, Prompts und Kontexte bleiben auf Deiner Festplatte.
Kostenmäßig ist die Hardware einmalig, danach fallen keine API-Kosten an. Ein Build für 800 EUR amortisiert sich schnell, wenn Du regelmäßig mit großen Modellen arbeitest. Stromkosten solltest Du einplanen: Eine RTX 4090 zieht unter Last bis zu 450 W, zwei davon deutlich mehr.
Sicherheitstechnisch gilt: Modelle von unbekannten Quellen können Schadcode enthalten. Lade Modelle nur von vertrauenswürdigen Repositories wie der offiziellen Ollama-Bibliothek oder Hugging Face mit geprüften Uploadern.
Weiterführende Links und Infos zu Ollama-Hardware
- Ollama - Grundlagen und Einrichtung
- Ollama Hardware-Anforderungen - Detaillierte Spezifikationen
- Ollama Konfiguration - Einstellungen und Tuning
- Kaufberatung - Weitere Hardware-Empfehlungen
- KI-PC Einsteiger - Breiterer Einstieg in KI-Hardware
- CPU vs. GPU - Warum die GPU den Unterschied macht
- GPU-Offloading - Layer-Verteilung erklärt
- Quantisierung - Wie Modelle kleiner werden
- RAM und VRAM Anforderungen - Speicherbedarf im Detail
FAQ: PC für Ollama - Typische Fragen
Welche GPU brauche ich für Ollama?
Für 7B- und 8B-Modelle reicht eine RTX 3060 mit 12 GB VRAM. Für 13B empfiehlt sich 12 bis 24 GB VRAM, für 30B mindestens 24 GB. 70B-Modelle brauchen 48 GB VRAM oder mehr.
Kann ich Ollama ohne GPU nutzen?
Ja, Ollama läuft auf der CPU. Die Geschwindigkeit ist aber deutlich geringer. 7B-Modelle kommen auf 5 bis 15 Token pro Sekunde, größere Modelle werden unkomfortabel.
Wie viel RAM brauche ich für Ollama?
Minimum 16 GB für kleine Modelle auf der CPU. Empfohlen sind 32 GB für 7B bis 13B und 64 GB oder mehr für 30B und 70B. Wenn das Modell nicht in den VRAM passt, braucht Ollama den RAM als Ausweichspeicher.
Reicht eine RTX 3060 für Ollama?
Ja, die RTX 3060 mit 12 GB VRAM ist ein sehr guter Einstieg. Sie führt 7B, 8B und 13B in Q4-K Quantisierung flüssig aus. Für 30B wird es knapp, hier hilft Offloading auf die CPU.
Lohnt sich eine RTX 4090 für Ollama?
Für Enthusiasten ja. 24 GB VRAM passen 30B-Modelle vollständig und 70B mit Offloading. Wer das Maximum an Leistung will, ist mit der 4090 richtig. Für den Einstieg ist sie überdimensioniert.
Ist Apple Silicon gut für Ollama?
Ja, besonders wegen des Unified Memory. Ein Mac Studio mit 128 GB kann 70B-Modelle ausführen, was mit einer einzelnen Grafikkarte schwer möglich ist. Nachteil ist der Preis und die fehlende Aufrüstbarkeit.
Was ist GPU-Offloading bei Ollama?
GPU-Offloading verschiebt Modelllayer von der CPU auf die GPU. Je mehr Layer auf die GPU passen, desto schneller wird die Inferenz. Die Umgebungsvariable OLLAMA_GPU_LAYERS steuert, wie viele Layer verschoben werden.
Kann ich mehrere GPUs für Ollama nutzen?
Ja, Ollama unterstützt mehrere GPUs. Der VRAM addiert sich. Zwei RTX 3090 mit jeweils 24 GB ergeben 48 GB VRAM, genug für 70B-Modelle in Q4. Achte auf Netzteil und Kühlung.
Was bedeutet Quantisierung bei Ollama?
Quantisierung reduziert die Genauigkeit der Modellgewichte, um Speicher zu sparen. Q4_K_M ist ein guter Kompromiss aus Größe und Qualität. Q8 ist genauer, braucht aber etwa doppelt so viel VRAM wie Q4.
Wie schnell ist Ollama auf der CPU?
Auf einer modernen CPU erreichst Du mit 7B-Modellen etwa 5 bis 15 Token pro Sekunde. 3B-Modelle kommen auf 10 bis 20 Token pro Sekunde. 13B und größer werden langsam, oft unter 5 Token pro Sekunde.
Brauche ich eine NVMe SSD für Ollama?
Nicht zwingend, aber empfohlen. Große Modelle laden von einer NVMe deutlich schneller als von einer SATA SSD. Beim Wechseln zwischen Modellen sparst Du spürbar Zeit.
Funktioniert Ollama mit AMD-Grafikkarten?
Ja, Ollama unterstützt AMD über ROCm. Die Kompatibilität ist aber nicht so breit wie bei NVIDIA mit CUDA. Wer auf Nummer sicher gehen will, wählt eine NVIDIA-GPU.
Quellen und weiterführende Literatur
- Ollama Modellbibliothek
- Ollama Dokumentation
- NVIDIA GPU-Spezifikationen
- Apple Silicon Übersicht
- Hugging Face Modelle
- Hardware für Ollama im Amazon Shop


