CPU für lokale KI kaufen
Was dieser Artikel über CPUs für lokale KI behandelt
- Wie wichtig die CPU bei lokaler KI ist.
- Welche CPU-Eigenschaften für KI-Inferenz relevant sind.
- Unterschied zwischen CPU- und GPU-Inferenz.
- Empfehlungen für verschiedene Budgets.
- Typische Fehler beim Kauf.
Einleitung: CPU für lokale KI kaufen
Die GPU ist bei lokaler KI meist der wichtigste Faktor für Geschwindigkeit. Trotzdem spielt die CPU eine entscheidende Rolle: sie lädt Modelle, koordiniert das System und übernimmt die Inferenz, wenn kein ausreichend VRAM vorhanden ist. Wer die CPU richtig wählt, vermeidet Flaschenhälse und kann auch Modelle betreiben, die nicht mehr in den GPU-Speicher passen.
Dieser Artikel zeigt, worauf beim Kauf einer CPU für Ollama und lokale KI-Projekte geachtet werden sollte.
Wichtige Begriffe
- CPU: Zentrale Prozessoreinheit.
- Kern: Eigenständige Recheneinheit innerhalb der CPU.
- Thread: Virtueller Kern durch Simultaneous Multithreading.
- Taktrate: Geschwindigkeit, mit der ein Kern arbeitet.
- AVX: Advanced Vector Extensions, Befehlssatz für KI-Berechnungen.
- AVX2/AVX-512: Neuere und breitere Vektorinstruktionen.
- RAM-Kanäle: Gleichzeitige Datenwege zum Arbeitsspeicher.
- CPU-Inferenz: Modell läuft auf der CPU statt auf der GPU.
Wann ist die CPU wichtig?
- Wenn das Modell nicht in den VRAM passt.
- Wenn das Modell komplett oder teilweise auf der CPU ausgeführt wird.
- Wenn Aufgaben wie Tokenisierung, Vorverarbeitung oder RAG auf der CPU laufen.
- Wenn mehrere Dienste parallel betrieben werden.
- Wenn keine dedizierte GPU verfügbar ist.
Bei rein GPU-basierten Inferenzen ist die CPU weniger entscheidend, darf aber nicht zur Bremse werden.
CPU-Inferenz: Was braucht sie?
CPU-Inferenz profitiert von:
- Vielen schnellen Kernen.
- Breiten Vektorinstruktionen wie AVX2 und AVX-512.
- Hoher Speicherbandbreite durch viele RAM-Kanäle.
- Grossem Cache.
Eine hohe Taktrate ist ebenfalls vorteilhaft, besonders bei kleineren Modellen.
AVX und KI
Ollama und llama.cpp nutzen AVX2 auf modernen CPUs. AVX-512 kann bei entsprechend optimierten Builds zusätzliche Geschwindigkeit bringen, ist aber nicht bei allen Consumer-CPUs verfügbar. Server-CPUs wie Intel Xeon oder AMD EPYC unterstützen oft AVX-512 und bieten viele Kerne und RAM-Kanäle.
Consumer-CPUs im Vergleich
| CPU | Kerne/Threads | AVX | Besonderheit |
|---|---|---|---|
| AMD Ryzen 5/7/9 | 6 bis 16 Kerne | AVX2 | Gute Preis-Leistung |
| Intel Core i5/i7/i9 | 6 bis 24 Kerne | AVX2, teils AVX-512 | Hohe Taktraten |
| AMD Threadripper | bis 64 Kerne | AVX2 | Viele RAM-Kanäle |
| Intel Xeon | bis 60+ Kerne | AVX-512 | ECC, viele PCIe-Lanes |
| AMD EPYC | bis 96 Kerne | AVX2 | Server, viele Kerne |
Budget-Empfehlungen
Einsteiger
- AMD Ryzen 5 oder Intel Core i5.
- 6 bis 8 Kerne.
- AVX2.
- Geeignet für kleine 7B-Modelle auf CPU.
Mittelklasse
- AMD Ryzen 7/9 oder Intel Core i7/i9.
- 8 bis 16 Kerne.
- Hohe Taktrate.
- Dual-Channel-RAM ausreichend, Quad-Channel besser.
High-End / Workstation
- AMD Threadripper oder Intel Xeon W.
- Viele Kerne und viele RAM-Kanäle.
- ECC-Support.
- Ideale für grosse CPU-Modelle und Multi-GPU-Setups.
CPU vs. GPU
- GPU: Sehr schnell bei massiv parallelen Berechnungen, Voraussetzung für flüssige KI-Inferenz.
- CPU: Flexibler, aber deutlich langsamer bei gleicher Modellgrösse.
- Unified Memory: Apple Silicon kombiniert CPU- und GPU-Speicher, was kleinen Modellen hilft.
Wer grössere Modelle flüssig nutzen will, braucht fast immer eine starke GPU. Die CPU sollte dennoch nicht vernachlässigt werden.
Kerne, Threads und Frequenz
- Mehr Kerne helfen bei parallelen Aufgaben und CPU-Inferenz.
- Höhere Taktrate verbessert Single-Thread-Leistung.
- Hyperthreading bringt bei KI oft einen moderaten Zuwachs.
- Die Balance aus Kernzahl und Frequenz ist wichtiger als nur eine der beiden Grössen.
RAM und CPU
CPUs profitieren von viel RAM und breiten RAM-Kanälen. Dual-Channel ist Minimum, Quad-Channel oder Octa-Channel bei Workstation-CPUs ideal. Speicherbandbreite ist bei CPU-Inferenz ein wichtiger Faktor, da Modell und KV-Cache aus dem RAM gelesen werden.
Cache
Grosser L3-Cache kann bei CPU-Inferenz helfen, da häufig benötigte Daten schneller verfügbar sind. CPUs mit grossem Cache, wie einige AMD X3D-Modelle, können bei bestimmten Workloads Vorteile bieten.
Tipps beim Kauf
- Vermeiden Sie CPUs ohne AVX2, wenn KI-Inferenz geplant ist.
- Achten Sie auf genug PCIe-Lanes für die geplante GPU.
- Server-CPUs bieten mehr RAM-Steckplätze und PCIe-Lanes.
- Workstation-CPUs sind lohnenswert, wenn viel RAM oder mehrere GPUs geplant sind.
- Für reine GPU-Inferenz ist ein moderner Mid-Range-Prozessor oft ausreichend.
Typische Kauffehler
- Zu wenige Kerne: System wird insgesamt träge.
- Kein AVX2: llama.cpp und Ollama laufen langsamer oder nicht optimal.
- Zu wenig RAM-Unterstützung: Spätere Erweiterung unmöglich.
- Falscher Sockel: Mainboard und CPU passen nicht zusammen.
- ECC vergessen: Bei 24/7-Servern wichtig.
- GPU-Limitierung: Zu wenige PCIe-Lanes für mehrere GPUs.
Weiterführende Links und Infos
- BotServ.de GPU für lokale KI kaufen
- BotServ.de RAM für lokale KI kaufen
- BotServ.de Mainboard für lokale KI kaufen
- BotServ.de Ollama Performance
FAQ: CPU für lokale KI
Brauche ich einen teuren Prozessor? Nein, für reine GPU-Inferenz reicht ein starker Mid-Range-Prozessor. CPU-Inferenz braucht aber viel Leistung.
Ist AVX-512 wichtig? AVX2 ist Standard. AVX-512 kann helfen, ist aber oft nur bei Server-CPUs verfügbar.
Sollte ich lieber Intel oder AMD kaufen? Beide funktionieren. AMD bietet oft mehr Kerne, Intel hohe Taktraten. Workstation-Entscheidung hängt vom Gesamtpaket ab.
Welche CPU für Ollama? Mindestens ein moderner 6-Kern-Prozessor mit AVX2. Für CPU-Inferenz lieber 8 bis 16 Kerne.
Lohnt sich ein Server-Prozessor? Ja, wenn viele RAM-Steckplätze, ECC oder mehrere GPUs benötigt werden.
Quellen und weiterführende Literatur
- AMD Ryzen: https://www.amd.com/en/processors/ryzen
- Intel Core: https://www.intel.com/content/www/us/en/products/details/processors.html
- llama.cpp CPU Inferenz: https://github.com/ggerganov/llama.cpp
Zusammenfassung: CPU für lokale KI kaufen
Die CPU ist bei lokalen KI-Setups neben der GPU wichtig. Für reine GPU-Inferenz reicht ein solider Mid-Range-Prozessor mit AVX2. Wer CPU-Inferenz, grosse Modelle oder viele parallele Dienste betreibt, profitiert von vielen Kernen, breiten RAM-Kanälen und grossem Cache. Workstation- und Server-CPUs bieten ECC, viele PCIe-Lanes und hohe Speicherbandbreite. Wer CPU und GPU abstimmt, bekommt ein ausgewogenes KI-System ohne unnötige Flaschenhälse.


