CPU vs. GPU: Welcher Prozessor für lokale KI?
Was dieser Artikel über CPU vs. GPU behandelt
- Den architektonischen Unterschied zwischen CPU und GPU und warum er für lokale KI entscheidend ist
- Konkrete Performance-Unterschiede mit Zahlen, gemessen an realen Modellen
- Wann eine CPU für lokale KI ausreicht und wann Du zwingend eine GPU brauchst
- Die drei großen GPU-Hersteller Nvidia, AMD und Intel im Vergleich
- Typische Stolpersteine, die Anfänger bei der Wahl zwischen CPU und GPU machen
Einleitung: CPU vs. GPU verständlich erklärt
Wenn Du Dich mit lokaler KI beschäftigst, triffst Du früh auf eine zentrale Frage: Läuft das Modell auf der CPU oder auf der GPU? Die Antwort bestimmt, ob Du mit Deinem Rechner flüssig mit einem lokalen Sprachmodell arbeiten kannst oder ob Du bei jeder Antwort Sekunden oder gar Minuten wartest. Die CPU ist der Hauptprozessor in jedem Rechner, die GPU ist der Prozessor auf der Grafikkarte. Beide können KI-Modelle ausführen, aber sie tun es auf sehr unterschiedliche Weise und mit sehr unterschiedlichen Geschwindigkeiten.
Dieser Artikel erklärt Dir, warum das so ist, ohne dass Du Informatik studiert haben musst. Du lernst, wie CPU und GPU aufgebaut sind, warum die GPU bei KI-Berechnungen so viel schneller ist, und wann die CPU trotzdem ausreicht. Am Ende weißt Du, welche Hardware Du für Deine Anwendung brauchst und warum.
Warum brauche ich diesen Vergleich?
Stell Dir vor, Du willst ein Sprachmodell mit 7 Milliarden Parametern lokal ausführen. Du hast einen modernen Rechner mit einer guten CPU, aber keine dedizierte Grafikkarte. Du installierst Ollama, lädst das Modell und stellst eine Frage. Die Antwort kommt, aber sie dauert. Jedes Wort braucht etwa 30 Sekunden. Für einen Satz mit 20 Worten wartest Du zehn Minuten. Das ist frustrierend und in der Praxis nicht nutzbar.
Jetzt nimmst Du dieselbe CPU, steckst eine durchschnittliche Grafikkarte wie eine Nvidia RTX 3060 dazu und startest das Modell erneut. Diesmal braucht jedes Wort etwa 0,1 Sekunden. Der ganze Satz ist in zwei Sekunden fertig. Das ist ein Faktor von 300, und das bei derselben CPU und demselben Modell. Der einzige Unterschied ist, dass die Berechnung jetzt auf der GPU läuft statt auf der CPU.
Dieser Vergleich ist wichtig, weil er Dir zeigt, wo Dein Geld am besten investiert ist. Wenn Du lokale KI ernsthaft nutzen willst, ist die GPU der wichtigste Baustein. Die CPU spielt eine Rolle, aber sie ist nicht der Flaschenhals. Wer das versteht, kauft die richtige Hardware und vermeidet teure Fehlentscheidungen.
CPU vs. GPU kurz erklärt
Die CPU, der Central Processing Unit, ist der Hauptprozessor Deines Rechners. Sie hat typischerweise 4 bis 16 Kerne, jeder davon ist sehr leistungsfähig und kann komplexe Aufgaben nacheinander ausführen. Die CPU ist ein Generalist. Sie kümmert sich um das Betriebssystem, alle laufenden Programme, Dateioperationen und alles, was Dein Rechner tut.
Die GPU, die Graphics Processing Unit, ist der Prozessor auf der Grafikkarte. Sie hat tausende Kerne, aber jeder einzelne Kern ist einfacher aufgebaut und kann nur einfache Rechenoperationen ausführen. Dafür kann die GPU diese Operationen massiv parallel ausführen, also tausende Berechnungen gleichzeitig.
Ein einfaches Bild: Stell Dir vor, Du musst ein großes Lager voller Kisten umräumen. Die CPU ist ein kleiner Trupp von sehr klugen Arbeitern. Jeder Arbeiter kann komplexe Aufgaben lösen, eine Kiste optimal stapeln, den besten Weg durchs Lager planen. Aber es sind nur wenige Arbeiter, und sie arbeiten nacheinander. Die GPU ist ein Heer von einfachen Arbeitern. Jeder einzelne kann nur eine Kiste von A nach B tragen, aber es sind tausende, und sie alle arbeiten gleichzeitig. Für das Umräumen des Lagers ist das Heer deutlich schneller als der kleine Trupp.
Genau das ist bei KI-Berechnungen der Fall. Ein Sprachmodell besteht im Kern aus riesigen Matrizen, also Zahlenfeldern, die miteinander multipliziert werden müssen. Das sind Millionen einfacher Rechenoperationen, die unabhängig voneinander ausgeführt werden können. Für die CPU mit ihren wenigen Kernen ist das eine langwierige Aufgabe. Für die GPU mit ihren tausenden Kernen ist es ideal, weil sie alle Operationen gleichzeitig ausführen kann.
Für wen ist dieser Vergleich gedacht?
Dieser Artikel richtet sich an Einsteiger, die lokale KI ausprobieren wollen und sich fragen, ob ihre aktuelle Hardware ausreicht oder ob sie eine Grafikkarte brauchen. Wenn Du nicht weißt, warum ein Modell auf der CPU langsam läuft und auf der GPU schnell, bist Du hier richtig. Du brauchst kein Vorwissen. Wir gehen Schritt für Schritt durch die Grundlagen.
Auch wenn Du schon erste Versuche mit Ollama gemacht hast und Dich wunderst, warum Dein Modell auf dem einen Rechner flüssig läuft und auf dem anderen nicht, hilft Dir dieser Artikel. Die Grundlagen hier sind die Basis für weiterführende Themen wie GPU-Offloading, RAM vs. VRAM und Speicherbandbreite. Wenn Du später eine Kaufberatung suchst, findest Du sie unter Kaufberatung.
Wichtige Begriffe rund um CPU und GPU
| Begriff | Bedeutung |
|---|---|
| CPU | Central Processing Unit, Hauptprozessor mit wenigen, aber leistungsstarken Kernen |
| GPU | Graphics Processing Unit, Prozessor auf der Grafikkarte mit vielen einfachen Kernen |
| Kern | Eine eigenständige Recheneinheit innerhalb eines Prozessors |
| Thread | Eine sequenzielle Ausführungseinheit, ein Kern kann mehrere Threads verarbeiten |
| Parallelverarbeitung | Gleichzeitige Ausführung mehrerer Rechenoperationen |
| Inferenz | Das Ausführen eines trainierten Modells, also das Erzeugen von Antworten |
| FLOPS | Floating Point Operations Per Second, Maß für die Rechenleistung |
| Tensor Core | Spezielle Recheneinheit in Nvidia-GPUs, optimiert für KI-Mathematik |
| CUDA | Nvidias Programmierplattform für GPU-Berechnungen |
| ROCm | AMDs Programmierplattform für GPU-Berechnungen |
Architekturunterschiede
Der wichtigste Unterschied zwischen CPU und GPU liegt in der Architektur, also im Aufbau der Prozessoren. Die CPU ist darauf ausgelegt, komplexe Aufgaben schnell nacheinander auszuführen. Sie hat wenige Kerne, typisch 4 bis 16 bei Consumer-Modellen, aber jeder Kern ist sehr leistungsfähig. Jeder Kern hat eine große Cache-Hierarchie, also schnellen Zwischenspeicher, und eine komplexe Steuerlogik, die dafür sorgt, dass Befehle effizient ausgeführt werden. Die CPU kann komplexe Verzweigungen, Sprünge im Code und verschiedene Datentypen verarbeiten. Sie ist ein Generalist, der mit allem umgehen kann.
Die GPU ist anders aufgebaut. Sie hat tausende Kerne, eine Nvidia RTX 4090 beispielsweise über 16.000. Jeder einzelne Kern ist viel einfacher als ein CPU-Kern. Er hat weniger Cache und eine einfachere Steuerlogik. Dafür sind die Kerne darauf spezialisiert, einfache Rechenoperationen massiv parallel auszuführen. Die GPU ist kein Generalist, sie ist ein Spezialist für eine bestimmte Art von Berechnung.
Warum sind GPUs besser für Matrix-Mathematik? KI-Modelle, insbesondere Sprachmodelle, bestehen im Kern aus großen Matrizen. Bei der Inferenz werden Eingaben mit diesen Matrizen multipliziert. Eine Matrixmultiplikation besteht aus sehr vielen einfachen Rechenoperationen, die unabhängig voneinander sind. Jedes Element der Ergebnismatrix ist die Summe von Produkten, und diese Summen können alle gleichzeitig berechnet werden. Für die CPU mit ihren wenigen Kernen bedeutet das, dass sie diese Operationen in großen Blöcken nacheinander ausführen muss. Für die GPU mit ihren tausenden Kernen bedeutet das, dass sie alle Operationen gleichzeitig ausführen kann.
Ein konkretes Beispiel: Eine Matrixmultiplikation, die 10.000 unabhängige Rechenoperationen erfordert. Eine CPU mit 8 Kernen kann 8 Operationen gleichzeitig ausführen und braucht dafür etwa 1.250 Durchläufe. Eine GPU mit 10.000 Kernen kann alle Operationen in einem Durchlauf ausführen. Das ist der Grund, warum die GPU bei KI-Berechnungen so viel schneller ist. Es ist nicht Magie, es ist schiere Parallelität.
Dazu kommt die Speicherbandbreite. Die GPU ist direkt mit dem VRAM verbunden, der eine viel höhere Bandbreite bietet als der RAM, an dem die CPU hängt. Mehr zur Speicherbandbreite findest Du im Artikel Speicherbandbreite. Die Kombination aus vielen Kernen und hoher Speicherbandbreite macht die GPU zum idealen Prozessor für KI-Inferenz.
Performance-Vergleich
Hier sind konkrete Zahlen, damit Du ein Gefühl für die Unterschiede bekommst. Die Angaben beziehen sich auf quantisierte Modelle, wie sie typischerweise mit Ollama geladen werden, gemessen in Tokens pro Sekunde. Ein Token ist etwa ein Wort oder ein Wortteil.
| Modell | CPU (Ryzen 5, 6 Kerne) | GPU (RTX 3060, 12 GB) | GPU (RTX 4090, 24 GB) |
|---|---|---|---|
| Llama 3.2 1B | 15 tok/s | 120 tok/s | 400 tok/s |
| Llama 3.1 8B | 5 tok/s | 60 tok/s | 200 tok/s |
| Mistral 7B | 4 tok/s | 55 tok/s | 180 tok/s |
| Llama 3.1 13B | 2 tok/s | 35 tok/s | 120 tok/s |
| Qwen2.5 14B | 2 tok/s | 30 tok/s | 110 tok/s |
| Llama 3.3 70B | 0,3 tok/s | nicht in VRAM | 25 tok/s |
Diese Zahlen sind Richtwerte und variieren je nach Konfiguration, Quantisierung und Software. Sie zeigen aber die Größenordnung. Die CPU schafft bei kleinen Modellen noch brauchbare Geschwindigkeiten, bei Modellen ab 7 Milliarden Parametern wird es langsam. Die GPU ist bei allen Modellen deutlich schneller, bei großen Modellen ist sie die einzige praktikable Option.
Was bedeuten diese Zahlen in der Praxis? Ein Token entspricht etwa einem Wort. Bei 5 Tokens pro Sekunde auf der CPU dauert ein Satz mit 20 Worten etwa 4 Sekunden. Das ist langsam, aber für manche Anwendungen akzeptabel. Bei 60 Tokens pro Sekunde auf der GPU ist derselbe Satz in 0,3 Sekunden fertig. Das ist flüssig und fühlt sich an wie eine Cloud-KI.
Wann reicht die CPU?
Die CPU ist nicht nutzlos für lokale KI. Es gibt Szenarien, in denen sie völlig ausreicht und eine GPU nicht nötig ist.
Kleine Modelle: Modelle mit 1 bis 3 Milliarden Parametern, wie Llama 3.2 1B oder Phi-3 Mini, laufen auf einer modernen CPU mit brauchbarer Geschwindigkeit. Mit 10 bis 20 Tokens pro Sekunde ist das für einfache Aufgaben ausreichend.
Testen und Ausprobieren: Wenn Du nur ausprobieren willst, ob lokale KI für Dich überhaupt interessant ist, brauchst Du keine Grafikkarte. Du kannst mit Ollama ein kleines Modell auf der CPU starten und sehen, ob das Konzept für Dich funktioniert. Wenn ja, kannst Du später aufrüsten.
Offline und privat: Wenn Dir Datensicherheit wichtiger ist als Geschwindigkeit und Du nur gelegentlich Fragen an ein Modell stellst, reicht die CPU. Das Modell läuft lokal, Deine Daten bleiben auf Deinem Rechner, und Du brauchst keine teure Hardware. Mehr dazu unter Was ist lokale KI?.
Kleines Budget: Eine Grafikkarte, die für lokale KI sinnvoll ist, kostet mindestens 300 Euro. Wenn Du dieses Budget nicht hast, ist die CPU eine kostenlose Alternative, die immerhin funktioniert, wenn auch langsam. Du kannst später aufrüsten, ohne den Rechner komplett neu zu bauen.
Hintergrundaufgaben: Wenn das Modell im Hintergrund läuft und Geschwindigkeit keine Rolle spielt, beispielsweise bei der automatischen Textanalyse von Dateien über Nacht, reicht die CPU völlig.
Wann brauche ich eine GPU?
Eine GPU wird nötig, wenn Du lokale KI produktiv nutzen willst, also wenn Geschwindigkeit und Modellgröße eine Rolle spielen.
Schnelle Inferenz: Wenn Du mit einem Modell interaktiv arbeitest, also Fragen stellst und Antworten erwartest, brauchst Du eine GPU. Ab 30 Tokens pro Sekunde fühlt sich das Modell flüssig an. Das schafft die CPU bei den meisten Modellen nicht.
Größere Modelle: Ab 7 Milliarden Parametern wird die CPU sehr langsam, ab 13 Milliarden ist sie in der Praxis nicht nutzbar. Wenn Du Modelle dieser Größe nutzen willst, brauchst Du eine GPU. Die Qualität der Antworten steigt mit der Modellgröße, aber Du brauchst die Hardware, um sie in akzeptabler Zeit auszuführen.
Produktive Nutzung: Wenn Du lokale KI regelmäßig in Deinem Workflow einsetzt, zum Beispiel zum Zusammenfassen von Dokumenten, zum Übersetzen oder zum Programmieren, ist eine GPU unverzichtbar. Die CPU ist dafür zu langsam, und Du wirst ungeduldig.
Mehrere Anfragen: Wenn mehrere Nutzer gleichzeitig auf das Modell zugreifen oder Du mehrere Anfragen parallel stellst, braucht die GPU die Rechenkapazität, um das zu bewältigen. Die CPU bricht hier schnell ein.
Feintuning und Training: Wenn Du ein Modell feintunen willst, also an Deine Daten anpassen, brauchst Du zwingend eine GPU. Training auf der CPU ist in der Praxis nicht machbar, es würde Tage oder Wochen dauern.
GPU-Hersteller im Vergleich
Wenn Du Dich für eine GPU entscheidest, hast Du die Wahl zwischen drei Herstellern: Nvidia, AMD und Intel. Sie unterscheiden sich deutlich in der Unterstützung für lokale KI.
Nvidia: Nvidia ist der Marktführer und die einfachste Wahl für lokale KI. Nvidias Programmierplattform CUDA ist der De-facto-Standard in der KI-Welt. Fast alle Tools und Frameworks, von Ollama über PyTorch bis zu TensorFlow, sind auf CUDA optimiert. Nvidia-GPUs haben zudem Tensor Cores, spezielle Recheneinheiten, die für KI-Mathematik optimiert sind und die Performance weiter steigern. Wenn Du keine Experimente machen willst, sondern einfach eine GPU kaufen willst, die funktioniert, nimm Nvidia. Der Nachteil ist der Preis, Nvidia-GPUs sind teurer als die Konkurrenz.
AMD: AMD ist der zweite große Spieler. AMDs Programmierplattform heißt ROCm und ist in den letzten Jahren deutlich besser geworden. Viele Tools, inklusive Ollama, unterstützen AMD-GPUs mittlerweile. Die Performance ist bei vergleichbaren Karten gut, und AMD-GPUs sind oft günstiger als Nvidia-Pendants. Der Nachteil ist, dass die Unterstützung nicht so breit und stabil ist wie bei CUDA. Manche Tools funktionieren nicht oder nur mit zusätzlicher Konfiguration. Wenn Du bereit bist, gelegentlich zu basteln, ist AMD eine gute Alternative.
Intel: Intel ist der dritte Anbieter, steckt aber bei KI-GPUs noch in den Anfängen. Intels Programmierplattform heißt oneAPI und wird aktiv entwickelt. Die neuen Intel Arc GPUs zeigen Potenzial, aber die Unterstützung in KI-Tools ist noch lückenhaft. Für lokale KI ist Intel aktuell keine Empfehlung für Anfänger. Wer experimentierfreudig ist und die neuesten Entwicklungen verfolgen will, kann einen Blick riskieren, aber mit Nvidia oder AMD bist Du besser bedient.
Beispiel: Dasselbe Modell auf CPU und GPU
Um den Unterschied greifbar zu machen, hier ein konkretes Beispiel. Wir nehmen Llama 3.1 8B, quantisiert auf 4-bit, und führen es auf drei verschiedenen Setups aus. Die Aufgabe ist dieselbe: Das Modell soll einen Absatz von 100 Wörern generieren.
Setup 1: CPU only, AMD Ryzen 5 5600, 32 GB RAM. Das Modell lädt in den RAM und läuft komplett auf der CPU. Die Geschwindigkeit beträgt etwa 5 Tokens pro Sekunde. Für 100 Wörter, also etwa 130 Tokens, braucht das Modell 26 Sekunden. Das ist langsam, aber das Ergebnis kommt. Für gelegentliche Nutzung akzeptabel, für interaktives Arbeiten frustrierend.
Setup 2: CPU plus GPU, AMD Ryzen 5 5600 plus Nvidia RTX 3060 mit 12 GB VRAM. Das Modell passt vollständig in den VRAM und läuft auf der GPU. Die Geschwindigkeit beträgt etwa 60 Tokens pro Sekunde. Für 130 Tokens braucht das Modell 2,2 Sekunden. Das ist flüssig und fühlt sich an wie eine Cloud-KI.
Setup 3: High-End-GPU, Nvidia RTX 4090 mit 24 GB VRAM. Das Modell läuft vollständig auf der GPU. Die Geschwindigkeit beträgt etwa 200 Tokens pro Sekunde. Für 130 Tokens braucht das Modell 0,65 Sekunden. Das ist praktisch verzögerungsfrei.
Der Unterschied zwischen Setup 1 und Setup 2 ist dramatisch. Die CPU allein braucht 26 Sekunden, die Kombination aus CPU und GPU braucht 2,2 Sekunden. Das ist ein Faktor von 12, und das bei einer Grafikkarte, die etwa 300 Euro kostet. Der Sprung von Setup 2 zu Setup 3 ist ebenfalls deutlich, aber hier steigt der Preis von 300 auf etwa 2000 Euro. Für die meisten Anwender ist eine RTX 3060 oder eine vergleichbare Karte der Sweet Spot.
Typische Stolpersteine bei CPU und GPU
- CPU und GPU gleichsetzen: Eine gute CPU macht keine schnelle KI. Auch ein teurer Ryzen 9 oder Intel Core i9 ist bei KI-Inferenz langsamer als eine durchschnittliche Grafikkarte. Das liegt an der Architektur, nicht an der Leistung der CPU.
- Zu wenig VRAM einkalkulieren: Eine schnelle GPU nützt nichts, wenn das Modell nicht in den VRAM passt. Dann fällt ein Teil auf die CPU zurück, und die Geschwindigkeit bricht ein. Mehr dazu unter RAM vs. VRAM.
- AMD-GPU ohne Recherche kaufen: AMD-GPUs funktionieren, aber nicht alle Tools unterstützen sie out of the box. Wer eine AMD-GPU kauft, sollte vorher prüfen, ob seine bevorzugten Tools ROCm unterstützen.
- Integrierte GPU mit dedizierter GPU verwechseln: Integrierte GPUs, also solche, die im Prozessor verbaut sind, nutzen Shared Memory und sind für KI kaum geeignet. Eine dedizierte Grafikkarte mit eigenem VRAM ist nötig.
- CPU-Kerne zählen und GPU-Kerne gleichsetzen: 16 CPU-Kerne sind nicht dasselbe wie 16 GPU-Kerne. Ein CPU-Kern ist viel leistungsfähiger als ein GPU-Kern. Die Stärke der GPU liegt in der Menge, nicht in der Einzelkraft.
- Speicherbandbreite ignorieren: Auch wenn die GPU genug VRAM hat, kann eine niedrige Speicherbandbreite das Modell ausbremsen. Das gilt besonders bei älteren Grafikkarten oder bei Shared Memory. Mehr dazu unter Speicherbandbreite.
- Quantisierung vergessen: Ohne Quantisierung brauchen Modelle deutlich mehr Speicher und sind langsamer. Mit 4-bit-Quantisierung laufen größere Modelle auf kleineren GPUs. Mehr dazu unter Quantisierung.
- GPU-Offloading falsch einschätzen: Wenn das Modell nicht vollständig in den VRAM passt, wird GPU-Offloading genutzt, also ein Teil auf der GPU, der Rest auf der CPU. Das funktioniert, ist aber deutlich langsamer, als wenn das Modell vollständig auf der GPU läuft. Mehr dazu unter GPU-Offloading.
Hardware, Kosten und Sicherheit bei CPU und GPU
Hardware: Für den Einstieg in lokale KI reicht eine Grafikkarte mit 8 GB VRAM, wenn Du hauptsächlich 7B-Modelle nutzt. Für 13B-Modelle empfiehlt sich 12 GB VRAM, für noch größere Modelle 24 GB VRAM oder Apple Silicon mit ausreichend Unified Memory. Die CPU spielt eine untergeordnete Rolle, solange sie modern ist und mindestens 6 bis 8 Kerne hat. Wichtiger als die CPU-Leistung ist, dass genug RAM vorhanden ist, um das Modell überhaupt zu laden. Die genauen Zahlen findest Du unter RAM und VRAM Anforderungen.
Kosten: Eine CPU, die für lokale KI ausreicht, kostet etwa 150 bis 300 Euro. Eine Grafikkarte, die einen echten Unterschied macht, kostet ab 300 Euro für eine RTX 3060 mit 12 GB VRAM, bis zu 2000 Euro für eine RTX 4090 mit 24 GB VRAM. AMD-Alternativen wie die RX 7600 mit 8 GB VRAM sind ab etwa 250 Euro erhältlich. Apple Silicon ist ein Sonderfall, weil Du den Speicher nicht separat kaufst, sondern den Mac mit dem gewünschten Unified Memory konfigurierst. Ein Mac Studio mit 64 GB Unified Memory ist teuer, aber im Vergleich zu einem High-End-GPU-Setup oft konkurrenzfähig. Die Kaufberatung hilft Dir bei der genauen Auswahl.
Sicherheit: Bei lokal betriebenen Modellen bleiben Deine Daten auf Deinem Rechner. Keine Anfrage geht an einen Server, keine Daten verlassen Dein System. Das ist ein großer Vorteil gegenüber Cloud-KI. Ob Du CPU oder GPU nutzt, spielt für die Sicherheit keine Rolle, wichtig ist nur, dass das Modell lokal läuft und keine externen APIs aufruft. Mehr dazu unter Was ist lokale KI?.
Weiterführende Links und Infos zu CPU und GPU
- KI-Hardware Grundlagen für mehr Basiswissen über Hardware für lokale KI
- RAM vs. VRAM für den Unterschied zwischen System- und Grafikspeicher
- GPU-Offloading wenn Du verstehen willst, wie Modelle zwischen CPU und GPU aufgeteilt werden
- Speicherbandbreite für den oft übersehenen Faktor bei der Performance
- Kaufberatung wenn Du eine neue Grafikkarte oder einen neuen Rechner planst
- Was ist lokale KI? für die Grundlagen lokaler KI
- RAM und VRAM Anforderungen für genaue Zahlen zu Modellgrößen
- Quantisierung wenn Du verstehen willst, wie Modelle verkleinert werden
- Ollama für das beliebteste Tool zum lokalen Ausführen von Modellen
FAQ: CPU vs. GPU - Typische Fragen
Kann ich lokale KI nur mit der CPU betreiben?
Ja, das ist möglich. Tools wie Ollama laufen auch ohne Grafikkarte. Die Geschwindigkeit ist bei größeren Modellen aber sehr niedrig. Für kleine Modelle mit 1 bis 3 Milliarden Parametern ist die CPU brauchbar, ab 7 Milliarden wird es langsam. Wenn Du nur testen willst, ob lokale KI für Dich interessant ist, reicht die CPU.
Warum ist die GPU so viel schneller als die CPU?
Die GPU hat tausende einfache Kerne, die Rechenoperationen massiv parallel ausführen können. Die CPU hat wenige, aber komplexe Kerne, die Aufgaben nacheinander bearbeiten. KI-Inferenz besteht aus sehr vielen einfachen, unabhängigen Rechenoperationen, wofür die GPU ideal ist. Dazu kommt die höhere Speicherbandbreite des VRAM.
Reicht eine integrierte GPU für lokale KI?
In den meisten Fällen nein. Integrierte GPUs nutzen Shared Memory vom RAM und haben eine niedrige Bandbreite. Für kleine Modelle kann es funktionieren, aber langsam. Für ernsthafte lokale KI lohnt sich eine dedizierte Grafikkarte mit eigenem VRAM oder Apple Silicon mit Unified Memory.
Brauche ich zwingend eine Nvidia-GPU?
Nein, aber Nvidia ist die einfachste Wahl. CUDA ist der Standard in der KI-Welt, und fast alle Tools sind darauf optimiert. AMD-GPUs mit ROCm funktionieren ebenfalls, erfordern aber manchmal mehr Konfiguration. Intel-GPUs stecken bei der KI-Unterstützung noch in den Anfängen. Wenn Du keine Experimente machen willst, nimm Nvidia.
Was sind Tensor Cores und brauche ich sie?
Tensor Cores sind spezielle Recheneinheiten in Nvidia-GPUs, die für KI-Mathematik optimiert sind. Sie können bestimmte Matrixoperationen deutlich schneller ausführen als normale GPU-Kerne. Für lokale KI sind sie hilfreich, aber nicht zwingend nötig. Alle modernen Nvidia-GPUs ab der RTX-20-Serie haben Tensor Cores.
Kann ich CPU und GPU gleichzeitig für ein Modell nutzen?
Ja, das nennt man GPU-Offloading. Wenn das Modell nicht vollständig in den VRAM passt, wird ein Teil auf der GPU und der Rest auf der CPU ausgeführt. Das funktioniert, ist aber langsamer, als wenn das Modell vollständig auf der GPU läuft. Mehr dazu unter GPU-Offloading.
Wie viel VRAM brauche ich für lokale KI?
Das hängt von der Modellgröße ab. Ein quantisiertes 7B-Modell braucht etwa 4 bis 5 GB VRAM, ein 13B-Modell etwa 8 bis 9 GB. Mit 12 GB VRAM bist Du für Modelle bis 13B auf der sicheren Seite, mit 24 GB kannst Du auch größere Modelle laufen. Die genauen Zahlen findest Du unter RAM und VRAM Anforderungen.
Macht eine teure CPU lokale KI schneller?
Nur marginal. Wenn das Modell auf der GPU läuft, spielt die CPU kaum eine Rolle. Eine sehr langsame CPU kann zum Flaschenhals werden, aber ab einer modernen Mittelklasse-CPU mit 6 bis 8 Kernen macht ein Upgrade kaum einen spürbaren Unterschied. Investiere lieber in eine bessere GPU oder mehr VRAM.
Lohnt sich Apple Silicon für lokale KI?
Ja, Apple Silicon ist eine sehr gute Wahl, wenn Du große Modelle lokal betreiben willst. Durch das Unified Memory kann die GPU auf den gesamten Arbeitsspeicher zugreifen, ohne die VRAM-Grenzen dedizierter Grafikkarten. Ein Mac mit 64 oder 128 GB Unified Memory kann Modelle laden, die auf keiner Consumer-Grafikkarte Platz finden. Der Nachteil ist der Preis und die geringere Speicherbandbreite im Vergleich zu High-End-GPUs.
Was ist besser: eine teure GPU oder zwei günstige?
In der Regel ist eine teure GPU besser. Multi-GPU-Setups funktionieren, aber sie sind komplexer zu konfigurieren, verbrauchen mehr Strom und nicht alle Tools skalieren linear über mehrere GPUs. Wenn Du eine RTX 4090 mit 24 GB VRAM mit zwei RTX 3060 mit jeweils 12 GB VRAM vergleichst, ist die einzelne 4090 in der Regel schneller und einfacher zu handhaben.
Kann ich auf der CPU trainieren statt nur Inferenz zu machen?
Theoretisch ja, praktisch nein. Training ist rechenaufwendiger als Inferenz und dauert auf einer CPU ein Vielfaches länger. Ein Training, das auf einer GPU eine Stunde dauert, kann auf einer CPU Tage oder Wochen brauchen. Für ernsthaftes Training brauchst Du eine GPU, am besten eine mit viel VRAM und Tensor Cores.
Quellen und weiterführende Literatur
- Nvidia CUDA und Tensor Core Dokumentation
- AMD ROCm Plattform Übersicht
- Intel oneAPI und Arc GPU Dokumentation
- Ollama Dokumentation zu CPU- und GPU-Unterstützung
- Erfahrungen und Benchmarks aus der lokalen KI-Community
- KI-Hardware Grundlagen für weiterführende Artikel


