KI-Hardware Grundlagen
Was dieser Artikel behandelt
- Welche Hardwarekomponenten für lokale KI wichtig sind und warum.
- Wie CPU, GPU, RAM, VRAM und SSD zusammenwirken.
- Was TOPS, APU und Unified Memory bedeuten.
- Verweise auf alle Grundlagen-Artikel und die Kaufberatung.
Einleitung
Wer KI-Modelle lokal betreiben will, braucht passende Hardware. Ein Sprachmodell ist eine große Datei, die in den Speicher geladen und dort verarbeitet wird. Ob das flüssig läuft, entscheiden CPU, GPU, RAM, VRAM und Speicher. Dieser Bereich sammelt Grundlagenwissen, das beim Verstehen, Zusammenstellen oder Kaufen eines KI-PCs hilft.
Warum brauche ich KI-Hardware-Grundlagen?
Ohne dieses Wissen kaufst Du blind. Du riskierst einen Rechner, der entweder zu schwach für Deine Modelle ist oder zu teuer für das, was Du eigentlich vorhast. Ein Beispiel: Wer Llama 3.1 8B laufen will, braucht etwa 8 GB Speicher für das quantisierte Modell. Auf einer GPU mit 8 GB VRAM läuft das flüssig. Auf einem Rechner mit nur 16 GB RAM und CPU-Inferenz dauert jede Antwort mehrere Sekunden. Wer das vorher weiß, spart Geld und Frust.
Die Grundlagen helfen Dir auch, Werbeversprechen einzuordnen. Ein Mini-PC mit 128 GB RAM klingt imposant, aber wenn die Speicherbandbreite niedrig ist, läuft ein großes Modell trotzdem langsam. TOPS-Werte auf dem Datenblatt sagen nicht alles, weil sie nur die Spitzenleistung unter idealen Bedingungen messen.
KI-Hardware kurz erklärt
Lokale KI lädt ein Modell in den Speicher und berechnet daraus Antworten. Dafür gibt es zwei Wege:
- CPU-Inferenz: Das Modell liegt im normalen Arbeitsspeicher (RAM). Die CPU berechnet die Antworten. Langsam, aber flexibel und günstig.
- GPU-Inferenz: Das Modell liegt im Grafikspeicher (VRAM). Die GPU berechnet die Antworten parallel und deutlich schneller.
Der Speicher entscheidet, welches Modell überhaupt passt. Die Rechenleistung entscheidet, wie schnell die Antworten kommen. Eine SSD sorgt dafür, dass das Modell schnell geladen wird. Eine APU wie Apple Silicon oder Ryzen AI Max vereint CPU und GPU auf einem Chip und teilt sich den Speicher.
Für wen ist dieser Bereich gedacht?
- Du willst lokal KI betreiben und wissen, was Dein Rechner leisten kann.
- Du überlegst, einen neuen PC oder Mini-PC zu kaufen.
- Du bist Einsteiger und möchtest Werbeversprechen besser einordnen.
- Du brauchst keine tiefen Vorkenntnisse. Technische Begriffe werden hier inline erklärt.
Wichtige Komponenten
| Komponente | Rolle | Worauf achten |
|---|---|---|
| CPU | Führt Inferenz und Betriebssystem aus | Moderne Kerne, viel Cache |
| RAM | Speichert Modelle bei CPU-Inferenz | 16 GB Minimum, 32 GB besser, 64-128 GB ideal |
| GPU/VRAM | Schnelle parallele Berechnung | 8 GB Minimum, 16 GB oder mehr besser |
| APU | CPU und GPU auf einem Chip | Unified oder Shared Memory nutzt gemeinsamen RAM |
| SSD | Schneller Speicher für Modelle | 500 GB oder mehr, vorzugsweise NVMe |
Wichtige Begriffe
- TOPS/NTOPS - Tera Operations Per Second. Die Maßeinheit für KI-Rechenleistung. Je höher der Wert, desto schneller kann ein Chip Modelle ausführen.
- APU - Accelerated Processing Unit: CPU und GPU auf einem Chip, wie bei Apple Silicon oder Ryzen AI Max.
- Unified/Shared Memory - Arbeitsspeicher wird von CPU und GPU gemeinsam genutzt. Wichtig für Apple Silicon und Ryzen AI Max.
- Quantisierung - Reduziert die Genauigkeit eines Modells, um es mit weniger Speicher laufen zu lassen. Ermöglicht größere Modelle auf kleinerer Hardware.
- VRAM - Speicher der dedizierten Grafikkarte. Entscheidend für GPU-Inferenz.
- LLM - Large Language Model, ein großes Sprachmodell.
Inhalt und Artikel
- RAM vs. VRAM - Was der Unterschied ist, wo Modelle liegen und warum beide für lokale KI wichtig sind.
- CPU vs. GPU - Welcher Prozessor für lokale KI schneller ist und wann die CPU reicht.
- GPU-Offloading - Wenn der VRAM nicht ausreicht: Modelle teils auf GPU, teils im RAM.
- Speicherbandbreite - Der wichtigste Faktor für KI-Inferenzgeschwindigkeit.
- Unified Memory - Wie Apple Silicon und Ryzen AI Max RAM und VRAM vereinen.
- Modellgröße und Speicherbedarf - Wie groß KI-Modelle wirklich sind und wie viel Speicher sie brauchen.
- Hardware richtig dimensionieren - Schritt-für-Schritt zum passenden KI-PC.
- KI-Grundlagen-Glossar - Alle wichtigen Begriffe von A bis Z verständlich erklärt.
Weitere verwandte Artikel:
- RAM- und VRAM-Anforderungen - Was braucht der Rechner konkret für lokale Modelle?
- Quantisierung - Wie große Modelle auf kleinere Hardware passen.
- KI-PC Einsteiger - Konkrete Kaufempfehlungen und Preisklassen.
- Kaufberatung Übersicht - Worauf beim Kauf zu achten ist.
Typische Stolpersteine
- RAM ist nicht VRAM - 32 GB RAM helfen wenig, wenn die GPU nur 4 GB VRAM hat. Für GPU-Inferenz zählt der Grafikspeicher.
- TOPS sagen nicht alles - Ein hoher TOPS-Wert bedeutet nicht automatisch, dass Dein Modell schnell läuft. Speicherbandbreite und Architektur sind genauso wichtig.
- Mini-PCs sind nicht aufrüstbar - Wer später mehr Speicher will, muss oft ein neues Gerät kaufen. Direkt genug RAM wählen.
- Apple Silicon ist effizient, aber nicht alles läuft nativ - Manche Open-Source-Modelle sind zuerst für CUDA optimiert und laufen unter Linux oder Windows mit Nvidia-GPU besser.
Weiterführende Links
FAQ - Häufige Fragen
Was ist der Unterschied zwischen RAM und VRAM?
RAM ist der Arbeitsspeicher des Rechners, VRAM der Speicher der Grafikkarte. Bei CPU-Inferenz liegt das Modell im RAM, bei GPU-Inferenz im VRAM. GPU-Inferenz ist deutlich schneller, braucht aber genug VRAM. Mehr dazu im Artikel RAM vs. VRAM.
Was ist wichtiger: RAM oder VRAM?
Beides. CPU-basierte Inferenz braucht viel RAM, GPU-basierte Inferenz vor allem VRAM. Für größere Modelle ist eine Grafikkarte mit ausreichend VRAM meist schneller.
Was bedeutet TOPS?
TOPS steht für Tera Operations Per Second. Es misst, wie viele Rechenoperationen ein Chip für KI-Aufgaben pro Sekunde durchführen kann. Höhere Werte bedeuten potenziell schnellere KI-Inferenz, aber Speicherbandbreite und Architektur sind genauso wichtig.
Brauche ich eine Grafikkarte für lokale KI?
Nicht zwingend. Kleine Modelle wie Llama 3.1 8B laufen auch auf der CPU. Für schnellere Antworten und größere Modelle ist eine GPU mit ausreichend VRAM empfohlen.
Was ist eine APU?
Eine APU vereint CPU und GPU auf einem Chip. Beispiele sind Apple Silicon und AMD Ryzen AI Max. Der Vorteil ist, dass beide Prozessoren auf denselben Speicher zugreifen können, was bei lokaler KI sehr hilfreich ist.
Was ist Unified Memory?
Bei Unified Memory teilen sich CPU und GPU denselben Arbeitsspeicher. Das bedeutet, dass ein Mac mit 32 GB RAM diese 32 GB auch für die GPU nutzen kann. Bei einer klassischen Grafikkarte ist der VRAM separat und begrenzt.
Wie viel RAM brauche ich für lokale KI?
Für 7B-Modelle mindestens 16 GB RAM, besser 32 GB. Größere Modelle wie 70B benötigen 64 GB oder mehr. Mit Cloud-APIs reicht der Speicher für das Framework selbst.
Wie viel VRAM brauche ich für lokale KI?
Für quantisierte 7B-Modelle mindestens 8 GB VRAM. Für 13B-Modelle 12 GB oder mehr. 70B-Modelle benötigen 24 GB oder mehr, oft mehrere GPUs.
Warum ist eine SSD wichtig?
Ein Sprachmodell kann mehrere Gigabyte groß sein. Eine NVMe-SSD lädt das Modell deutlich schneller als eine HDD. Das verkürzt die Startzeit und sorgt für flüssigeres Arbeiten.
Lohnt sich ein Mini-PC für lokale KI?
Ja, wenn Du kompakte und stromsparende Hardware suchst. Mini-PCs mit Ryzen AI Max oder Apple Silicon bieten viel Speicher auf kleinem Raum. Achte darauf, direkt genug RAM zu wählen, da Mini-PCs oft nicht aufrüstbar sind.
Wo finde ich Kaufberatung?
Im Bereich KI-Hardware Kaufberatung finden sich Empfehlungen für Einsteiger-Systeme. Der Artikel KI-PC Einsteiger bietet konkrete Modelle und Preisklassen.
Was ist Quantisierung und was hat sie mit Hardware zu tun?
Quantisierung reduziert die Genauigkeit eines Modells, um es mit weniger Speicher laufen zu lassen. Dadurch passen größere Modelle auf kleinere Hardware. Mehr dazu im Artikel Quantisierung.


