Skip to content
BotServBotServ
HardwareDimensionierungKI-PCVRAMRAMGPUKaufberatungPlanung

Hardware richtig dimensionieren: KI-PC planen

Wie dimensioniere ich Hardware für lokale KI richtig? VRAM, RAM, CPU, SSD und Strom passend zum Wunschmodell wählen. Praxisguide mit Rechenbeispielen.

S

schutzgeist

17 min read
Hardware richtig dimensionieren für lokale KI

Hardware richtig dimensionieren: KI-PC planen

Was dieser Artikel über Hardware-Planung behandelt

  • Wie Du Hardware für lokale KI von Grund auf planst, angefangen beim Wunschmodell
  • Welche Formel Dir hilft, den VRAM-Bedarf eines Modells zu berechnen
  • Wie GPU, RAM, CPU, SSD und Netzteil zusammenhängen und sich gegenseitig beeinflussen
  • Drei Beispielrechnungen für Budgets unter 500, 500 bis 1500 und 1500 bis 3000 Euro
  • Eine Checkliste und typische Stolpersteine, damit Du beim Kauf keine Fehler machst

Einleitung: Hardware richtig dimensionieren verständlich erklärt

Wer sich für lokale KI interessiert, steht schnell vor einer scheinbar einfachen Frage: Welchen Rechner brauche ich eigentlich? Die Antwort ist weniger offensichtlich, als sie klingt. Ein beliebter Gaming-PC ist nicht automatisch ein guter KI-PC, und ein teurer Workstation-Rechner kann für Deine Zwecke überdimensioniert sein. Die richtige Dimensionierung beginnt nicht bei der Grafikkarte, sondern bei einer ganz anderen Frage: Welches Modell willst Du ausführen?

Wenn Du Dich durch die KI-Hardware Grundlagen arbeitest, trifft Du auf Begriffe wie VRAM, Speicherbandbreite und GPU-Offloading. Jeder dieser Begriffe beschreibt ein Puzzleteil, das bei der Hardware-Planung eine Rolle spielt. Dieser Artikel führt alle Teile zusammen und zeigt Dir Schritt für Schritt, wie Du einen KI-PC planst, der zu Deinen Anforderungen passt. Nicht mehr und nicht weniger.

Du brauchst kein Vorwissen. Wir gehen jeden Schritt einzeln durch, vom Wunschmodell über die VRAM-Berechnung bis zum Netzteil. Am Ende hast Du einen Plan, den Du direkt umsetzen kannst.

Warum brauche ich eine richtige Dimensionierung?

Stell Dir vor, Du kaufst einen Rechner für 1500 Euro. Eine starke CPU, 32 GB RAM, eine schicke Grafikkarte mit 8 GB VRAM. Der Verkäufer verspricht Dir, der Rechner sei perfekt für KI. Du installierst Ollama, lädst ein Modell mit 13 Milliarden Parametern und startest es. Danach wartest Du. Jede Antwort dauert mehrere Sekunden, das Modell ruckelt, und Du fragst Dich, warum der teure Rechner nicht besser funktioniert. Das Problem: 8 GB VRAM reichen für ein 13B-Modell nicht aus, und das Modell fällt auf die CPU zurück.

Das andere Extrem: Du gibst 3000 Euro aus, kaufst die größte Grafikkarte, die Du findest, und nutzt am Ende nur 7B-Modelle, die auch auf einer Karte für 300 Euro laufen würden. Du hast 2200 Euro verschwendet, weil Du die Dimensionierung nicht durchdacht hast.

Beide Szenarien haben dieselbe Ursache. Die Hardware wurde nicht auf das Wunschmodell abgestimmt. Die richtige Dimensionierung spart Geld, vermeidet Frustration und sorgt dafür, dass Dein Rechner genau das kann, was Du von ihm erwartest. Wenn Du die Grundlagen von RAM vs. VRAM und CPU vs. GPU kennst, hast Du bereits das Rüstzeug. Dieser Artikel zeigt Dir, wie Du das Wissen anwendest.

Hardware-Planung kurz erklärt

Hardware-Planung für lokale KI bedeutet, jeden Bauteil so zu wählen, dass er zum Wunschmodell passt. Du fängst beim Modell an und arbeitest Dich nach unten vor. Erst das Modell bestimmt den VRAM-Bedarf. Der VRAM-Bedarf bestimmt die GPU. Die GPU bestimmt den Strombedarf. Der Strombedarf bestimmt das Netzteil. Und nebenbei müssen RAM, CPU und SSD so dimensioniert sein, dass sie nicht zum Flaschenhals werden.

Ein einfaches Bild: Stell Dir vor, Du baust ein Haus. Bevor Du Ziegel bestellst, musst Du wissen, wie viele Menschen darin wohnen werden. Eine Familie mit zwei Kindern braucht ein anderes Haus als ein Single. Wenn Du zuerst Ziegel kaufst und danach überlegst, wer einziehen soll, baust Du entweder ein zu kleines oder ein zu großes Haus. Bei der Hardware-Planung ist das Wunschmodell die Familie, und die Bauteile sind die Ziegel. Du planst von der Nutzung her, nicht von den Bauteilen.

Für wen ist dieser Artikel gedacht?

Dieser Artikel richtet sich an Einsteiger, die einen Rechner für lokale KI planen oder kaufen wollen. Wenn Du Dich fragst, welche Grafikkarte Du brauchst, wie viel RAM ausreicht und ob Deine aktuelle CPU überhaupt eine Rolle spielt, bist Du hier richtig. Du brauchst kein technisches Vorwissen, aber es hilft, die Grundlagen aus KI-Hardware Grundlagen grob zu kennen.

Auch wenn Du schon erste Versuche mit Ollama gemacht hast und jetzt über ein Upgrade nachdenkst, hilft Dir dieser Artikel. Die Beispielrechnungen und die Checkliste am Ende geben Dir konkrete Anhaltspunkte, damit Du nicht blind kaufst.

Wichtige Begriffe rund um Hardware-Planung

BegriffBedeutung
VRAMSpeicher auf der Grafikkarte, exklusiv für die GPU, entscheidend für die Modellgröße
RAMArbeitsspeicher des Systems, genutzt von CPU und allen Programmen
GPUProzessor auf der Grafikkarte mit vielen parallelen Kernen, ideal für KI
CPUHauptprozessor mit weniger, aber flexibleren Kernen
SSDSchneller Datenspeicher, auf dem die Modelle liegen
NVMeBesonders schnelle SSD, die direkt über PCIe angeschlossen wird
TDPThermal Design Power, die Wärmeleistung, die ein Bauteil abgibt
WattMaßeinheit für Leistung, hier für den Stromverbrauch des Rechners
PSUPower Supply Unit, das Netzteil, das den Rechner mit Strom versorgt
Form FactorBauform eines Bauteils, z. B. ATX für Mainboards oder Dual-Slot für Grafikkarten

Schritt 1: Wunschmodell festlegen

Der erste Schritt ist der wichtigste und wird am häufigsten übersprungen. Bevor Du irgendwelche Bauteile aussuchst, musst Du wissen, welches Modell Du ausführen willst. Das Modell bestimmt alles andere, vom VRAM über die GPU bis zum Netzteil.

Fang mit einer einfachen Frage an: Was willst Du mit der KI machen? Soll sie Dir beim Schreiben helfen, Code generieren oder Dokumente zusammenfassen? Für einfache Textaufgaben reicht oft ein 7B-Modell wie Llama 3.1 8B oder Mistral 7B. Für anspruchsvollere Aufgaben, wie etwa das Zusammenfassen längerer Dokumente oder das Beantworten komplexer Fragen, lohnt sich ein 13B- oder 14B-Modell. Für sehr anspruchsvolle Aufgaben, etwa mehrsprachige Übersetzungen oder tiefgehende Reasoning-Aufgaben, denkst Du über ein 70B-Modell nach.

Wenn Du Dir unsicher bist, fang klein an. Ein 7B-Modell läuft auf fast jeder modernen Grafikkarte und gibt Dir einen Eindruck, was lokale KI kann. Du kannst später immer auf ein größeres Modell wechseln, ohne die Hardware zu ändern, solange Du bei der Planung etwas Spielraum lässt. Mehr zu den Zusammenhängen findest Du unter Modellgröße und Speicherbedarf.

Schritt 2: VRAM berechnen

Sobald Du Dein Wunschmodell kennst, berechnest Du den VRAM-Bedarf. Die Faustregel für quantisierte Modelle, wie sie typischerweise mit Ollama geladen werden, lautet:

VRAM-Bedarf in GB = Parameterzahl in Milliarden x 0,6 bis 0,8

Der Faktor hängt von der Quantisierung ab. Bei 4-bit-Quantisierung rechne mit etwa 0,6 GB pro Milliarde Parameter. Bei 5-bit mit etwa 0,7 GB, bei 6-bit mit etwa 0,8 GB. Mehr zur Quantisierung findest Du im Artikel Quantisierung.

Dazu kommen noch etwa 1 bis 2 GB für den sogenannten Context, also den Verlauf Deiner Unterhaltung. Je länger der Context, desto mehr Speicher braucht er.

Beispiele:

  • 7B-Modell, 4-bit: 7 x 0,6 = 4,2 GB, plus 1 GB Context, also etwa 5 GB VRAM
  • 13B-Modell, 4-bit: 13 x 0,6 = 7,8 GB, plus 1 GB Context, also etwa 9 GB VRAM
  • 70B-Modell, 4-bit: 70 x 0,6 = 42 GB, plus 2 GB Context, also etwa 44 GB VRAM

Addiere noch einen Sicherheitspuffer von 10 bis 20 Prozent, damit das Modell auch bei längeren Unterhaltungen stabil läuft. Genauere Zahlen findest Du unter RAM und VRAM Anforderungen.

Schritt 3: GPU wählen

Die GPU ist das Herzstück Deines KI-PCs. Sie bestimmt, wie schnell das Modell läuft und wie groß es sein darf. Die wichtigste Kennzahl ist der VRAM, denn ohne ausreichenden VRAM nützt die schnellste GPU nichts. Erst danach schaust Du auf Rechenleistung und Speicherbandbreite.

Nvidia: Nvidia ist die einfachste Wahl, weil die meisten Tools und Frameworks auf Nvidia optimiert sind. Die CUDA-Bibliothek ist der De-facto-Standard in der KI-Welt. Consumer-Karten wie die RTX 4060 mit 8 GB, die RTX 4070 mit 12 GB oder die RTX 4090 mit 24 GB decken die meisten Anwendungsfälle ab. Der Nachteil ist der Preis, besonders bei Karten mit viel VRAM.

AMD: AMD-GPUs funktionieren ebenfalls, erfordern aber manchmal mehr Konfiguration. Mit Tools wie ROCm hat sich die Situation verbessert, aber Nvidia bleibt die unkompliziertere Wahl. Wenn Du bereits eine AMD-Karte hast, lohnt sich ein Versuch. Wenn Du neu kaufst und KI im Fokus steht, ist Nvidia meist die sicherere Entscheidung.

Apple Silicon: Macs mit M-Chips nutzen Unified Memory, bei dem CPU und GPU sich einen gemeinsamen Speicher teilen. Ein Mac Studio mit 64 oder 128 GB Unified Memory kann Modelle laden, die auf keiner Consumer-Grafikkarte Platz finden. Das ist eine starke Option, wenn Du große Modelle betreiben willst, ohne mehrere Grafikkarten zu kaufen. Mehr dazu unter Unified Memory.

Wähle die GPU so, dass der berechnete VRAM-Bedarf plus Sicherheitspuffer hineinpasst. Wenn Dein 13B-Modell 9 GB braucht, wähle eine Karte mit 12 GB VRAM. Wenn Dein 7B-Modell 5 GB braucht, reicht 8 GB VRAM. Mehr zur Auswahl findest Du in der Kaufberatung.

Schritt 4: RAM dimensionieren

Der RAM ist der Arbeitsspeicher Deines Systems. Er spielt für die Geschwindigkeit der Inferenz eine untergeordnete Rolle, solange das Modell vollständig in den VRAM passt. Er wird aber wichtig, wenn das Modell nicht in den VRAM passt und Teile auf die CPU ausweichen müssen. Das nennt man GPU-Offloading, mehr dazu im Artikel GPU-Offloading.

Die Faustregel lautet: Plane mindestens das Doppelte des VRAM-Bedarfs als RAM. Wenn Dein Modell 9 GB VRAM braucht, plane mindestens 18 GB RAM, aufgerundet 32 GB. So hat das System genug Platz, um das Modell vollständig im RAM zu halten, falls die GPU nicht ausreicht, und daneben noch normal zu funktionieren.

DDR4 vs. DDR5: DDR5 ist schneller als DDR4 und bietet eine höhere Speicherbandbreite. Das hilft besonders, wenn das Modell teilweise auf der CPU läuft, weil die CPU dann schneller auf die Daten zugreift. Wenn Du ohnehin ein neues System baust, wähle DDR5. Wenn Du einen bestehenden Rechner aufrüstest, prüfe, ob Dein Mainboard DDR5 unterstützt. DDR4 ist nicht falsch, aber DDR5 ist die zukunftssicherere Wahl. Mehr zum Zusammenhang findest Du unter Speicherbandbreite.

Schritt 5: CPU und Mainboard

Die CPU spielt für die Inferenz eine untergeordnete Rolle, solange das Modell auf der GPU läuft. Sie wird aber wichtig, wenn Teile des Modells auf die CPU ausweichen, und sie bestimmt, wie schnell das Modell aus dem RAM in den VRAM geladen wird. Eine moderne CPU mit ausreichend Kernen sorgt dafür, dass das System insgesamt flüssig bleibt.

Wähle eine CPU aus einer aktuellen Generation, etwa einen AMD Ryzen 5 oder 7 oder einen Intel Core i5 oder i7. Du brauchst kein Top-Modell, aber vermeide sehr alte oder sehr schwache CPUs. Wichtig ist, dass die CPU genug PCIe-Lanes bietet, damit die GPU mit voller Geschwindigkeit kommunizieren kann. Die meisten modernen CPUs bieten das, aber bei sehr günstigen Modellen kann es Einschränkungen geben.

Das Mainboard muss zur CPU passen, also den richtigen Sockel haben, und genug PCIe-Slots bieten. Wenn Du später eine zweite Grafikkarte einbauen willst, achte auf zwei x16-Slots, auch wenn die zweite Karte oft nur mit reduzierter Geschwindigkeit läuft. Prüfe außerdem, ob das Mainboard DDR5 unterstützt, falls Du DDR5-RAM planst.

Schritt 6: SSD und Speicher

Die SSD ist der Ort, an dem Deine Modelle liegen. Jedes Modell ist eine Datei, und diese Datei muss beim Start in den RAM und von dort in den VRAM geladen werden. Je schneller die SSD, desto kürzer die Ladezeit. Eine langsame Festplatte macht sich nicht während der Inferenz bemerkbar, aber beim Start jedes Modells.

Wähle eine NVMe-SSD, die direkt über PCIe angeschlossen wird. NVMe-SSDs sind deutlich schneller als SATA-SSDs und reduzieren die Ladezeit spürbar. Eine typische NVMe-SSD liest mit 3000 bis 7000 MB/s, eine SATA-SSD nur mit etwa 500 MB/s.

Wie viel Speicher brauchst Du? Ein quantisiertes 7B-Modell ist etwa 4 bis 5 GB groß, ein 13B-Modell etwa 8 bis 9 GB, ein 70B-Modell etwa 40 GB. Wenn Du mehrere Modelle speichern willst, plane mindestens 1 TB. Modelle nehmen schnell Platz, und Du wirst wahrscheinlich mehr ausprobieren, als Du ursprünglich geplant hast. 2 TB sind eine komfortable Größe, die Dir Luft lässt.

Schritt 7: Netzteil und Kühlung

Das Netzteil versorgt Deinen Rechner mit Strom. Wenn es zu schwach ist, stürzt der Rechner unter Last ab, was besonders bei langen Inferenzläufen ärgerlich ist. Wenn es zu stark dimensioniert ist, verschwendest Du Geld. Die richtige Größe berechnest Du aus dem Stromverbrauch aller Bauteile.

Addiere die TDP-Werte aller Bauteile. Eine typische Konfiguration sieht so aus:

GPU: 200 W
CPU: 100 W
RAM, Mainboard, SSD: 50 W
Gesamt: 350 W

Addiere 30 bis 50 Prozent Sicherheitspuffer, damit das Netzteil nicht dauerhaft am Limit läuft. Für 350 W Gesamtverbrauch wähle ein Netzteil mit 500 bis 600 W. Für eine RTX 4090 mit 450 W TDP brauchst Du mindestens 850 W, besser 1000 W.

Achte auf die Effizienzklasse. Ein Netzteil mit 80-Plus-Gold-Zertifizierung ist effizienter und läuft kühler als ein günstiges Netzteil ohne Zertifizierung. Das spart Strom und verlängert die Lebensdauer.

Die Kühlung hält Deine Bauteile im sicheren Temperaturbereich. Die GPU hat meist eine eigene Kühlung, aber der Rechner insgesamt braucht ausreichend Gehäuselüfter, damit die warme Luft nach draußen transportiert wird. Achte auf ein Gehäuse mit guter Luftführung und mindestens zwei bis drei Lüftern. Wenn die GPU zu heiß wird, taktet sie ab und wird langsamer, was die Inferenzgeschwindigkeit direkt beeinflusst.

Beispielrechnungen für 3 Budgets

Hier sind drei Beispielrechnungen, damit Du ein Gefühl für die Größenordnungen bekommst. Die Preise sind Richtwerte und können schwanken.

Unter 500 Euro: In dieser Preisklasse baust Du keinen reinen KI-PC, sondern nutzt, was Du hast, oder kaufst gebraucht. Eine gebrauchte Nvidia RTX 3060 mit 12 GB VRAM kostet etwa 200 Euro. Dazu ein einfacher Rechner mit 16 GB RAM und einer NVMe-SSD. Damit laufen 7B-Modelle flüssig und 13B-Modelle mit GPU-Offloading. Eine Alternative ist ein Mac Mini M4 mit 16 GB Unified Memory, der ab etwa 700 Euro startet, also knapp über dem Budget liegt, aber eine sehr kompakte Lösung ist. Mehr zum Einstieg findest Du unter KI-PC Einsteiger.

500 bis 1500 Euro: In dieser Preisklasse bekommst Du einen ordentlichen KI-PC. Eine Nvidia RTX 4060 mit 8 GB VRAM kostet etwa 300 Euro, eine RTX 4070 mit 12 GB VRAM etwa 550 Euro. Dazu eine aktuelle CPU, 32 GB DDR5-RAM, eine 1 TB NVMe-SSD und ein 650-W-Netzteil. Damit laufen 7B-Modelle flüssig und 13B-Modelle vollständig in den VRAM, wenn Du die 12-GB-Karte wählst. Ein solcher Rechner kostet komplett etwa 1000 bis 1300 Euro.

1500 bis 3000 Euro: Hier denkst Du über eine RTX 4090 mit 24 GB VRAM nach, die etwa 2000 Euro kostet. Damit laufen 13B- und 14B-Modelle problemlos, und auch 30B-Modelle passen in den VRAM. Für 70B-Modelle reicht es nicht, hier brauchst Du Multi-GPU oder Apple Silicon. Alternativ kaufst Du zwei RTX 4070 mit jeweils 12 GB VRAM, was zusammen 24 GB ergibt, aber mehr Komplexität und Stromverbrauch mit sich bringt. Ein Mac Studio mit 64 GB Unified Memory kostet ab etwa 2400 Euro und ist für große Modelle oft die bessere Wahl.

Checkliste: Hardware-Kauf für KI

  • Wunschmodell festgelegt, inklusive Parameterzahl und Quantisierung
  • VRAM-Bedarf berechnet, inklusive Context und Sicherheitspuffer
  • GPU gewählt, deren VRAM den berechneten Bedarf abdeckt
  • RAM mindestens das Doppelte des VRAM-Bedarfs, aufgerundet auf gängige Größen
  • CPU aus aktueller Generation, genug PCIe-Lanes für die GPU
  • Mainboard mit passendem Sockel und DDR5-Unterstützung, falls geplant
  • NVMe-SSD mit mindestens 1 TB, besser 2 TB
  • Netzteil mit 30 bis 50 Prozent Sicherheitspuffer über dem berechneten Verbrauch
  • Gehäuse mit guter Luftführung und mindestens zwei bis drei Lüftern
  • Effizienzklasse des Netzteils geprüft, mindestens 80-Plus-Gold
  • Gesamtbudget mit Puffer für Kabel, Kühlung und unerwartete Kosten

Typische Stolpersteine bei der Hardware-Planung

  • Mit der GPU anfangen statt mit dem Modell: Wer zuerst eine Grafikkarte aussucht und danach überlegt, welches Modell er laufen will, plant rückwärts. Die GPU folgt aus dem Modell, nicht umgekehrt.
  • VRAM-Bedarf unterschätzen: Der Context braucht zusätzlichen Speicher, und bei längeren Unterhaltungen wächst er. Wer nur die Modellgröße berechnet, läuft Gefahr, dass das Modell bei langen Gesprächen abstürzt.
  • RAM zu knapp dimensionieren: Wenn der VRAM nicht ausreicht, braucht die CPU genug RAM, um die restlichen Modellteile zu halten. Zu wenig RAM führt dazu, dass das Modell gar nicht startet.
  • Netzteil zu schwach gewählt: Ein zu schwaches Netzteil führt zu Abstürzen unter Last. Das ist besonders ärgerlich, weil es unregelmäßig auftritt und schwer zu diagnostizieren ist.
  • Kühlung vernachlässigen: Eine zu heiße GPU takelt ab und wird langsamer. Das bemerkst Du nicht sofort, aber die Inferenzgeschwindigkeit sinkt spürbar.
  • Langsame SSD verwendet: Eine SATA-SSD oder gar eine HDD macht das Laden großer Modelle quälend langsam. NVMe ist Pflicht für einen KI-PC.
  • Quantisierung ignoriert: Wer Modelle ohne Quantisierung lädt, braucht deutlich mehr VRAM. Mit 4-bit-Quantisierung passen viel größere Modelle in den VRAM, bei kaum spürbarem Qualitätsverlust.
  • Aufrüstbarkeit von VRAM erwarten: VRAM lässt sich nicht nachrüsten. Wer mehr VRAM will, muss eine neue Grafikkarte kaufen. Plane daher von vornherein mit etwas Spielraum.

Hardware, Kosten und Sicherheit bei der Dimensionierung

Hardware: Die richtige Dimensionierung beginnt beim Wunschmodell und endet beim Netzteil. Jeder Bauteil muss zum Modell passen, sonst entsteht entweder ein Flaschenhals oder verschwendetes Geld. Die GPU ist das wichtigste Bauteil, aber RAM, SSD und Netzteil dürfen nicht vernachlässigt werden. Ein starker KI-PC ist nur so gut wie sein schwächstes Glied.

Kosten: Die GPU ist der größte Kostenfaktor. Eine RTX 4060 mit 8 GB kostet etwa 300 Euro, eine RTX 4090 mit 24 GB etwa 2000 Euro. RAM ist günstig, typisch 3 bis 5 Euro pro GB. NVMe-SSDs kosten etwa 50 bis 80 Euro pro TB. Das Netzteil sollte nicht am falschen Ende gespart werden, ein gutes 650-W-Netzteil kostet etwa 80 bis 120 Euro. Insgesamt liegt ein solider KI-PC bei 1000 bis 1500 Euro, ein High-End-Setup bei 2500 bis 3000 Euro.

Sicherheit: Bei lokal betriebenen Modellen bleiben Deine Daten auf Deinem Rechner. Keine Anfrage geht an einen Server, keine Daten verlassen Dein System. Das ist ein großer Vorteil gegenüber Cloud-KI. Die Dimensionierung spielt hierfür keine direkte Rolle, wichtig ist nur, dass das Modell lokal läuft und keine externen APIs aufruft.

FAQ: Hardware richtig dimensionieren - Typische Fragen

Wie fange ich mit der Hardware-Planung an?

Der erste Schritt ist immer das Wunschmodell. Überlege, was Du mit der KI machen willst, wähle ein Modell aus und berechne den VRAM-Bedarf. Erst danach schaust Du Dir Grafikkarten an. Wenn Du rückwärts planst, also zuerst eine GPU kaufst und danach suchst, was darauf läuft, verschwendest Du oft Geld.

Wie berechne ich den VRAM-Bedarf eines Modells?

Für quantisierte Modelle gilt die Faustregel: Parameterzahl in Milliarden mal 0,6 bis 0,8 GB, je nach Quantisierung. Dazu kommen 1 bis 2 GB für den Context und ein Sicherheitspuffer von 10 bis 20 Prozent. Ein 7B-Modell mit 4-bit-Quantisierung braucht etwa 5 GB, ein 13B-Modell etwa 9 GB.

Wie viel RAM brauche ich für lokale KI?

Plane mindestens das Doppelte des VRAM-Bedarfs als RAM. Wenn Dein Modell 9 GB VRAM braucht, wähle mindestens 18 GB RAM, aufgerundet 32 GB. So hat das System genug Platz, um das Modell vollständig im RAM zu halten, falls die GPU nicht ausreicht.

Reicht eine CPU ohne dedizierte Grafikkarte?

Für kleine 7B-Modelle funktioniert eine CPU mit ausreichend RAM, aber langsam. Für ernsthafte lokale KI lohnt sich eine dedizierte Grafikkarte oder Apple Silicon. Die GPU ist deutlich schneller als die CPU, weil sie tausende parallele Kerne hat.

Lohnt sich DDR5-RAM für lokale KI?

Ja, besonders wenn das Modell teilweise auf der CPU läuft. DDR5 bietet eine höhere Speicherbandbreite als DDR4, was die CPU-basierte Inferenz beschleunigt. Wenn Du ein neues System baust, wähle DDR5. Bei einem bestehenden Rechner prüfe, ob Dein Mainboard DDR5 unterstützt.

Wie stark muss das Netzteil sein?

Addiere die TDP-Werte aller Bauteile und addiere 30 bis 50 Prozent Sicherheitspuffer. Für eine typische Konfiguration mit 350 W Gesamtverbrauch wähle ein Netzteil mit 500 bis 600 W. Für eine RTX 4090 brauchst Du mindestens 850 W, besser 1000 W.

Brauche ich eine NVMe-SSD oder reicht eine SATA-SSD?

Eine NVMe-SSD ist empfehlenswert, weil sie das Laden großer Modelle deutlich beschleunigt. Eine SATA-SSD funktioniert, ist aber etwa sechsmal langsamer. Bei einem 40 GB großen Modell macht das einen spürbaren Unterschied beim Start.

Kann ich später aufrüsten?

RAM und SSD lassen sich problemlos aufrüsten. VRAM hingegen nicht, er ist fest auf der Grafikkarte verlötet. Wenn Du mehr VRAM brauchst, musst Du eine neue Grafikkarte kaufen. Plane daher von vornherein mit etwas Spielraum.

Lohnt sich Apple Silicon für lokale KI?

Ja, besonders wenn Du große Modelle betreiben willst. Apple Silicon nutzt Unified Memory, bei dem die GPU auf den gesamten Arbeitsspeicher zugreifen kann. Ein Mac Studio mit 64 oder 128 GB Unified Memory kann Modelle laden, die auf keiner Consumer-Grafikkarte Platz finden.

Wie viel Speicherplatz brauche ich für Modelle?

Ein quantisiertes 7B-Modell ist etwa 4 bis 5 GB groß, ein 13B-Modell etwa 8 bis 9 GB, ein 70B-Modell etwa 40 GB. Plane mindestens 1 TB, besser 2 TB, damit Du mehrere Modelle speichern kannst, ohne ständig Platz zu schaffen.

Was passiert, wenn das Netzteil zu schwach ist?

Ein zu schwaches Netzteil führt zu Abstürzen unter Last, besonders bei langen Inferenzläufen. Das ist schwer zu diagnostizieren, weil es unregelmäßig auftritt. Wähle das Netzteil immer mit Sicherheitspuffer und achte auf eine gute Effizienzklasse.

Soll ich eine Nvidia- oder eine AMD-GPU kaufen?

Nvidia ist die einfachste Wahl, weil die meisten Tools und Frameworks auf Nvidia optimiert sind. AMD-GPUs funktionieren ebenfalls, erfordern aber manchmal mehr Konfiguration. Wenn Du neu kaufst und KI im Fokus steht, ist Nvidia meist die sicherere Entscheidung.

Quellen und weiterführende Literatur

  • Nvidia Spezifikationen zu RTX 4060, 4070 und 4090
  • AMD Ryzen Spezifikationen und PCIe-Lanes
  • Apple Silicon Unified Memory Übersicht
  • Ollama Dokumentation zu Modellladung und GPU-Offloading
  • Erfahrungen aus der lokalen KI-Community zu Hardware-Konfigurationen
Zurück zum KI Blog
Share:

Ähnliche Beiträge