RAM vs. VRAM
Was dieser Artikel über RAM vs. VRAM behandelt
- Den Unterschied zwischen RAM und VRAM und warum beide für lokale KI wichtig sind
- Wie ein Modell vom Speicherlaufwerk über den RAM in den VRAM gelangt
- Was passiert, wenn der VRAM nicht ausreicht, und wie GPU-Offloading funktioniert
- Wie Apple Silicon und APUs mit Unified Memory das Spiel verändern
- Konkrete Empfehlungen, welches Setup für welche Modellgröße reicht
Einleitung: RAM vs. VRAM verständlich erklärt
Wer KI-Modelle lokal auf dem eigenen Rechner betreibt, trifft früh auf zwei Speicherarten, die oft verwechselt werden: RAM und VRAM. Beide sind Arbeitsspeicher, beide halten Daten für den Prozessor bereit, aber sie sitzen an unterschiedlichen Orten und haben sehr unterschiedliche Geschwindigkeiten. Genau dieser Unterschied entscheidet, ob ein Modell flüssig läuft oder ob Du Sekunden auf jedes Wort wartest.
Wenn Du Dich mit lokaler KI beschäftigst, kommst Du nicht daran vorbei. Tools wie Ollama geben Dir zwar die Möglichkeit, Modelle mit einem Befehl zu starten, aber ob das Ergebnis schnell oder quälend langsam ist, hängt davon ab, wo das Modell im Speicher landet. Ein grundlegendes Verständnis von RAM und VRAM hilft Dir, die richtige Hardware zu kaufen, die richtigen Modelle auszuwählen und Frustration zu vermeiden.
Warum brauche ich dieses Wissen?
Stell Dir vor, Du kaufst einen neuen PC. 32 GB RAM, eine ordentliche CPU, eine Grafikkarte mit 4 GB VRAM. Der Verkäufer sagt Dir, der Rechner sei perfekt für KI. Du installierst Ollama, lädst ein Modell mit 13 Milliarden Parametern und startest es. Danach wartest Du. Jede Antwort dauert zehn Sekunden oder länger. Der Rechner ist nicht langsam, das Modell ist nicht kaputt, aber der VRAM ist einfach zu klein für dieses Modell.
Das ist ein klassischer Fehler, den viele machen. RAM und VRAM werden oft in einen Topf geworfen, weil beide in Gigabyte angegeben werden. Aber 32 GB RAM helfen Dir wenig, wenn die GPU nur 4 GB VRAM hat. Das Modell wird dann teilweise im RAM ausgeführt, was deutlich langsamer ist. Wenn Du vorher weißt, wie RAM und VRAM zusammenhängen, kaufst Du die richtige Hardware und sparst Dir den Frust.
RAM vs. VRAM - In A Nutshell
RAM ist der Arbeitsspeicher Deines Rechners. Er steht der CPU und allen laufenden Programmen zur Verfügung. VRAM ist der Speicher auf einer dedizierten Grafikkarte und steht der GPU exklusiv zur Verfügung. Für KI-Berechnungen ist VRAM in der Regel deutlich schneller, weil die GPU tausende parallele Rechenkerne hat und der VRAM eine viel höhere Speicherbandbreite bietet.
Ein einfaches Bild: Stell Dir Deinen Rechner als Werkstatt vor. Der RAM ist der Schreibtisch, auf dem alle Unterlagen liegen, an denen Du gerade arbeitest. Je größer der Schreibtisch, desto mehr Unterlagen passen darauf. Der VRAM ist die Werkbank direkt neben der Maschine. Die Maschine ist die GPU, und sie kann nur das verarbeiten, was auf der Werkbank liegt. Wenn die Werkbank zu klein ist, muss die Maschine ständig Unterlagen vom Schreibtisch holen, und das kostet Zeit.
Ein Modell, das auf der GPU laufen soll, muss vollständig in den VRAM passen. Passt es nicht, fallen Teile auf den RAM zurück. Dann wird das Modell langsamer, weil die CPU weniger parallele Rechenkerne hat als eine GPU und der Datentransfer zwischen RAM und VRAM zusätzlich Zeit kostet.
Für wen ist dieser Vergleich gedacht?
Dieser Artikel richtet sich an Einsteiger, die lokale KI ausprobieren wollen und sich fragen, welche Hardware sie brauchen. Wenn Du noch nie von VRAM gehört hast oder nicht weißt, warum ein Modell mit 7 Milliarden Parametern auf einer GPU schnell läuft und auf einer CPU nicht, bist Du hier richtig. Du brauchst kein Vorwissen. Wir gehen Schritt für Schritt durch, was RAM und VRAM sind, wie sie zusammenarbeiten und was Du beim Kauf beachten musst.
Auch wenn Du schon erste Experimente mit Ollama gemacht hast und Dich fragst, warum manche Modelle schnell laufen und andere nicht, hilft Dir dieser Artikel. Die Grundlagen hier sind die Basis für weiterführende Themen wie RAM und VRAM Anforderungen und Quantisierung.
Wichtige Begriffe rund um RAM und VRAM
| Begriff | Bedeutung |
|---|---|
| RAM | Arbeitsspeicher des Systems, genutzt von CPU und allen Programmen |
| VRAM | Speicher auf einer dedizierten Grafikkarte, exklusiv für die GPU |
| GPU | Prozessor auf der Grafikkarte mit vielen parallelen Kernen, ideal für KI |
| CPU | Hauptprozessor mit weniger, aber flexibleren Kernen |
| GPU-Offloading | Anteile des Modells werden von der CPU auf die GPU ausgelagert |
| Unified Memory | Gemeinsamer Speicher für CPU und GPU, z. B. bei Apple Silicon |
| Shared Memory | GPU nutzt Teil des RAM, z. B. bei APUs ohne dedizierten VRAM |
| Speicherbandbreite | Datenmenge, die pro Sekunde zwischen Speicher und Prozessor fließen kann |
| APU | Prozessor mit integrierter GPU, teilt sich oft den RAM |
| Apple Silicon | Chips von Apple wie M1, M2, M3, M4, die RAM und GPU-Speicher vereinen |
Direkter Vergleich: RAM vs. VRAM
| Kriterium | RAM | VRAM |
|---|---|---|
| Ort | Auf dem Mainboard, im Rechner | Auf der Grafikkarte, direkt neben der GPU |
| Zugriff | CPU und alle Programme | Nur die GPU |
| Geschwindigkeit für KI | Mäßig, begrenzt durch CPU-Kerne | Sehr hoch, durch tausende GPU-Kerne |
| Bandbreite | Typisch 50 bis 100 GB/s | Typisch 500 bis 1000 GB/s und mehr |
| Latenz | Höher | Niedriger, da direkter an der GPU |
| Verfügbarkeit | In jedem Rechner vorhanden | Nur mit dedizierter Grafikkarte |
| Preis pro GB | Günstig, typisch 3 bis 5 Euro | Teuer, typisch 15 bis 30 Euro und mehr |
| Aufrüstbarkeit | Einfach, RAM-Module lassen sich nachrüsten | Kaum, VRAM ist fest auf der GPU verlötet |
| Typische Größen | 16, 32, 64 GB | 8, 12, 16, 24 GB bei Consumer-GPUs |
| Hauptsächlicher Nutzer | CPU | GPU |
| Auswirkung bei Knappheit | Programme werden langsam oder stürzen ab | Modell fällt auf CPU zurück, wird sehr langsam |
Wie hängen RAM und VRAM zusammen?
Wenn Du ein KI-Modell mit Ollama startest, passiert im Hintergrund Folgendes. Das Modell liegt als Datei auf Deiner SSD oder Festplatte. Beim Start lädt Ollama die Datei zuerst in den RAM. Der RAM ist der allgemeine Arbeitsspeicher, und dort hält das System alles bereit, was gerade gebraucht wird.
Wenn Du eine dedizierte Grafikkarte hast, versucht Ollama danach, das Modell vom RAM in den VRAM zu kopieren. Die GPU rechnet deutlich schneller als die CPU, weil sie tausende parallele Kerne hat. Je mehr vom Modell im VRAM liegt, desto schneller läuft die Inferenz, also das Erzeugen von Antworten.
Der Ablauf sieht vereinfacht so aus:
- Modell liegt als Datei auf der SSD
- Ollama lädt die Datei in den RAM
- Wenn eine GPU vorhanden ist, kopiert Ollama das Modell vom RAM in den VRAM
- Die GPU führt die Berechnungen aus und erzeugt die Antwort
- Das Ergebnis geht zurück an das Programm, das die Antwort anzeigt
Wenn das Modell vollständig in den VRAM passt, ist das ideal. Die GPU hat alles, was sie braucht, direkt neben sich, und der Datentransfer zwischen RAM und VRAM während der Inferenz ist minimal. Das Modell läuft am schnellsten.
Was passiert bei knappem VRAM?
Wenn das Modell nicht vollständig in den VRAM passt, kommt GPU-Offloading ins Spiel. Ollama versucht, so viel wie möglich vom Modell in den VRAM zu laden und den Rest im RAM zu behalten. Die GPU bearbeitet die Teile, die im VRAM liegen, und die CPU bearbeitet die Teile, die im RAM liegen. Das funktioniert, aber es kostet Zeit, weil ständig Daten zwischen RAM und VRAM hin und her geschoben werden müssen.
Je weniger vom Modell in den VRAM passt, desto mehr Arbeit muss die CPU übernehmen, und desto langsamer wird das Modell. Im Extremfall, wenn gar keine GPU vorhanden ist oder der VRAM extrem klein ist, läuft das Modell komplett im RAM auf der CPU. Das ist für kleine Modelle akzeptabel, für größere Modelle aber sehr langsam.
Eine Lösung ist Quantisierung. Dabei wird das Modell komprimiert, indem die Genauigkeit der Zahlen reduziert wird, mit denen das Modell rechnet. Ein Modell, das ursprünglich 16 GB VRAM braucht, kann mit Quantisierung auf 4-bit vielleicht auf 5 GB schrumpfen. Das passt dann auch in eine kleinere Grafikkarte. Der Preis ist ein leichter Qualitätsverlust, aber für die meisten Anwendungen ist der kaum spürbar.
Eine andere Lösung ist einfach eine Grafikkarte mit mehr VRAM. Consumer-GPUs von Nvidia gibt es mit 8, 12, 16 oder 24 GB VRAM. Die Kaufberatung hilft Dir bei der Auswahl.
Apple Silicon und Unified Memory
Apple Silicon, also die Chips M1, M2, M3, M4 und deren Pro- und Max-Varianten, funktionieren grundlegend anders als Rechner mit separater CPU und GPU. Bei Apple Silicon gibt es keinen separaten VRAM. Stattdessen teilen sich CPU und GPU einen gemeinsamen Speicher, das sogenannte Unified Memory.
Das bedeutet, die GPU kann auf den gesamten Arbeitsspeicher zugreifen. Ein Mac Studio mit 128 GB Unified Memory kann der GPU theoretisch fast den gesamten Speicher zur Verfügung stellen. Das ist ein enormer Vorteil für lokale KI, weil große Modelle, die auf einer Consumer-Grafikkarte mit 24 GB VRAM nicht laufen würden, auf einem Mac mit ausreichend Unified Memory durchaus passen.
Der Nachteil ist die Speicherbandbreite. Apple Silicon hat zwar eine hohe Bandbreite, aber sie ist niedriger als bei dedizierten High-End-Grafikkarten wie einer Nvidia H100. Für lokale KI zu Hause ist Apple Silicon trotzdem eine sehr gute Wahl, weil die Speichermenge das wichtigste Kriterium ist und die Bandbreite für die meisten Anwendungen ausreicht.
Wenn Du über Apple Silicon nachdenkst, achte auf die Variante. Die Standard-Chips M1, M2, M3, M4 haben eine geringere Speicherbandbreite als die Pro-, Max- und Ultra-Varianten. Für KI lohnen sich mindestens die Pro-Varianten, am besten Max oder Ultra.
APU und Shared Memory
Neben Apple Silicon gibt es noch einen anderen Ansatz, bei dem CPU und GPU sich den Speicher teilen: APUs. Eine APU ist ein Prozessor, der eine GPU integriert hat. Bekannte Beispiele sind AMD Ryzen AI Max oder Intels Core Ultra Serie. Bei diesen Chips gibt es keinen separaten VRAM, die GPU nutzt stattdessen einen Teil des RAM. Das nennt man Shared Memory.
Der Vorteil ist, dass Du keine separate Grafikkarte brauchst und trotzdem von der GPU profitieren kannst. Der Nachteil ist, dass die Speicherbandbreite des RAM deutlich niedriger ist als bei dediziertem VRAM. Die GPU ist also schneller als eine reine CPU-Lösung, aber langsamer als eine dedizierte Grafikkarte mit eigenem VRAM.
Besonders interessant ist der AMD Ryzen AI Max, der bis zu 128 GB RAM unterstützt und davon einen großen Teil der GPU zur Verfügung stellen kann. Das ist eine Alternative zu Apple Silicon, wenn Du einen Windows- oder Linux-Rechner bauen willst und große Modelle lokal betreiben möchtest, ohne eine teure dedizierte Grafikkarte zu kaufen.
Beispiel: Welches Setup für welches Modell?
Hier sind konkrete Beispiele, damit Du ein Gefühl für die Größenordnungen bekommst. Die Angaben beziehen sich auf quantisierte Modelle, wie sie typischerweise mit Ollama geladen werden. Mehr zu den genauen Zahlen findest Du unter RAM und VRAM Anforderungen.
7B-Modell (7 Milliarden Parameter): Ein quantisiertes 7B-Modell braucht etwa 4 bis 5 GB Speicher. Das passt in jede moderne Grafikkarte mit 8 GB VRAM. Auf einer GPU läuft es schnell und flüssig. Auf einer CPU mit 16 GB RAM läuft es auch, aber deutlich langsamer.
13B-Modell (13 Milliarden Parameter): Ein quantisiertes 13B-Modell braucht etwa 8 bis 9 GB Speicher. Das passt noch in eine Grafikkarte mit 12 GB VRAM, wie etwa eine Nvidia RTX 3060. Mit 8 GB VRAM wird es knapp, und Du brauchst GPU-Offloading oder stärkere Quantisierung.
70B-Modell (70 Milliarden Parameter): Ein quantisiertes 70B-Modell braucht etwa 40 bis 45 GB Speicher. Das passt in keine Consumer-Grafikkarte, denn die größte, die RTX 4090, hat 24 GB VRAM. Hier brauchst Du entweder mehrere Grafikkarten, Apple Silicon mit mindestens 64 GB Unified Memory oder eine APU wie den Ryzen AI Max mit ausreichend RAM.
Noch größere Modelle: Modelle mit 100 Milliarden Parametern und mehr brauchen 60 GB Speicher und aufwärts. Für lokale Nutzung kommen hier nur Macs mit 128 GB Unified Memory oder Multi-GPU-Setups in Frage.
Typische Stolpersteine bei RAM und VRAM
- RAM und VRAM verwechseln: 32 GB RAM helfen nicht, wenn die GPU nur 4 GB VRAM hat. Das Modell wird langsam, weil es nicht in den VRAM passt.
- Zu kleine Grafikkarte gekauft: Wer eine GPU mit 8 GB VRAM kauft und dann ein 13B-Modell laufen will, muss mit GPU-Offloading leben oder stärker quantisieren.
- Shared Memory mit dediziertem VRAM gleichsetzen: Eine APU nutzt den RAM als VRAM, ist aber langsamer als eine dedizierte Grafikkarte mit eigenem VRAM, weil die Bandbreite niedriger ist.
- Apple Silicon Bandbreite unterschätzen: Ein Standard-M3 ist für KI weniger geeignet als ein M3 Max, weil die Speicherbandbreite deutlich niedriger ist.
- Quantisierung ignorieren: Wer Modelle ohne Quantisierung lädt, braucht deutlich mehr VRAM. Mit 4-bit-Quantisierung passen viel größere Modelle in den VRAM.
- Latenz übersehen: Auch wenn genug Speicher vorhanden ist, kann eine niedrige Speicherbandbreite das Modell langsam machen. Das gilt besonders bei Shared Memory.
- Aufrüstbarkeit von VRAM erwarten: VRAM lässt sich nicht nachrüsten. Wer mehr VRAM will, muss eine neue Grafikkarte kaufen. RAM hingegen kann man meist problemlos erweitern.
Hardware, Kosten und Sicherheit bei RAM und VRAM
Hardware: Für den Einstieg in lokale KI reicht eine Grafikkarte mit 8 GB VRAM, wenn Du hauptsächlich 7B-Modelle nutzt. Für 13B-Modelle empfiehlt sich 12 GB VRAM, für noch größere Modelle 24 GB VRAM oder Apple Silicon mit ausreichend Unified Memory. Die CPU spielt eine untergeordnete Rolle, solange sie modern ist. Wichtiger ist die GPU und deren VRAM.
Kosten: RAM ist günstig, typisch 3 bis 5 Euro pro GB. VRAM ist teuer, weil er fest auf der Grafikkarte verbaut ist und Du die ganze Karte kaufst. Eine Nvidia RTX 4060 mit 8 GB VRAM kostet etwa 300 Euro, eine RTX 4090 mit 24 GB VRAM etwa 2000 Euro. Apple Silicon ist ein Sonderfall, weil Du den Speicher nicht separat kaufst, sondern den Mac mit dem gewünschten Unified Memory konfigurierst. Ein Mac Studio mit 128 GB Unified Memory ist teuer, aber im Vergleich zu einem Multi-GPU-Setup oft günstiger.
Sicherheit: Bei lokal betriebenen Modellen bleiben Deine Daten auf Deinem Rechner. Keine Anfrage geht an einen Server, keine Daten verlassen Dein System. Das ist ein großer Vorteil gegenüber Cloud-KI. RAM und VRAM spielen hierfür keine Rolle, wichtig ist nur, dass das Modell lokal läuft und keine externen APIs aufruft. Mehr dazu unter Was ist lokale KI?.
Weiterführende Links und Infos zu RAM und VRAM
- KI-Hardware Grundlagen für mehr Basiswissen über Hardware für lokale KI
- Kaufberatung wenn Du eine neue Grafikkarte oder einen neuen Rechner planst
- KI-PC Einsteiger für eine konkrete Empfehlung für den Einstieg
- RAM und VRAM Anforderungen für genaue Zahlen zu Modellgrößen
- Quantisierung wenn Du verstehen willst, wie Modelle verkleinert werden
- Was ist lokale KI? für die Grundlagen lokaler KI
- Ollama für das beliebteste Tool zum lokalen Ausführen von Modellen
FAQ - Typische Fragen zu RAM und VRAM
Kann ich VRAM mit RAM erweitern?
Nein. VRAM ist fest auf der Grafikkarte verbaut und lässt sich nicht nachrüsten. Wenn Du mehr VRAM brauchst, musst Du eine neue Grafikkarte kaufen. RAM hingegen kannst Du meist problemlos erweitern, indem Du zusätzliche Module in Dein Mainboard steckst.
Lohnt sich eine GPU mit 8 GB VRAM?
Ja, für den Einstieg. 8 GB VRAM reichen für quantisierte 7B-Modelle problemlos. Für 13B-Modelle wird es knapp, hier brauchst Du GPU-Offloading oder stärkere Quantisierung. Wenn Du größere Modelle laufen willst, lohnt sich eine Karte mit 12 oder 16 GB VRAM.
Warum ist Apple Silicon so beliebt für lokale KI?
Apple Silicon nutzt Unified Memory, bei dem CPU und GPU sich einen gemeinsamen Speicher teilen. Die GPU kann auf den gesamten Arbeitsspeicher zugreifen, ohne die typischen VRAM-Grenzen dedizierter Grafikkarten. Ein Mac mit 64 oder 128 GB Unified Memory kann Modelle laden, die auf keiner Consumer-Grafikkarte Platz finden.
Was ist schneller: CPU mit viel RAM oder GPU mit wenig VRAM?
Für KI-Inferenz ist fast immer die GPU schneller, auch mit wenig VRAM, solange das Modell hineinpasst. Die GPU hat tausende parallele Kerne und eine viel höhere Speicherbandbreite. Eine CPU mit viel RAM ist nur dann besser, wenn das Modell zu groß für den VRAM ist und ohnehin auf der CPU laufen muss.
Was bedeutet GPU-Offloading genau?
GPU-Offloading bedeutet, dass Teile eines Modells auf die GPU ausgelagert werden, während der Rest im RAM auf der CPU läuft. Das passiert, wenn das Modell nicht vollständig in den VRAM passt. Je mehr vom Modell in den VRAM passt, desto schneller läuft das Modell.
Hilft mehr RAM, wenn der VRAM zu klein ist?
Bedingt. Mehr RAM erlaubt es Dir, größere Modelle überhaupt zu laden und auf der CPU auszuführen. Aber die Geschwindigkeit bleibt niedrig, weil die CPU und der RAM langsamer sind als die GPU und der VRAM. Mehr RAM löst das Geschwindigkeitsproblem nicht, er macht nur möglich, dass das Modell überhaupt läuft.
Was ist der Unterschied zwischen Unified Memory und Shared Memory?
Unified Memory bei Apple Silicon ist ein gemeinsamer Speicher, der von Anfang an für CPU und GPU optimiert ist und eine hohe Bandbreite bietet. Shared Memory bei APUs bedeutet, dass die integrierte GPU einen Teil des normalen RAM nutzt. Die Bandbreite ist dabei niedriger als bei dediziertem VRAM oder Unified Memory.
Brauche ich eine Nvidia-GPU für lokale KI?
Nein, aber Nvidia ist die einfachste Wahl, weil die meisten Tools und Frameworks auf Nvidia optimiert sind. AMD-GPUs funktionieren ebenfalls, erfordern aber manchmal mehr Konfiguration. Apple Silicon und APUs sind Alternativen, die ohne dedizierte Grafikkarte auskommen.
Wie viel VRAM brauche ich für ein 7B-Modell?
Ein quantisiertes 7B-Modell braucht etwa 4 bis 5 GB VRAM. Mit 8 GB VRAM bist Du auf der sicheren Seite. Ohne Quantisierung braucht das Modell etwa 14 GB, was eine deutlich größere Grafikkarte voraussetzt.
Kann ich mehrere Grafikkarten für mehr VRAM nutzen?
Ja, das ist möglich. Tools wie Ollama unterstützen Multi-GPU-Setups, bei denen das Modell auf den VRAM mehrerer Grafikkarten verteilt wird. Das ist eine Möglichkeit, große Modelle lokal zu betreiben, ohne Apple Silicon oder eine APU zu nutzen. Nachteil ist der hohe Stromverbrauch und die Kosten.
Was passiert, wenn der VRAM komplett voll ist?
Wenn der VRAM voll ist und das Modell noch nicht vollständig geladen ist, stürzt das Programm ab oder es gibt eine Fehlermeldung. Ollama versucht in solchen Fällen, automatisch auf GPU-Offloading zurückzugreifen und den Rest im RAM zu belassen. Wenn auch der RAM nicht ausreicht, startet das Modell gar nicht.
Reicht der VRAM einer integrierten GPU?
In den meisten Fällen nein. Integrierte GPUs nutzen Shared Memory vom RAM und haben eine niedrige Bandbreite. Für kleine 7B-Modelle kann es funktionieren, aber langsam. Für ernsthafte lokale KI lohnt sich eine dedizierte Grafikkarte oder Apple Silicon.
Sollte ich RAM oder VRAM aufrüsten, wenn mein Modell langsam ist?
Wenn das Modell langsam ist, weil es nicht in den VRAM passt, bringt mehr RAM nichts für die Geschwindigkeit. In diesem Fall brauchst Du eine Grafikkarte mit mehr VRAM oder eine stärkere Quantisierung. Mehr RAM hilft nur, wenn das Modell gar nicht erst startet, weil auch der RAM zu klein ist.
Quellen und weiterführende Literatur
- Nvidia Speicherarchitektur und VRAM-Spezifikationen
- AMD Ryzen AI Max Dokumentation
- Apple Silicon Unified Memory Übersicht
- Ollama Dokumentation zu GPU-Offloading
- Erfahrungen aus der lokalen KI-Community


