RAM und VRAM Anforderungen
Was dieser Artikel über RAM und VRAM Anforderungen behandelt
- Wie viel RAM und VRAM Du für typische KI-Modelle wirklich brauchst
- Eine klare Formel, mit der Du den Speicherbedarf selbst berechnest
- Konkrete Beispielrechnungen für Llama 3.1 8B, Qwen 2.5 14B und Llama 3.1 70B
- Empfohlene Hardware nach Budget, von unter 500 EUR bis über 2000 EUR
- Die häufigsten Stolpersteine, die verhindern, dass Dein Modell läuft
Einleitung: RAM und VRAM Anforderungen verständlich erklärt
Bevor Du ein KI-Modell lokal betreibst, musst Du wissen, ob Deine Hardware überhaupt ausreicht. Die wichtigste Frage lautet: Wie viel Speicher braucht das Modell während der Nutzung? Dabei spielen RAM und VRAM die zentrale Rolle. Je größer das Modell und je länger der Kontext, desto mehr Speicher wird benötigt.
Warum das so wichtig ist? Weil Speicher der Engpass Nummer eins bei lokaler KI ist. Du kannst den schnellsten Prozessor haben und die teuerste Grafikkarte, wenn der Speicher nicht reicht, startet das Modell gar nicht erst oder bricht mittendrin ab. Im Gegensatz zu Cloud-Diensten, bei denen Du einfach mehr zahlst, bist Du bei lokaler KI an die physischen Grenzen Deiner Hardware gebunden. Und genau diese Grenzen wollen wir in diesem Artikel verstehen.
Wenn Du noch neu beim Thema bist, lies zuerst Was ist lokale KI?. Dieser Artikel hier baut darauf auf und geht tief in die Hardware-Anforderungen ein.
Warum brauche ich diese Anforderungen?
Stell Dir vor, Du kaufst einen Rechner für 2000 EUR. Du hast Dich beraten lassen, eine starke CPU ausgewählt, eine schicke Grafikkarte mit 8 GB VRAM eingebaut und 32 GB RAM im System. Zuhause angekommen willst Du Llama 3.1 70B laufen lassen, weil Du im Internet gelesen hast, dass das Modell richtig gut sein soll. Du startest Ollama, lädst das Modell, und dann passiert es: Die Ausgabe stockt, dauert ewig, oder das Modell lädt gar nicht erst.
Was ist passiert? Das 70B-Modell braucht selbst in der stärksten Quantisierung rund 40 GB Speicher. Deine Grafikkarte hat 8 GB VRAM, davon bleiben nach dem Betriebssystem vielleicht 7 GB übrig. Das Modell muss also fast vollständig in den langsamen System-RAM ausweichen. Die CPU rechnet statt der GPU, und statt 30 Tokens pro Sekunde kommen vielleicht 1 bis 2 Tokens pro Sekunde heraus. Die 2000 EUR waren gut angelegt für Gaming, aber nicht für ein 70B-Modell.
Hättest Du vorher gerechnet, wüsstest Du, dass ein 70B-Modell eine Grafikkarte mit 24 GB VRAM oder mehr braucht, am besten zwei davon, oder ein Apple Silicon Mac mit 64 GB Unified Memory. Mit dem Wissen hättest Du entweder die Hardware anders geplant oder ein kleineres Modell wie Llama 3.1 8B gewählt, das auf Deiner Karte problemlos läuft.
Genau das ist der Punkt: Wenn Du die Anforderungen kennst, triffst Du die richtige Kaufentscheidung. Wenn Du sie nicht kennst, riskierst Du, dass Dein teurer Rechner für Dein eigentliches Ziel unbrauchbar ist.
RAM und VRAM Anforderungen - In A Nutshell
RAM ist der Arbeitsspeicher Deines Rechners, VRAM ist der Videospeicher auf einer dedizierten Grafikkarte. KI-Modelle lassen sich auf beiden ausführen. GPUs mit ausreichend VRAM sind deutlich schneller, weil sie massive Parallelverarbeitung unterstützen. Fehlt VRAM, kann das Modell im System-RAM oder auf der CPU laufen, wird dann aber spürbar langsamer.
Als Faustregel gilt: Ein quantisiertes 7B-Modell braucht etwa 4 bis 8 GB Speicher. Ein 13B-Modell braucht 8 bis 16 GB. Ein 70B-Modell benötigt je nach Quantisierung 40 GB oder mehr. Dazu kommt der Speicher für den KV-Cache, der mit der Kontextlänge wächst.
Die wichtigste Zahl, die Du Dir merken solltest: Nimm die Modellgröße in Milliarden Parametern, teile sie durch 2, und Du hast den Speicherbedarf in GB für FP16. Für Q4_K_M nimm etwa ein Viertel bis ein Drittel davon. Das ist grob, aber es gibt Dir eine erste Orientierung, bevor Du in die Details gehst.
Für wen ist dieser Artikel gedacht?
Dieser Artikel richtet sich an Anfänger, die zum ersten Mal ein KI-Modell lokal betreiben wollen und unsicher sind, ob ihre Hardware ausreicht. Er ist auch für Dich interessant, wenn Du planst, einen Rechner für lokale KI zu kaufen oder aufzurüsten, und vorher wissen willst, was Du wirklich brauchst. Du brauchst keine Vorkenntnisse in KI oder Hardware, wir erklären alles Schritt für Schritt.
Wenn Du schon weißt, was Quantisierung und KV-Cache sind, kannst Du direkt zu den Tabellen und Beispielrechnungen springen. Wenn nicht, kein Problem, die nächsten Abschnitte holen Dich ab.
Wichtige Begriffe rund um RAM und VRAM Anforderungen
| Begriff | Bedeutung |
|---|---|
| RAM | Arbeitsspeicher des Rechners, genutzt für CPU-basierte Ausführung |
| VRAM | Speicher auf der Grafikkarte, deutlich schneller für KI-Inferenz |
| GPU | Grafikprozessor, beschleunigt KI-Inferenz durch parallele Rechenkerne |
| CPU | Hauptprozessor des Rechners, führt das Modell aus wenn keine GPU vorhanden oder VRAM voll ist |
| Speicherbedarf | Benötigter RAM oder VRAM während der Ausführung eines Modells |
| KV-Cache | Zwischenspeicher für bereits berechnete Attention-Werte, wächst mit der Kontextlänge |
| Quantisierung | Reduzierung der Speichergenauigkeit der Modellgewichte, verringert den Speicherbedarf |
| GPU-Offloading | Teile des Modells laufen auf der GPU, der Rest im System-RAM |
| Unified Memory | Apple Silicon teilt RAM zwischen CPU und GPU, kein getrennter VRAM nötig |
Mehr zu Quantisierung findest Du im Artikel Quantisierung, mehr zur Kontextlänge und ihrem Einfluss auf den KV-Cache in Kontextlänge.
Wie berechnet sich der Speicherbedarf?
Der Gesamtspeicherbedarf beim Ausführen eines Modells setzt sich aus drei Teilen zusammen:
- Modellgewichte: Das ist der eigentliche Speicher für das Modell. Er hängt von der Anzahl der Parameter und der Quantisierung ab.
- KV-Cache: Zwischenspeicher für die Attention-Berechnung, wächst mit der Kontextlänge.
- Overhead: Platz für das Betriebssystem, andere laufende Programme und Framework-Interna.
Formel für die Modellgewichte
Die Grundformel für die Modellgewichte lautet:
Speicher (GB) = Parameterzahl × Bytes pro Parameter / 1024^3
Bei FP16 sind das 2 Bytes pro Parameter, bei Q8_0 etwa 1 Byte, bei Q5_K_M etwa 0,7 Bytes und bei Q4_K_M etwa 0,55 Bytes.
Beispiel FP16, 7B-Modell:
7.000.000.000 × 2 / 1024^3 = ca. 13 GB
Beispiel Q4_K_M, 7B-Modell:
7.000.000.000 × 0,55 / 1024^3 = ca. 3,6 GB
Formel für den KV-Cache
Der KV-Cache wächst mit der Kontextlänge. Eine grobe Abschätzung für ein typisches Modell:
KV-Cache (GB) = 2 × Anzahl Layer × Dimension × Kontextlänge × 2 Bytes / 1024^3
Für Llama 3.1 8B mit 32 Layern, Dimension 4096 und 4096 Tokens Kontext:
2 × 32 × 4096 × 4096 × 2 / 1024^3 = ca. 2 GB
Bei 32.768 Tokens Kontext wächst derselbe Cache auf etwa 16 GB. Das zeigt, wie wichtig die Kontextlänge für den Speicherbedarf ist.
Overhead
Plane etwa 2 bis 4 GB für das Betriebssystem und Framework-Interna ein. Unter Windows mit Browser und anderen Anwendungen können es auch 4 bis 6 GB sein. Wenn Du unsicher bist, nimm 4 GB als Puffer.
Gesamtformel
Gesamtbedarf = Modellgewichte + KV-Cache + Overhead
Diese Formel ist vereinfacht, aber sie gibt Dir eine brauchbare Schätzung. In der Praxis kommen noch kleinere Framework-Abweichungen dazu, aber für die Kaufentscheidung reicht das völlig aus.
Speicherbedarf nach Modellgröße
Die folgende Tabelle zeigt den Speicherbedarf nur für die Modellgewichte, ohne KV-Cache und ohne Overhead. Die Werte sind gerundet und beziehen sich auf typische GGUF-Quantisierungen.
| Modellgröße | Q4_K_M | Q5_K_M | Q8_0 | FP16 |
|---|---|---|---|---|
| 7B | ca. 4 GB | ca. 5 GB | ca. 7 GB | ca. 14 GB |
| 8B | ca. 5 GB | ca. 6 GB | ca. 8 GB | ca. 16 GB |
| 13B | ca. 8 GB | ca. 9 GB | ca. 13 GB | ca. 26 GB |
| 30B | ca. 18 GB | ca. 21 GB | ca. 31 GB | ca. 60 GB |
| 70B | ca. 40 GB | ca. 45 GB | ca. 70 GB | ca. 140 GB |
Diese Werte beziehen sich nur auf das Modell selbst. Für den KV-Cache und das Betriebssystem solltest Du jeweils noch Puffer einplanen, siehe nächsten Abschnitt.
Was kommt zum Modell noch dazu?
Die Modellgewichte sind nur ein Teil der Rechnung. Drei weitere Faktoren bestimmen, wie viel Speicher insgesamt belegt ist.
KV-Cache
Der KV-Cache speichert die bereits berechneten Attention-Werte, damit das Modell bei jedem neuen Token nicht den gesamten Kontext neu berechnen muss. Er wächst linear mit der Kontextlänge. Bei kurzen Kontexten von 2048 Tokens ist er vernachlässigbar klein, bei 32.768 Tokens kann er bei größeren Modellen mehrere Gigabyte groß werden.
Plane für typische Nutzung mit 8192 Tokens Kontext etwa 1 bis 4 GB zusätzlich ein, je nach Modellgröße. Bei 32.768 Tokens kann der KV-Cache bei einem 70B-Modell auf 20 GB oder mehr anwachsen.
Betriebssystem und andere Anwendungen
Dein Betriebssystem belegt selbst Speicher. Unter Windows sind das mit Browser und Hintergrundprozessen schnell 4 bis 6 GB. Unter Linux kommtst Du mit 1 bis 2 GB aus. Wenn Du gleichzeitig programmierst, Dokumente bearbeitest oder andere Tools offen hast, addiert sich das.
Wie viel Puffer solltest Du einplanen?
Als Faustregel: Nimm den Speicherbedarf der Modellgewichte, addiere den KV-Cache für Deine gewünschte Kontextlänge und plane nochmal 20 Prozent Puffer oben drauf. So gehst Du auf Nummer sicher, dass das Modell nicht knapp an der Grenze läuft und Du noch Platz für andere Anwendungen hast.
Beispiel: Ein 8B-Modell in Q4_K_M braucht 5 GB. KV-Cache für 8192 Tokens etwa 2 GB. Overhead 4 GB. Gesamt: 11 GB. Mit 20 Prozent Puffer landest Du bei etwa 13 GB. Eine Grafikkarte mit 12 GB VRAM wird knapp, eine mit 16 GB ist entspannt.
Beispielrechnungen
Drei konkrete Beispiele, die typische Fragen beantworten.
Beispiel 1: Ich will Llama 3.1 8B laufen lassen
Llama 3.1 8B in Q4_K_M braucht etwa 5 GB für die Modellgewichte. Für eine Kontextlänge von 8192 Tokens kommt etwa 2 GB KV-Cache dazu. Overhead für Betriebssystem und Framework etwa 4 GB.
5 GB (Modell) + 2 GB (KV-Cache) + 4 GB (Overhead) = 11 GB
Mit 20 Prozent Puffer: etwa 13 GB. Du brauchst also eine Grafikkarte mit mindestens 12 GB VRAM, besser 16 GB, oder einen Rechner mit mindestens 16 GB RAM für CPU-Betrieb. Mit 16 GB RAM läuft es, mit 32 GB RAM bist Du auf der sicheren Seite.
Empfohlene Hardware: RTX 3060 12 GB für GPU-Betrieb, oder ein Rechner mit 32 GB RAM für CPU-Betrieb. Ein Mac Mini M4 mit 24 GB Unified Memory schafft das problemlos.
Beispiel 2: Ich will Qwen 2.5 14B laufen lassen
Qwen 2.5 14B in Q4_K_M braucht etwa 9 GB für die Modellgewichte. KV-Cache für 8192 Tokens etwa 3 GB. Overhead 4 GB.
9 GB (Modell) + 3 GB (KV-Cache) + 4 GB (Overhead) = 16 GB
Mit 20 Prozent Puffer: etwa 19 GB. Du brauchst eine Grafikkarte mit mindestens 24 GB VRAM für reinen GPU-Betrieb, oder Du nutzt GPU-Offloading mit einer 16 GB Karte und lagertest den Rest in den System-RAM aus. Dafür brauchst Du dann mindestens 32 GB RAM im System.
Empfohlene Hardware: RTX 4090 24 GB für reinen GPU-Betrieb, oder RTX 4060 Ti 16 GB mit 32 GB System-RAM für GPU-Offloading. Ein Mac Studio mit 64 GB Unified Memory schafft das entspannt.
Beispiel 3: Ich will Llama 3.1 70B laufen lassen
Llama 3.1 70B in Q4_K_M braucht etwa 40 GB für die Modellgewichte. KV-Cache für 8192 Tokens etwa 8 GB. Overhead 4 GB.
40 GB (Modell) + 8 GB (KV-Cache) + 4 GB (Overhead) = 52 GB
Mit 20 Prozent Puffer: etwa 62 GB. Das ist mit einer einzelnen Consumer-GPU nicht mehr machbar. Du brauchst entweder zwei RTX 4090 mit jeweils 24 GB VRAM, oder ein Apple Silicon Mac mit mindestens 64 GB Unified Memory, am besten 128 GB.
Empfohlene Hardware: Mac Studio M2 Ultra mit 128 GB Unified Memory, oder zwei RTX 4090 in einem Workstation-Gehäuse. Alternativ ein Cloud-Miet-Setup, aber das verlässt den Rahmen lokaler KI.
Empfohlene Hardware nach Budget
| Budget | Was ist möglich | Empfohlene Modelle |
|---|---|---|
| unter 500 EUR | CPU-Betrieb mit vorhandenem Rechner, 16 GB RAM | 7B bis 8B in Q4_K_M, langsam aber nutzbar |
| 500 bis 1000 EUR | Rechner mit 32 GB RAM oder gebrauchte GPU mit 8 bis 12 GB VRAM | 7B bis 13B in Q4_K_M, GPU-Betrieb möglich |
| 1000 bis 2000 EUR | Rechner mit RTX 3060 12 GB oder RTX 4060 Ti 16 GB, 32 GB RAM | 8B bis 14B in Q4_K_M, flüssige Ausgabe |
| über 2000 EUR | RTX 4090 24 GB oder Mac Studio mit 64 GB Unified Memory | 30B in Q4_K_M, 70B mit Offloading möglich |
Diese Tabelle gibt eine Orientierung. Die genaue Auswahl hängt davon ab, ob Du neu kaufst oder aufrüstest, und welche Modelle Du primär nutzen willst. Mehr Details findest Du in der Kaufberatung und im Artikel KI-PC Einsteiger.
Apple Silicon Empfehlungen
Apple Silicon hat einen großen Vorteil für lokale KI: Unified Memory. CPU und GPU teilen sich denselben Speicher, es gibt keinen getrennten VRAM. Das bedeutet, ein Mac mit 64 GB RAM hat effektiv 64 GB Speicher für KI-Modelle zur Verfügung, abzüglich des Betriebsystems. Das ist mit Consumer-GPUs von Nvidia so nicht erreichbar, da die größte Consumer-GPU bei 24 GB VRAM endet.
Mac Mini M4
Der Mac Mini M4 ist der günstigste Einstieg in Apple Silicon für lokale KI. Mit 24 GB Unified Memory läuft er 7B und 8B Modelle in Q4_K_M problemlos, auch Q8_0 ist möglich. 13B Modelle in Q4_K_M laufen ebenfalls. Größere Modelle werden knapp.
Mit 32 GB Unified Memory schaffst Du auch 14B Modelle in Q4_K_M entspannt und 30B Modelle mit etwas Offloading. Der Mac Mini M4 ist für Einsteiger die beste Wahl, wenn Du nicht viel ausgeben willst aber trotzdem flüssig arbeiten möchtest.
Mac Studio
Der Mac Studio M2 Max mit 64 GB Unified Memory schafft 30B Modelle in Q4_K_M problemlos und 70B Modelle in Q4_K_M mit etwas Geduld. Der Mac Studio M2 Ultra mit 128 GB Unified Memory läuft 70B Modelle in Q5_K_M oder Q8_0, und ist damit die stärkste Consumer-Lösung für lokale KI, die es aktuell gibt.
Der Nachteil von Apple Silicon ist die Geschwindigkeit im Vergleich zu Nvidia-GPUs. Bei Modellen, die komplett in den VRAM einer RTX 4090 passen, ist die 4090 deutlich schneller. Erst bei Modellen, die nicht in 24 GB VRAM passen, spielt Apple Silicon seine Stärke aus.
GPU-Empfehlungen
RTX 3060 12 GB
Die RTX 3060 mit 12 GB VRAM ist der Preis-Leistungs-Sieger für Einsteiger. Sie kostet gebraucht unter 300 EUR und läuft 7B und 8B Modelle in Q4_K_M und Q5_K_M problemlos. 13B Modelle in Q4_K_M passen ebenfalls rein, Q8_0 wird knapp. Für 30B und größer reicht sie nicht.
RTX 4060 Ti 16 GB
Die RTX 4060 Ti mit 16 GB VRAM ist der nächste Schritt. Sie kostet neu etwa 450 EUR und bietet genug Platz für 13B und 14B Modelle in Q4_K_M und Q5_K_M. 8B Modelle laufen auch in Q8_0 oder FP16. Für 30B Modelle reicht sie mit Offloading in den System-RAM, wird aber langsam.
RTX 4090 24 GB
Die RTX 4090 mit 24 GB VRAM ist die stärkste Consumer-GPU von Nvidia. Sie kostet neu etwa 1800 EUR und läuft 30B Modelle in Q4_K_M komplett im VRAM, was sehr flüssige Ausgabe ermöglicht. 70B Modelle in Q4_K_M brauchen Offloading in den System-RAM, werden damit langsamer, sind aber nutzbar. Für reine 70B-Nutzung ohne Kompromisse brauchst Du zwei 4090er oder Apple Silicon mit 128 GB.
Mehr zu GPU-Auswahl und Hardware-Grundlagen findest Du unter KI-Hardware Grundlagen und im Artikel RAM vs. VRAM.
Wie prüfe ich meinen aktuellen Speicher?
Bevor Du ein Modell lädst, solltest Du wissen, wie viel Speicher Dir überhaupt zur Verfügung steht. Drei Befehle helfen Dir dabei.
VRAM auf Nvidia-GPUs prüfen
Öffne ein Terminal und gib ein:
nvidia-smi
Das zeigt Dir eine Tabelle mit allen Nvidia-GPUs, ihrem VRAM-Gesamt und dem aktuell belegten Speicher. Achte auf die Spalte Memory-Usage. Was dort frei ist, steht Deinem Modell zur Verfügung.
Laufende Modelle in Ollama prüfen
Wenn Du Ollama nutzt, kannst Du sehen, welche Modelle gerade geladen sind und wie viel Speicher sie belegen:
ollama ps
Das zeigt eine Tabelle mit Modellname, Größe, VRAM-Anteil und Status. So siehst Du sofort, ob ein Modell komplett im VRAM liegt oder teilweise im System-RAM.
System-RAM prüfen
Unter Linux:
free -h
Unter Windows öffnest Du den Task-Manager mit Strg+Shift+Esc und schaust unter dem Reiter Leistung auf den Arbeitsspeicher. Unter macOS öffnest Du die Aktivitätsanzeige und schaust unter Speicher.
So weißt Du immer, wo Du stehst, bevor Du ein Modell startest.
Typische Stolpersteine bei RAM und VRAM Anforderungen
-
VRAM knapp kalkuliert: Du planst genau den Speicherbedarf des Modells, vergisst aber KV-Cache und Overhead. Das Modell startet, stürzt aber bei längeren Kontexten ab. Plane immer 20 Prozent Puffer ein.
-
Kontextlänge unterschätzt: Ein Modell mit 8192 Tokens Kontext braucht deutlich weniger KV-Cache als dasselbe Modell mit 32.768 Tokens. Wenn Du lange Dokumente verarbeitest, kann der KV-Cache den Speicherbedarf verdoppeln.
-
Betriebssystem nicht eingerechnet: Unter Windows belegt das System mit Browser und Hintergrundprozessen schnell 4 bis 6 GB. Wenn Deine Grafikkarte 12 GB VRAM hat, bleiben effektiv nur 6 bis 8 GB für das Modell übrig.
-
Falsche Quantisierung gewählt: Q8_0 braucht doppelt so viel Speicher wie Q4_K_M, bei oft nur minimal besserer Qualität. Wenn der Speicher knapp ist, wähle Q4_K_M statt Q8_0.
-
GPU-Offloading nicht verstanden: Wenn das Modell nicht komplett in den VRAM passt, lagert Ollama Teile in den System-RAM aus. Das funktioniert, ist aber langsamer. Du brauchst dann genug System-RAM, um den Rest aufzunehmen.
-
FP16 für den Alltag genutzt: FP16 braucht viermal so viel Speicher wie Q4_K_M, ohne dass die Qualität im Alltag spürbar besser ist. FP16 ist für Training und Fine-Tuning relevant, für reine Inferenz ist Q4_K_M oder Q5_K_M die bessere Wahl.
-
Apple Silicon Speicher falsch eingeschätzt: Bei Apple Silicon teilen sich CPU und GPU den Speicher. Ein Mac mit 32 GB Unified Memory hat nicht 32 GB VRAM, sondern 32 GB minus Betriebssystem minus andere Anwendungen. Plane hier ebenfalls Puffer ein.
Hardware, Kosten und Sicherheit bei RAM und VRAM Anforderungen
Der einfachste Einstieg gelingt mit vorhandener Hardware. Wer schon einen Rechner mit 16 GB RAM oder mehr besitzt, kann direkt mit kleinen quantisierten Modellen testen. Wer gezielt in Hardware investieren will, sollte die gewünschte Modellgröße und Kontextlänge im Blick haben.
Die Kosten skalieren mit der GPU. Consumer-GPUs mit 12 oder 24 GB VRAM sind im Vergleich zu Workstations günstig. High-End-GPU-Workstations oder Server mit mehreren GPUs werden schnell teuer. Apple Silicon bietet hier ein gutes Preis-Leistungs-Verhältnis, wenn Du Modelle jenseits von 24 GB Speicherbedarf laufen willst, weil Unified Memory deutlich günstiger ist als mehrere Nvidia-GPUs.
Aus Sicherheitssicht ist der große Vorteil lokaler KI, dass keine Daten das Haus verlassen müssen, egal wie viel Hardware im Rechner sitzt. Deine Prompts, Deine Dokumente, Deine Ergebnisse bleiben auf Deinem Rechner. Das ist besonders relevant für sensible Daten aus Beruf oder Forschung. Mehr zum sicheren Betrieb lokaler KI findest Du im Artikel LLM lokal betreiben.
Weiterführende Links und Infos zu RAM und VRAM Anforderungen
- Was ist lokale KI? - Grundlagen lokaler KI
- Quantisierung - Wie Quantisierung den Speicherbedarf reduziert
- Kontextlänge - Warum lange Kontexte mehr Speicher brauchen
- LLM lokal betreiben - Praxisguide für den lokalen Betrieb
- KI-Hardware Grundlagen - Überblick über KI-Hardware
- RAM vs. VRAM - Der Unterschied zwischen RAM und VRAM
- Kaufberatung - Hardware gezielt auswählen
- KI-PC Einsteiger - Der erste KI-Rechner
- Ollama - Modelle einfach lokal starten
FAQ - Typische Fragen zu RAM und VRAM
Kann ich ein Modell nutzen, wenn ich weniger Speicher habe als empfohlen?
Ja, oft läuft es trotzdem, nur langsamer. Ollama und andere Tools lagern Teile des Modells in den System-RAM aus, wenn der VRAM nicht reicht. Für flüssige Nutzung solltest Du die Empfehlungen aber einhalten, sonst wird die Ausgabe spürbar langsam.
Wie viel VRAM brauche ich für Llama 3.1 8B?
Für die Q4_K_M-Variante reichen etwa 6 bis 8 GB VRAM inklusive KV-Cache und Puffer. Für Q5_K_M sollten es 8 bis 10 GB sein, für Q8_0 eher 12 GB. Mit 16 GB VRAM bist Du für alle Quantisierungen auf der sicheren Seite.
Läuft Ollama auf Apple Silicon?
Ja. Apple Silicon mit Unified Memory ist für lokale KI sehr beliebt, weil RAM und GPU-Speicher geteilt werden. Ein Mac mit 16 oder 24 GB RAM eignet sich gut für kleine bis mittlere Modelle, ein Mac Studio mit 64 GB oder mehr schafft auch große Modelle.
Was ist besser: mehr RAM oder mehr VRAM?
Für den schnellen Betrieb ist VRAM auf einer dedizierten GPU besser, weil die GPU das Modell parallel verarbeitet. Mehr RAM hilft, wenn die GPU nicht ausreicht und Teile des Modells in den System-RAM ausgelagert werden. Ideal ist beides, genug VRAM für das Modell und genug RAM als Puffer.
Brauche ich zwei GPUs für große Modelle?
Nicht zwingend. Mit starken Quantisierungen passen auch große Modelle auf eine einzelne Consumer-GPU, wenn sie 24 GB VRAM hat. Für FP16 oder Q8_0 bei 70B oder mehr brauchst Du mehr VRAM, also mehrere GPUs oder Apple Silicon mit großem Unified Memory.
Was passiert, wenn der VRAM voll ist?
Das Framework lagert die überschüssigen Modellteile in den System-RAM aus. Das Modell läuft weiter, aber die Teile im System-RAM werden von der CPU berechnet, was deutlich langsamer ist. Du merkst das an einer niedrigeren Tokens-pro-Sekunde-Rate.
Wie viel RAM brauche ich minimum für lokale KI?
Für kleine Modelle wie 7B in Q4_K_M reichen 16 GB RAM im CPU-Betrieb. Für flüssiges Arbeiten mit GPU-Offloading solltest Du 32 GB RAM haben. Für große Modelle ab 30B sind 64 GB RAM oder mehr empfehlenswert.
Reicht eine integrierte Grafikkarte für lokale KI?
Für sehr kleine Modelle und Experimente ja, aber die Performance ist deutlich schlechter als mit einer dedizierten GPU. Integrierte Grafikkarten teilen sich den Speicher mit dem System-RAM und haben wenig eigene Rechenkerne. Für ernsthafte Nutzung ist eine dedizierte GPU empfehlenswert.
Wie beeinflusst die Kontextlänge den Speicherbedarf?
Der KV-Cache wächst linear mit der Kontextlänge. Ein Modell mit 2048 Tokens Kontext braucht wenig zusätzlichen Speicher, bei 32.768 Tokens kann der KV-Cache mehrere Gigabyte groß werden. Wenn Du lange Dokumente verarbeitest, plane entsprechend mehr Speicher ein.
Soll ich Q4_K_M oder Q5_K_M wählen?
Q4_K_M ist der beste Einstieg für knappen Speicher, die Qualität ist für die meisten Anwendungen gut genug. Q5_K_M braucht etwa 25 Prozent mehr Speicher, die Qualität ist minimal besser. Wenn Du genug Speicher hast, nimm Q5_K_M, wenn Speicher knapp ist, nimm Q4_K_M.
Kann ich mehrere Modelle gleichzeitig laufen lassen?
Ja, aber jeder Modell lädt separat in den Speicher. Zwei 8B Modelle in Q4_K_M brauchen zusammen etwa 10 GB nur für die Modellgewichte, plus KV-Cache und Overhead. Plane genug Speicher ein, wenn Du mehrere Modelle parallel nutzt.
Wie viel Speicher braucht das Betriebssystem selbst?
Unter Linux kommst Du mit 1 bis 2 GB aus. Unter Windows sind es mit Browser und Hintergrundprozessen schnell 4 bis 6 GB. Unter macOS plane etwa 3 bis 4 GB ein. Wenn Du unsicher bist, nimm 4 GB als Puffer für das Betriebssystem.
Lohnt sich FP16 für bessere Qualität?
Für reine Inferenz im Alltag ist der Qualitätsunterschied zwischen Q4_K_M und FP16 meistens klein, der Speicherbedarf ist aber viermal so hoch. FP16 lohnt sich für Training und Fine-Tuning. Für das Ausführen von Modellen ist Q4_K_M oder Q5_K_M die bessere Wahl.
Was ist Unified Memory bei Apple Silicon?
Unified Memory bedeutet, dass CPU und GPU sich denselben Speicher teilen. Es gibt keinen getrennten VRAM. Das ist ein Vorteil für lokale KI, weil ein Mac mit 64 GB RAM effektiv 64 GB Speicher für Modelle zur Verfügung hat, abzüglich des Betriebssystems. Bei Nvidia-GPUs ist der VRAM auf 24 GB bei Consumer-Modellen begrenzt.
Quellen und weiterführende Literatur
- Ollama Modell-Dokumentation
- Nvidia GPU-Spezifikationen
- Hugging Face Model Cards
- llama.cpp Quantisierungs-Dokumentation
- Apple Silicon Spezifikationen


