RAM-Rechner für lokale KI
Was dieser Artikel über RAM-Rechner behandelt
- Wie viel RAM ein lokales KI-System braucht.
- Welche Komponenten zusammen den Speicherbedarf ergeben.
- Wie Du Betriebssystem, Container, Modell und RAG einplanst.
- Wie Du mit begrenztem RAM effektiv arbeitest.
Einleitung: RAM für lokale KI berechnen
Viele Anfänger überschätzen die Bedeutung der Grafikkarte und unterschätzen den Arbeitsspeicher. RAM ist aber genauso wichtig. Er entscheidet, ob Du Modelle laden, RAG betreiben und mehrere Dienste gleichzeitig laufen lassen kannst.
Wer nur gelegentlich ein kleines Modell nutzt, kommt mit 16 GB RAM aus. Wer dauerhaft mehrere Container, Vektordatenbanken und ein großes Modell laufen lässt, braucht 32 GB, 64 GB oder sogar mehr. Die Berechnung hilft Dir, das richtige Maß zu finden.
Warum brauche ich einen RAM-Rechner?
Ohne Planung passiert es schnell, dass das System in den Swap auslagert. Dann wird alles langsam, und Modelle reagieren mit hoher Latenz. Ein RAM-Rechner zeigt Dir vor dem Kauf oder der Konfiguration, wie viel Speicher Du wirklich brauchst.
Außerdem hilft die Berechnung dabei, Alt-Systeme richtig einzuschätzen. Vielleicht reicht ein vorhandener Rechner mit kleineren Modellen doch noch aus.
RAM-Bedarf kurz erklärt
Der Gesamt-RAM setzt sich aus mehreren Teilen zusammen:
- Betriebssystem-Overhead: Linux, Windows oder macOS reservieren 2 bis 6 GB.
- Ollama oder Modell-Runtime: Das Sprachmodell selbst belegt VRAM oder RAM, je nach Konfiguration.
- Vektordatenbank: Chroma, Qdrant oder PostgreSQL mit Vektorsuche brauchen Speicher.
- Weitere Dienste: Web-UI, Reverse Proxy, Datenbanken, Monitoring.
- Reserve: Mindestens 10 bis 20 Prozent Puffer für Spitzen.
Für einen stabilen Betrieb sollte der gesamte Arbeitsspeicher nicht dauerhaft über 80 Prozent ausgelastet sein.
Für wen ist der RAM-Rechner gedacht?
- Für alle, die einen KI-Heimserver planen.
- Für Nutzer, die wissen wollen, ob ihr vorhandener Rechner reicht.
- Für Admins, die mehrere Containerdienste gleichzeitig betreiben.
- Für Einsteiger, die die Dimensionierung der Hardware verstehen wollen.
Wichtige Begriffe rund um RAM-Berechnung
- Swap: Auslagerung auf die Festplatte, wenn der RAM voll ist. Macht das System langsam.
- RAM-Disk: Ein Teil des Arbeitsspeichers wird als virtuelles Laufwerk genutzt.
- Shared Memory: Speicher, den mehrere Prozesse gemeinsam nutzen.
- Vektordatenbank-Speicher: Zusätzlicher RAM für Embeddings und Indizes.
- Overhead: Nicht direkt sichtbarer Speicherverbrauch von Frameworks und Bibliotheken.
Praxisbeispiele für RAM-Berechnung
Minimaler Chatbot
- Linux: 2 GB
- Ollama mit 3B-Modell Q4: 1,5 GB
- Open WebUI: 500 MB
- Reserve: 2 GB
Empfohlener RAM: 8 GB
RAG-System für Bücher
- Linux: 2 GB
- Ollama mit 8B-Modell Q4: 5 GB
- Chroma oder Qdrant: 4 GB
- Open WebUI: 500 MB
- Reserve: 4 GB
Empfohlener RAM: 32 GB
Multi-Service-Server
- Linux: 3 GB
- Ollama mit 13B-Modell Q4: 9 GB
- Vektordatenbank, n8n, Reverse Proxy: 6 GB
- Sonstige Container: 4 GB
- Reserve: 6 GB
Empfohlener RAM: 64 GB
Typische Stolpersteine bei der RAM-Planung
- Nur das Modell betrachten: Container, Datenbank und UI brauchen ebenfalls RAM.
- Keine Reserve einplanen: Bei Spitzenlast stürzt das System ab oder wird extrem langsam.
- Swap als Lösung sehen: Swap ist eine Notbremse, kein Ersatz für RAM.
- Zu viele Dienste starten: Jeder Container verbraucht Speicher, besonders Java- oder Python-Anwendungen.
- GPU-Offloading vergessen: Wenn das Modell in den VRAM ausgelagert werden kann, spart das System-RAM.
Weiterführende Links und Infos zum RAM-Rechner
FAQ: RAM-Rechner für lokale KI
Ist 16 GB RAM für lokale KI genug? Für kleine Modelle und einen einfachen Bot reicht 16 GB. Für RAG oder mehrere Dienste wird es schnell knapp.
Was passiert, wenn nicht genug RAM vorhanden ist? Das System lagert in den Swap aus oder bricht Aktionen ab. Modelle reagieren extrem langsam oder lassen sich nicht laden.
Brauche ich DDR5 für lokale KI? DDR5 ist hilfreich, aber nicht zwingend. Menge und Stabilität sind wichtiger als die neueste Technologie.
Hilft GPU-Offloading beim RAM-Sparen? Ja. Wenn das Modell auf der GPU läuft, wird weniger System-RAM benötigt. Der VRAM ist dann entscheidend.
Sollte ich lieber mehr RAM oder mehr VRAM kaufen? Für reine Modellausführung ist VRAM wichtiger. Für RAG, Container und viele parallele Dienste ist RAM genauso wichtig.
Quellen und weiterführende Literatur
- Ollama Dokumentation: https://ollama.com/
- Qdrant Dokumentation: https://qdrant.tech/documentation/
- Chroma Dokumentation: https://docs.trychroma.com/
Zusammenfassung: RAM-Rechner für lokale KI
Der RAM-Bedarf setzt sich aus Betriebssystem, Modell, Vektordatenbank, weiteren Diensten und einer Reserve zusammen. Für einen einfachen Chatbot reichen 8 bis 16 GB, für ein RAG-System mit mehreren Diensten eher 32 bis 64 GB. Wer den Bedarf vor der Hardware-Anschaffung überschlägt, vermeidet teure Fehlkäufe und langsames Swap-Verhalten.


