PC für RAG: Hardware für Wissensdatenbanken
Was dieser Artikel über RAG-Hardware behandelt
- Welche Hardware-Komponenten für lokales RAG wirklich zählen, von GPU bis SSD
- Wie viel VRAM Du brauchst, wenn LLM und Embedding-Modell gleichzeitig laufen
- Warum Vektordatenbanken wie Chroma und Qdrant viel RAM verbrauchen
- Welche Builds sich für RAG eignen, vom Budget-PC bis zur Workstation
- Welche Stolpersteine Du beim Aufbau eines RAG-Systems vermeiden solltest
Einleitung: PC für RAG verständlich erklärt
Lokales RAG kombiniert ein Sprachmodell mit einer eigenen Wissensdatenbank. Statt das Modell auf alles zu trainieren, durchsuchst Du Deine Dokumente zur Laufzeit und gibst die relevanten Stellen als Kontext an das LLM. Das funktioniert lokal, ohne Cloud, ohne API-Kosten.
Das Problem: RAG stellt andere Hardware-Anforderungen als reines LLM-Inferenz. Du betreibst gleichzeitig ein LLM, ein Embedding-Modell und eine Vektordatenbank. Alle drei konkurrieren um VRAM, RAM und Speicherbandbreite. Ein PC, der ein 7B-Modell flüssig ausführt, kann an RAG scheitern, wenn Vektordatenbank und Embedding-Modell hinzukommen.
Dieser Artikel erklärt, welcher PC für RAG sinnvoll ist und welche Builds sich für verschiedene Budgets eignen. Weitere Empfehlungen findest Du im Bereich Kaufberatung.
Warum brauche ich spezielle Hardware für RAG?
Ein normales LLM-Setup lädt ein Modell in den VRAM und generiert Text. RAG macht mehr: Wenn Du eine Frage stellst, durchsucht das System erst Deine Vektordatenbank nach passenden Textabschnitten. Dafür wandelt ein Embedding-Modell Deine Frage in einen Vektor um. Die Vektordatenbank vergleicht diesen Vektor mit allen gespeicherten Vektoren und liefert die besten Treffer zurück. Erst dann geht der zusammengesetzte Prompt an das LLM.
Konkret laufen dabei drei Dinge gleichzeitig oder nacheinander:
- Embedding-Modell: Wandelt die Anfrage in Vektoren um, braucht VRAM oder RAM
- Vektordatenbank: Hält alle Embeddings im Speicher, braucht RAM
- LLM: Generiert die Antwort aus dem Kontext, braucht VRAM
Wenn Du ein 7B-LLM mit 6 GB VRAM betreibst und ein Embedding-Modell wie nomic-embed-text noch einmal 1 bis 2 GB braucht, sind schon 8 GB belegt. Dazu kommt der KV-Cache, der mit längeren Dokumenten schnell mehrere GB erreicht. Wer das nicht einplant, bekommt Performance-Probleme.
Die Grundlagen dazu findest Du im Artikel Hardware richtig dimensionieren.
PC für RAG kurz erklärt
Für RAG brauchst Du drei Dinge gleichzeitig: VRAM für LLM und Embedding-Modell, RAM für die Vektordatenbank und eine schnelle SSD. Als Faustregel: Mindestens 12 GB VRAM für ein 7B-LLM plus Embedding-Modell, 32 GB RAM für kleinere Vektordatenbanken und eine NVMe SSD. Wer größere Sammlungen durchsucht, sollte 64 GB RAM oder mehr einplanen.
Für wen ist dieser Artikel gedacht?
Dieser Artikel richtet sich an Einsteiger und Fortgeschrittene, die einen PC für lokales RAG planen oder aufrüsten wollen. Wenn Du weißt, was eine Vektordatenbank macht und was VRAM ist, reicht das. Wer ganz neu einsteigt, findet im Artikel RAG Grundlagen eine breitere Übersicht.
Wichtige Begriffe rund um RAG-Hardware
| Begriff | Bedeutung |
|---|---|
| VRAM | Videospeicher der GPU. Platz für LLM und Embedding-Modell. |
| RAM | Arbeitsspeicher des Systems. Hält die Vektordatenbank im Speicher. |
| Embedding-Modell | Wandelt Text in Vektoren um. Braucht VRAM oder RAM, je nach Setup. |
| Vektordatenbank | Speichert Embeddings und ermöglicht Ähnlichkeitssuche. Beispiele: Chroma, Qdrant. |
| SSD | Festplatte für Modelle und Dokumente. NVMe ist deutlich schneller als SATA. |
| NVMe | Schnelle SSD-Schnittstelle. Wichtig für kurze Ladezeiten beim Start. |
| KV-Cache | Speichert berechnete Attention-Werte während der Inferenz. Wächst mit dem Kontext. |
| Chunking | Aufteilung von Dokumenten in Abschnitte vor dem Embedding. |
| Retrieval | Suchvorgang in der Vektordatenbank nach passenden Textabschnitten. |
| Reranking | Zweite Bewertung der Suchergebnisse für bessere Relevanz. Braucht zusätzlich Rechenleistung. |
RAG-Hardware-Anforderungen
RAG bedeutet, dass drei Komponenten gleichzeitig Ressourcen brauchen. Die folgende Tabelle zeigt typische Anforderungen für ein lokales RAG-Setup mit einem 7B-LLM.
| Komponente | VRAM-Bedarf | RAM-Bedarf | Hinweis |
|---|---|---|---|
| 7B-LLM (Q4) | 5 bis 6 GB | 16 GB | Hauptmodell für Antwortgenerierung |
| Embedding-Modell | 1 bis 2 GB | 4 GB | z.B. nomic-embed-text, all-MiniLM |
| KV-Cache (8k Kontext) | 1 bis 3 GB | - | Wächst mit Kontextlänge |
| Vektordatenbank | - | 4 bis 32 GB | Hängt von Anzahl der Vektoren ab |
| Betriebssystem + Rest | - | 8 GB | Browser, IDE, andere Programme |
Zusammen kommst Du auf etwa 8 bis 11 GB VRAM und 32 bis 64 GB RAM für ein brauchbares 7B-RAG-Setup. Wer ein 13B-LLM nutzt, braucht entsprechend mehr VRAM. Details findest Du in den Artikeln Embedding-Modelle und Vektordatenbanken.
GPU für RAG
Die GPU in einem RAG-System muss zwei Modelle laden: das LLM und das Embedding-Modell. Beide brauchen VRAM. Wenn beide zusammen nicht in den VRAM passen, gibt es zwei Strategien.
Strategie 1: Beide Modelle gleichzeitig im VRAM. Das ist die schnellste Variante. Bei jeder Anfrage wird sofort embeddiert und gesucht, ohne Ladezeit. Du brauchst genug VRAM für beide plus KV-Cache. Ein 7B-LLM in Q4 (6 GB) plus nomic-embed-text (1 GB) plus KV-Cache (2 GB) braucht etwa 9 GB VRAM. Eine RTX 3060 mit 12 GB schafft das.
Strategie 2: Modelle nacheinander laden. Wenn der VRAM nicht reicht, entlädst Du das LLM, lädst das Embedding-Modell, embeddierst die Anfrage und lädst das LLM wieder. Das kostet jedes Mal mehrere Sekunden Ladezeit. Für interaktive Nutzung ist das unkomfortabel, für Batch-Verarbeitung akzeptabel.
Mit Ollama kannst Du beide Modelle verwalten. Ollama hält Modelle im Speicher, wenn genug Platz ist, und entlädt sie automatisch bei Knappheit. Die Einstellung OLLAMA_KEEP_ALIVE steuert, wie lange Modelle geladen bleiben.
Empfohlene GPUs für RAG:
- RTX 3060 12 GB: Einstieg für 7B-RAG. Beide Modelle passen gleichzeitig in den VRAM.
- RTX 4070 12 GB: Schneller, gleicher VRAM. Gut für 7B mit längeren Kontexten.
- RTX 3090 24 GB: Viel VRAM für 13B-LLM plus Embedding-Modell plus großen KV-Cache.
- RTX 4090 24 GB: Maximale Geschwindigkeit für 13B-RAG-Setups.
RAM und Vektordatenbank
Vektordatenbanken wie Chroma und Qdrant halten ihre Embeddings im RAM, um schnelle Ähnlichkeitssuche zu ermöglichen. Je mehr Dokumente Du hast, desto mehr RAM brauchst Du.
Ein Embedding mit 768 Dimensionen braucht etwa 3 KB Speicher. Bei 100.000 Dokumenten mit jeweils 10 Chunks sind das 1 Million Vektoren, also etwa 3 GB RAM nur für die Vektoren. Dazu kommt Metadata und Indexstruktur, das verdoppelt den Bedarf grob.
| Dokumente | Chunks | Vektoren | RAM-Bedarf (ca.) |
|---|---|---|---|
| 1.000 | 10.000 | 10.000 | 0,1 GB |
| 10.000 | 100.000 | 100.000 | 0,8 GB |
| 100.000 | 1.000.000 | 1.000.000 | 8 GB |
| 500.000 | 5.000.000 | 5.000.000 | 40 GB |
Wer große Dokumentensammlungen durchsucht, braucht deutlich mehr RAM. 32 GB sind für kleine bis mittlere Sammlungen ausreichend. Bei mehreren hunderttausend Dokumenten solltest Du 64 GB oder mehr einplanen.
SSD: Warum NVMe wichtig ist
RAG lädt regelmäßig Modelle und Dokumente. Beim Start lädt Ollama das LLM und das Embedding-Modell. Eine NVMe SSD mit 3.500 MB/s oder mehr lädt ein 5 GB-Modell in unter zwei Sekunden. Eine SATA SSD mit 550 MB/s braucht dafür etwa neun Sekunden.
Auch die Vektordatenbank profitiert von NVMe. Beim Start lädt Chroma oder Qdrant den Index von der Festplatte in den RAM. Bei großen Sammlungen kann das mehrere Gigabyte sein. NVMe reduziert die Startzeit deutlich.
Zusätzlich speicherst Du die Originaldokumente auf der SSD. Bei großen Sammlungen kommst Du schnell auf mehrere hundert Gigabyte. Eine 2 TB NVMe SSD gibt Dir genug Luft für Modelle, Vektordatenbank und Dokumente.
Empfohlene Hardware im Amazon Shop
Hardware für RAG im Amazon Shop
Bei Amazon ansehenAffiliate-Link: Bei einem Kauf erhalten wir möglicherweise eine Provision.
Build-Vorschläge für RAG-PCs
Build 1: Budget, etwa 700 bis 900 EUR
- CPU: AMD Ryzen 5 5600 oder Intel Core i5-12400F
- RAM: 32 GB DDR4
- GPU: RTX 3060 12 GB
- Speicher: 1 TB NVMe SSD
- Netzteil: 550 W, 80+ Bronze
Dieser Build führt ein 7B-LLM plus Embedding-Modell gleichzeitig aus. 32 GB RAM reichen für Vektordatenbanken bis etwa 100.000 Vektoren. Ideal für den Einstieg.
Build 2: Mittelklasse, etwa 1.400 bis 2.000 EUR
- CPU: AMD Ryzen 5 7600 oder Intel Core i5-13600K
- RAM: 64 GB DDR5
- GPU: RTX 4070 12 GB oder gebrauchte RTX 3090 24 GB
- Speicher: 2 TB NVMe SSD
- Netzteil: 750 W, 80+ Gold
Mit 24 GB VRAM (RTX 3090) laufen 13B-LLM plus Embedding-Modell plus großer KV-Cache. 64 GB RAM geben Dir Luft für Vektordatenbanken mit mehreren hunderttausend Vektoren.
Build 3: High-End, etwa 3.500 bis 5.500 EUR
- CPU: AMD Ryzen 9 7950X oder Intel Core i9-14900K
- RAM: 128 GB DDR5
- GPU: 2x RTX 4090 24 GB oder 2x RTX 3090 24 GB
- Speicher: 4 TB NVMe SSD
- Netzteil: 1.200 W, 80+ Platinum
48 GB VRAM ermöglichen große LLMs bis 70B in Q4, plus Embedding-Modell und Reranking-Modell gleichzeitig. 128 GB RAM sorgen dafür, dass auch Vektordatenbanken mit Millionen von Einträgen laufen.
RAG Performance-Tipps
- Modelle gleichzeitig halten: Lass LLM und Embedding-Modell im VRAM, wenn Platz ist. Das spart Ladezeit bei jeder Anfrage.
- Quantisierung wählen: Q4_K_M ist ein guter Standard für das LLM. Für das Embedding-Modell reicht oft Q8 oder FP16, da diese Modelle klein sind. Mehr dazu unter Quantisierung.
- Kontextlänge begrenzen: Der KV-Cache wächst mit dem Kontext. Bei RAG gibst Du mehrere Chunks als Kontext. Reduziere die Anzahl oder Größe der Chunks, wenn der VRAM knapp wird.
- Caching nutzen: Wenn Du dieselben Fragen mehrfach stellst, cache die Embeddings und Suchergebnisse. Das spart Embedding-Zeit und Datenbank-Abfragen.
- Batch-Embedding: Wenn Du viele Dokumente hinzufügst, embeddiere sie in Batches statt einzeln. Das nutzt die GPU besser aus.
- Reranking sparsam einsetzen: Ein Reranking-Modell verbessert die Suchergebnisse, braucht aber zusätzlich VRAM und Rechenzeit. Nutze es nur, wenn die Retrieval-Qualität nicht ausreicht.
Typische Stolpersteine bei RAG-Hardware
- VRAM zu knapp bemessen: Wer nur das LLM einplant und das Embedding-Modell vergisst, hat nicht genug VRAM. Plane immer beide Modelle plus KV-Cache ein.
- Vektordatenbank im VRAM: Chroma und Qdrant laufen im RAM, nicht im VRAM. Die GPU ist für LLM und Embedding-Modell da.
- RAM unterschätzt: Große Vektordatenbanken brauchen viel RAM. Wer 16 GB hat und 500.000 Dokumente durchsucht, kommt an die Grenze. Das System fängt an zu swappen.
- Embedding-Modell zu groß: Große Embedding-Modelle wie
bge-largebrauchen mehr VRAM als kleine wieall-MiniLM. Wähle das Modell entsprechend Deiner Hardware. - Kontextlänge beim LLM ignoriert: RAG fügt mehrere Chunks zum Prompt hinzu. Bei 10 Chunks à 500 Tokens bist Du bei 5.000 Tokens Kontext. Der KV-Cache verbraucht entsprechend VRAM.
- Langsame SSD als Flaschenhals: Beim Laden von Modellen und beim Start der Vektordatenbank macht eine SATA SSD den Unterschied spürbar. NVMe ist für RAG praktisch Pflicht.
- Netzteil zu schwach: Zwei RTX 3090 ziehen unter Last über 700 W allein. Ein schwaches Netzteil führt zu Abstürzen.
- Gehäuse zu klein: Große GPUs passen nicht in jedes Gehäuse. Bei Dual-GPU-Setups miss vorher nach.
Hardware, Kosten und Sicherheit bei RAG
Lokales RAG bedeutet, dass Deine Dokumente und Anfragen Deinen Rechner nicht verlassen. Vertrauliche Dokumente, interne Wikis und persönliche Notizen bleiben auf Deiner Festplatte.
Kostenmäßig ist die Hardware einmalig, danach fallen keine API-Kosten an. Wer regelmäßig eine Wissensdatenbank mit mehreren tausend Dokumenten durchsucht, amortisiert einen Build für 1.500 EUR schnell. Stromkosten solltest Du einplanen: Eine RTX 4090 zieht unter Last bis zu 450 W.
Sicherheitstechnisch gilt: Lade LLMs und Embedding-Modelle nur von vertrauenswürdigen Repositories wie der offiziellen Ollama-Bibliothek oder Hugging Face mit geprüften Uploadern.
Weiterführende Links und Infos zu RAG-Hardware
- Lokales RAG - Grundlagen und Einrichtung
- RAG Grundlagen - Wie RAG funktioniert
- Embedding-Modelle - Vektoren aus Text
- Vektordatenbanken - Speicherung und Suche
- Kaufberatung - Weitere Hardware-Empfehlungen
- Hardware richtig dimensionieren - Ressourcen planen
- Ollama - Modelle lokal verwalten
- Quantisierung - Modelle kleiner machen
FAQ: PC für RAG - Typische Fragen
Welche GPU brauche ich für lokales RAG?
Für ein 7B-LLM plus Embedding-Modell reicht eine RTX 3060 mit 12 GB VRAM. Für 13B-Modelle empfiehlt sich 24 GB VRAM, etwa eine RTX 3090.
Kann ich RAG ohne GPU nutzen?
Ja, RAG funktioniert auch auf der CPU. LLM und Embedding-Modell laufen dann im RAM. Die Geschwindigkeit ist aber deutlich geringer. Für interaktive Nutzung ist eine GPU empfohlen.
Wie viel RAM brauche ich für RAG?
Minimum 32 GB für kleine RAG-Setups. Bei Vektordatenbanken mit mehreren hunderttausend Vektoren solltest Du 64 GB oder mehr einplanen. Der Bedarf wächst mit der Anzahl der Dokumente.
Reicht eine RTX 3060 für RAG?
Ja, die RTX 3060 mit 12 GB VRAM ist ein guter Einstieg. Sie führt ein 7B-LLM und ein kleines Embedding-Modell gleichzeitig aus. Für 13B-Modelle wird der VRAM knapp.
Kann ich LLM und Embedding-Modell gleichzeitig auf der GPU nutzen?
Ja, wenn genug VRAM vorhanden ist. Ollama hält beide Modelle im Speicher, wenn Platz ist. Bei knapperem VRAM entlädt Ollama Modelle automatisch.
Welche Vektordatenbank ist für lokales RAG am besten?
Chroma ist einfach einzurichten und gut für den Einstieg. Qdrant ist performanter und skaliert besser bei großen Sammlungen. Beide laufen lokal und halten ihre Daten im RAM.
Wie viel Speicherplatz brauche ich für RAG?
Modelle brauchen 3 bis 40 GB pro Modell. Die Vektordatenbank braucht etwa 3 KB pro Vektor plus Index. Originaldokumente brauchen je nach Format 1 bis 10 MB. Eine 2 TB NVMe SSD ist für die meisten Setups ausreichend.
Brauche ich eine NVMe SSD für RAG?
Empfohlen, ja. RAG lädt regelmäßig Modelle und beim Start die Vektordatenbank. NVMe mit 3.500 MB/s reduziert die Ladezeiten deutlich gegenüber SATA SSDs mit 550 MB/s.
Was ist Model-Swapping bei RAG?
Model-Swapping bedeutet, dass Du das LLM entlädst, um das Embedding-Modell zu laden, und umgekehrt. Das passiert automatisch bei VRAM-Knappheit. Der Nachteil ist Ladezeit bei jedem Wechsel.
Wie beeinflusst die Kontextlänge den VRAM-Bedarf bei RAG?
Bei RAG fügst Du mehrere gefundene Textabschnitte zum Prompt hinzu. Jeder zusätzliche Token im Kontext vergrößert den KV-Cache, der im VRAM liegt. Bei 10 Chunks à 500 Tokens sind das 5.000 Tokens Kontext, die mehrere GB VRAM zusätzlich verbrauchen können.
Lohnt sich Reranking für lokales RAG?
Reranking verbessert die Reihenfolge der Suchergebnisse und kann die Antwortqualität erhöhen. Es braucht aber zusätzlich VRAM für ein weiteres Modell und kostet Rechenzeit. Für kleine Dokumentensammlungen ist es oft nicht nötig, bei großen Sammlungen mit vielen Treffern kann es helfen.
Quellen und weiterführende Literatur
- Ollama Modellbibliothek
- Ollama Dokumentation
- Chroma Vektordatenbank
- Qdrant Vektordatenbank
- NVIDIA GPU-Spezifikationen
- Hugging Face Embedding-Modelle
- Hardware für RAG im Amazon Shop


