RAG Grundlagen
Einleitung
Sprachmodelle kennen nur das, was in ihren Trainingsdaten steht. Bei firmeneigenen oder privaten Dokumenten versagt das Wissen. RAG, also Retrieval Augmented Generation, schafft Abhilfe. Es kombiniert eine Dokumentensuche mit der Textgenerierung eines Modells. So beantwortet die KI Fragen auf Basis Deiner eigenen Inhalte.
RAG - In A Nutshell
RAG funktioniert in zwei Schritten. Zuerst sucht das System Dokumentenabschnitte, die zur Frage passen. Dann übergibt es diese Abschnitte zusammen mit der Frage an ein Sprachmodell. Das Modell formuliert die Antwort auf Basis der gelieferten Informationen.
Das hat zwei Vorteile: Das Modell muss die Dokumente nicht auswendig kennen, und Deine Antworten bleiben nachprüfbar, weil Quellen sichtbar sind.
Wichtige Begriffe und Komponenten
| Begriff | Bedeutung |
|---|---|
| Retrieval | Suche nach passenden Dokumentenabschnitten |
| Generation | Erzeugen der Antwort durch das Sprachmodell |
| Embeddings | Zahlenvektoren, die den Inhalt von Texten repräsentieren |
| Vektordatenbank | Speicher, der Dokumente als Vektoren ablegt und durchsucht |
| Chunking | Aufteilen von Dokumenten in sinnvolle Abschnitte |
| Kontext | Die an das Modell übergebenen Dokumentenabschnitte |
Praxisrelevanz
Wann ist RAG sinnvoll?
RAG ist sinnvoll, sobald Du eigene Dokumente befragen willst. Beispiele sind interne Wissensdatenbanken, Vertragsverwaltung, Handbücher, wissenschaftliche Arbeiten oder Kundendokumentationen. Statt lange Dokumente ins Kontextfenster zu quetschen, greift RAG nur die relevanten Stellen heraus.
Wie sieht ein typischer Ablauf aus?
- Dokumente laden und in Abschnitte teilen.
- Aus jedem Abschnitt einen Embedding-Vektor erzeugen.
- Vektoren in einer Datenbank speichern.
- Bei einer Frage einen passenden Vektor suchen.
- Gefundene Abschnitte und Frage an das Modell übergeben.
- Modell erzeugt Antwort und nennt Quellen.
Vor- und Nachteile im Vergleich
| Vorteil | Nachteil |
|---|---|
| Aktuelles Wissen aus eigenen Dokumenten | Aufbau und Pflege der Datenbank nötig |
| Nachprüfbare Quellen | Qualität hängt von Chunking und Embedding ab |
| Weniger Speicher im Kontextfenster | Zusätzliche Komponenten wie Vektordatenbank |
| Geringerer Bedarf an Modellgröße | Schlechtes Chunking führt zu schlechten Antworten |
Hardware-, Kosten- und Sicherheitsbetrachtung
RAG braucht ein Embedding-Modell, das auf dem Rechner läuft, sowie Speicherplatz für die Vektordatenbank. Beides ist wenig speicherhungrig im Vergleich zu großen Sprachmodellen. Die Kosten halten sich in Grenzen, weil Open-Source-Modelle und kostenlose Vektordatenbanken wie Chroma oder Qdrant existieren.
Sicherheit ist ein großer Vorteil. Deine Dokumente verlassen Deinen Rechner nicht. Das ist besonders für Unternehmen und sensible Daten wichtig.
Weitere KI Infos und Themen
- RAG verbindet Dokumentensuche mit Sprachmodell-Antworten.
- Wichtige Bausteine sind Chunking, Embeddings und Vektordatenbank.
- Gutes Chunking und gute Embeddings sind entscheidend für die Qualität.
- Lokales RAG hält Daten intern.
Mehr zur Technik findest Du in Chunking und Embedding-Modelle. Für Vektordatenbanken siehe Chroma.
FAQ - Typische Fragen zu RAG
Brauche RAG viel Speicher?
Die Vektordatenbank selbst ist meist klein. Größere Kosten verursachen die Originaldokumente. Für viele tausend Dokumente reichen wenige Gigabyte Speicher.
Kann RAG auch mit PDFs umgehen?
Ja, mit passenden Parsern oder OCR. Die meisten RAG-Pipelines unterstützen PDFs, Word-Dokumente und Webseiten.
Muss das Sprachmodell auf den Dokumenten trainiert sein?
Nein. Das Modell erhält die relevanten Passagen im Prompt. Es muss diese nur verstehen und zusammenfassen.
Was ist besser: langer Kontext oder RAG?
Für große Dokumentenmengen ist RAG meist effizienter. Lange Kontexte verbrauchen viel Speicher und werden mit zunehmender Länge ungenauer.
Tools und Weiterführendes
Für den Einstieg eignen sich Open WebUI mit RAG-Funktion, Chroma, Qdrant, LangChain und LlamaIndex. Embedding-Modelle findet man auf Hugging Face.
Quellen
- LangChain RAG-Tutorials
- Qdrant Dokumentation
- Hugging Face Embedding-Modelle


