Skip to content
BotServBotServ
RAGRetrieval Augmented GenerationVektordatenbankEmbeddingsDokumentensuchelokale KI

RAG Grundlagen

Retrieval Augmented Generation verstehen: Dokumente indizieren, passende Abschnitte finden und Sprachmodelle damit beantworten.

S

schutzgeist

2 min read
RAG-Pipeline mit Dokumenten, Vektordatenbank und Modell

RAG Grundlagen

Einleitung

Sprachmodelle kennen nur das, was in ihren Trainingsdaten steht. Bei firmeneigenen oder privaten Dokumenten versagt das Wissen. RAG, also Retrieval Augmented Generation, schafft Abhilfe. Es kombiniert eine Dokumentensuche mit der Textgenerierung eines Modells. So beantwortet die KI Fragen auf Basis Deiner eigenen Inhalte.

RAG - In A Nutshell

RAG funktioniert in zwei Schritten. Zuerst sucht das System Dokumentenabschnitte, die zur Frage passen. Dann übergibt es diese Abschnitte zusammen mit der Frage an ein Sprachmodell. Das Modell formuliert die Antwort auf Basis der gelieferten Informationen.

Das hat zwei Vorteile: Das Modell muss die Dokumente nicht auswendig kennen, und Deine Antworten bleiben nachprüfbar, weil Quellen sichtbar sind.

Wichtige Begriffe und Komponenten

BegriffBedeutung
RetrievalSuche nach passenden Dokumentenabschnitten
GenerationErzeugen der Antwort durch das Sprachmodell
EmbeddingsZahlenvektoren, die den Inhalt von Texten repräsentieren
VektordatenbankSpeicher, der Dokumente als Vektoren ablegt und durchsucht
ChunkingAufteilen von Dokumenten in sinnvolle Abschnitte
KontextDie an das Modell übergebenen Dokumentenabschnitte

Praxisrelevanz

Wann ist RAG sinnvoll?

RAG ist sinnvoll, sobald Du eigene Dokumente befragen willst. Beispiele sind interne Wissensdatenbanken, Vertragsverwaltung, Handbücher, wissenschaftliche Arbeiten oder Kundendokumentationen. Statt lange Dokumente ins Kontextfenster zu quetschen, greift RAG nur die relevanten Stellen heraus.

Wie sieht ein typischer Ablauf aus?

  1. Dokumente laden und in Abschnitte teilen.
  2. Aus jedem Abschnitt einen Embedding-Vektor erzeugen.
  3. Vektoren in einer Datenbank speichern.
  4. Bei einer Frage einen passenden Vektor suchen.
  5. Gefundene Abschnitte und Frage an das Modell übergeben.
  6. Modell erzeugt Antwort und nennt Quellen.

Vor- und Nachteile im Vergleich

VorteilNachteil
Aktuelles Wissen aus eigenen DokumentenAufbau und Pflege der Datenbank nötig
Nachprüfbare QuellenQualität hängt von Chunking und Embedding ab
Weniger Speicher im KontextfensterZusätzliche Komponenten wie Vektordatenbank
Geringerer Bedarf an ModellgrößeSchlechtes Chunking führt zu schlechten Antworten

Hardware-, Kosten- und Sicherheitsbetrachtung

RAG braucht ein Embedding-Modell, das auf dem Rechner läuft, sowie Speicherplatz für die Vektordatenbank. Beides ist wenig speicherhungrig im Vergleich zu großen Sprachmodellen. Die Kosten halten sich in Grenzen, weil Open-Source-Modelle und kostenlose Vektordatenbanken wie Chroma oder Qdrant existieren.

Sicherheit ist ein großer Vorteil. Deine Dokumente verlassen Deinen Rechner nicht. Das ist besonders für Unternehmen und sensible Daten wichtig.

Weitere KI Infos und Themen

  • RAG verbindet Dokumentensuche mit Sprachmodell-Antworten.
  • Wichtige Bausteine sind Chunking, Embeddings und Vektordatenbank.
  • Gutes Chunking und gute Embeddings sind entscheidend für die Qualität.
  • Lokales RAG hält Daten intern.

Mehr zur Technik findest Du in Chunking und Embedding-Modelle. Für Vektordatenbanken siehe Chroma.

FAQ - Typische Fragen zu RAG

Brauche RAG viel Speicher?

Die Vektordatenbank selbst ist meist klein. Größere Kosten verursachen die Originaldokumente. Für viele tausend Dokumente reichen wenige Gigabyte Speicher.

Kann RAG auch mit PDFs umgehen?

Ja, mit passenden Parsern oder OCR. Die meisten RAG-Pipelines unterstützen PDFs, Word-Dokumente und Webseiten.

Muss das Sprachmodell auf den Dokumenten trainiert sein?

Nein. Das Modell erhält die relevanten Passagen im Prompt. Es muss diese nur verstehen und zusammenfassen.

Was ist besser: langer Kontext oder RAG?

Für große Dokumentenmengen ist RAG meist effizienter. Lange Kontexte verbrauchen viel Speicher und werden mit zunehmender Länge ungenauer.

Tools und Weiterführendes

Für den Einstieg eignen sich Open WebUI mit RAG-Funktion, Chroma, Qdrant, LangChain und LlamaIndex. Embedding-Modelle findet man auf Hugging Face.

Quellen

  • LangChain RAG-Tutorials
  • Qdrant Dokumentation
  • Hugging Face Embedding-Modelle
Zurück zum KI Blog
Share:

Nächster Artikel in Lokale KI

Weiterlesen
Chroma einrichten

Ähnliche Beiträge