Lokales RAG
Was dieser Artikel behandelt
- Was RAG ist und warum es sinnvoll ist.
- Die einzelnen Schritte: Chunking, Embedding, Speicherung, Abfrage.
- Verweise auf alle RAG-Artikel.
Einleitung
RAG - Retrieval-Augmented Generation - ermöglicht es, eigene Dokumente in Sprachmodelle einzubeziehen. Statt auf allgemeines Wissen zu antworten, greift das Modell auf hochgeladene Inhalte zurück. Lokal betrieben bleiben die Daten im eigenen Netzwerk.
Inhalt
- RAG Grundlagen - Aufbau, Ablauf und typische Anwendungsfälle.
- Chunking - Wie Dokumente in sinnvolle Teile zerlegt werden.
- Embedding-Modelle - Wie Text in Vektoren umgewandelt wird.
- Vektordatenbanken - Speicherlösungen wie Chroma und Qdrant.
- RAG vs. Kontextfenster - Wann RAG lohnt und wann ein großes Kontextfenster reicht.
- Dokumente vorbereiten - Formate, Bereinigung und Strukturierung für saubere RAG-Daten.
- PDF und OCR - Gescannte Dokumente mit Tesseract und Layout-Erkennung nutzbar machen.
- Reranking - Cross-Encoder und Reranker für bessere RAG-Ergebnisse.
- Hybrid Search - Semantische und lexikalische Suche kombinieren.
- Quellenangaben - Nachverfolgbare Antworten mit Metadaten und Zitaten.
- RAG-Qualität testen - Metriken wie Recall, Precision und RAGAS.
- Wissensbestand aktualisieren - RAG-Daten pflegen, aktualisieren und versionieren.
- RAG-Tutorials - Schritt-für-Schritt Anleitungen mit Python-Code.
Wichtige Begriffe
| Begriff | Bedeutung |
|---|---|
| Chunking | Zerlegen von Text in Such-Stücke |
| Embedding | Vektorielle Repräsentation von Text |
| Vektordatenbank | Speicher für Embeddings mit Ähnlichkeitssuche |
| Retrieval | Suche nach passenden Dokumententeilen |
FAQ - Häufige Fragen
Kann ich RAG vollständig lokal betreiben?
Ja. Ollama für Modelle, Chroma oder Qdrant für Vektordatenbanken und lokale Dokumente reichen für einen vollständig lokalen RAG-Stack.
Was kostet lokales RAG?
Hauptsächlich Hardware und Strom. Die Software ist Open Source. Keine laufenden API-Kosten.


