AnythingLLM: RAG-Desktop-App für lokale KI
Was dieser Artikel über AnythingLLM behandelt
- Was AnythingLLM ist und wie es Dir hilft, mit Deinen Dokumenten zu chatten, ohne eine Zeile Code zu schreiben
- Wie Du AnythingLLM als Desktop-App oder über Docker installierst und mit lokalen Modellen verbindest
- Wie Workspaces funktionieren und warum sie den Umgang mit verschiedenen Dokumentensammlungen erleichtern
- Welche Funktionen AnythingLLM bietet, vom Agent-Modus bis zum Pinning von Antworten
- Welche Stolpersteine es gibt und wie Du typische Probleme vermeidest
Einleitung: AnythingLLM verständlich erklärt
Wenn Du Dich mit lokaler KI beschäftigst, stößt Du schnell auf einen Wunsch: Du möchtest mit Deinen eigenen Dokumenten chatten. Ein PDF-Handbuch, eine Sammlung von Notizen, ein Vertrag, all das soll nicht nur auf der Festplatte liegen, sondern befragbar sein. Du stellst eine Frage und bekommst eine Antwort, die auf Deinen Inhalten basiert.
Genau das ist die Stärke von AnythingLLM. Es ist eine Desktop-App, die RAG ohne Programmierung möglich macht. Du brauchst kein Python, keine API-Keys, keine Kommandozeile. Du installierst die App, lädst Dokumente hoch und chattest darüber. Im Hintergrund kümmert sich AnythingLLM um Embeddings, Vektordatenbank und Kontextverwaltung.
In diesem Artikel erfährst Du, was AnythingLLM kann, wie Du es installierst und wie Du es im Alltag nutzt. Wenn Du noch neu im Thema bist, lies zuerst unseren Artikel Was ist lokale KI?.
Warum brauche ich AnythingLLM?
Stell Dir vor, Du hast einen Ordner voller PDFs: Bedienungsanleitungen, Forschungsberichte, Rechnungen, Verträge. Du willst gezielt Fragen dazu stellen, ohne jedes Dokument einzeln zu öffnen und zu durchsuchen.
Ohne AnythingLLM sähe das so aus:
- Du suchst ein Python-RAG-Framework, liest Dich in die Doku ein
- Du schreibst Code für Embeddings, Vektordatenbank und Retrieval
- Du richtest eine API ein oder konfigurierst Ollama manuell
- Du debuggst Fehler, bis es endlich funktioniert
Mit AnythingLLM öffnest Du die App, ziehst Deine PDFs per Drag-and-Drop in einen Workspace und stellst Deine Frage. Fertig. Kein Code, keine Konfiguration, kein API-Setup.
Du möchtest vielleicht Folgendes:
- Dokumente hochladen und gezielt Fragen dazu stellen, ohne zu programmieren
- Verschiedene Themenbereiche sauber trennen, statt alles in einen Topf zu werfen
- Lokale Modelle über Ollama oder LM Studio nutzen, ohne Daten in die Cloud zu schicken
- Einen Agenten nutzen, der Web-Suche und RAG kombiniert
- Eine Desktop-App, die sich wie ein normales Programm bedienen lässt
AnythingLLM löst all diese Punkte. Mehr zur Grundlage findest Du in unserer Übersicht zur Lokale KI Software.
AnythingLLM kurz erklärt
AnythingLLM ist eine Desktop-Anwendung für RAG mit lokalen und Cloud-Modellen. Es verwaltet Deine Dokumente in Workspaces, erstellt automatisch Embeddings und lässt Dich per Chat Fragen an Deine Inhalte stellen. Du brauchst keine Programmierkenntnisse.
Die wichtigsten Eigenschaften:
- Desktop-App: Läuft als normales Programm auf Windows, macOS und Linux
- RAG ohne Code: Dokumente hochladen, Fragen stellen, fertig
- Workspaces: Jeder Workspace hat eigene Dokumente und eigenen Kontext
- Multi-Provider: Funktioniert mit Ollama, LM Studio, OpenAI, Anthropic und weiteren
- Agent-Modus: Eingebaute Agenten für Web-Suche, RAG und Werkzeuge
- Docker-Option: Für Server-Betrieb oder Mehrplatznutzung verfügbar
Wer Ollama noch nicht kennt, liest zuerst unseren Artikel zu Ollama.
Für wen ist AnythingLLM gedacht?
AnythingLLM richtet sich an mehrere Zielgruppen:
- Einzelnutzer, die mit ihren Dokumenten chatten wollen, ohne zu programmieren
- Wissensarbeiter, die Recherchen, Notizen und Handbücher befragbar machen möchten
- Kleine Teams, die eine gemeinsame Wissensbasis aufbauen wollen
- Entwickler, die RAG schnell ausprobieren wollen, bevor sie eine eigene Lösung bauen
- Selbsthoster, die AnythingLLM über Docker auf einem Server betreiben wollen
Vorkenntnisse brauchst Du nicht. Wenn Du die Desktop-App nutzt, ist die Installation genauso einfach wie bei jedem anderen Programm. Grundlagen zu RAG findest Du in unserem Artikel RAG Grundlagen.
Wichtige Begriffe rund um AnythingLLM
| Begriff | Erklärung |
|---|---|
| AnythingLLM | Desktop-App für RAG mit lokalen und Cloud-Modellen, ohne Programmierung |
| Workspace | Eigener Bereich mit eigenen Dokumenten, eigenem Kontext und eigener Konfiguration |
| RAG | Retrieval-Augmented Generation, Fragen an eigene Dokumente stellen |
| Embedding | Zahlenvektor, der den Inhalt eines Textstücks repräsentiert, für die Suche |
| Vector DB | Vektordatenbank, in der Embeddings gespeichert und durchsucht werden |
| Document | Eine Datei, die Du in einen Workspace lädst, zum Beispiel PDF oder DOCX |
| Ollama | Tool, das lokale Modelle lädt und ausführt, oft als Backend für AnythingLLM genutzt |
| LLM Provider | Dienst oder Tool, das das Sprachmodell bereitstellt, lokal oder in der Cloud |
| Agent | Modus, in dem das Modell Werkzeuge nutzt, zum Beispiel Web-Suche oder RAG |
| Pin | Eine Antwort oder einen Textabschnitt festhalten, damit er im Kontext bleibt |
Installation
AnythingLLM bietet zwei Installationswege: die Desktop-App für Einzelnutzer und Docker für den Server-Betrieb.
Desktop-App
Die Desktop-App ist die einfachste Variante. Du lädst sie von der offiziellen Website herunter und installierst sie wie jedes andere Programm.
- Windows: Lade den Installer herunter, führe ihn aus und folge dem Assistenten
- macOS: Lade die
.dmg-Datei, öffne sie und ziehe AnythingLLM in den Programme-Ordner - Linux: Lade das passende Paket,
.debfür Ubuntu und Debian oder.AppImagefür andere Distributionen
Nach der Installation startest Du AnythingLLM wie eine normale Anwendung. Beim ersten Start wirst Du durch einen Setup-Assistenten geführt, der Dich den LLM-Provider auswählen lässt.
Docker
Für den Server-Betrieb oder wenn Du Docker bevorzugst, gibt es ein offizielles Docker-Image.
docker run -d -p 3001:3001 \
-v anythingllm:/app/server/storage \
-e STORAGE_DIR=/app/server/storage \
--name anythingllm \
--restart always \
mintplexlabs/anythingllm
Erklärung der einzelnen Teile:
-d: Container läuft im Hintergrund-p 3001:3001: Der Port 3001 Deines Rechners zeigt auf Port 3001 im Container-v anythingllm:/app/server/storage: Dokumente und Konfiguration bleiben erhalten--restart always: Container startet automatisch nach einem Neustart
Danach öffnest Du http://localhost:3001 im Browser. Der erste Start führt Dich durch das Setup, bei dem Du den LLM-Provider und die Embedding-Quelle festlegst.
LLM-Provider einrichten
AnythingLLM unterstützt verschiedene Provider, sowohl lokal als auch in der Cloud. Du entscheidest, wo Deine Anfragen verarbeitet werden.
Lokale Provider
- Ollama: Die häufigste Wahl für lokale Modelle. Installiere Ollama, lade ein Modell mit
ollama pull llama3.1und wähle in AnythingLLM den Provider “Ollama” aus. Mehr dazu im Artikel Ollama. - LM Studio: Eine Desktop-App, die Modelle lädt und eine OpenAI-kompatible API bereitstellt. Trage die Adresse der LM-Studio-API in AnythingLLM ein. Details im Artikel LM Studio.
Lokale Provider haben den Vorteil, dass Deine Daten Deinen Rechner nicht verlassen. Du brauchst allerdings ausreichend Hardware, besonders für größere Modelle. Grundlagen dazu im Artikel LLM lokal betreiben.
Cloud-Provider
- OpenAI: Du brauchst einen API-Key. Anfragen laufen über die OpenAI-Server, Deine Dokumente werden für die Anfrage dorthin gesendet.
- Anthropic: Gleiches Prinzip wie bei OpenAI, Du brauchst einen API-Key und sendest Anfragen an die Anthropic-Server.
Cloud-Provider sind einfacher einzurichten und brauchen keine lokale Hardware. Dafür verlassen Deine Daten Deinen Rechner. Du entscheidest selbst, welcher Kompromiss für Dich passt.
Embedding-Provider
Neben dem LLM-Provider musst Du auch einen Embedding-Provider festlegen. AnythingLLM nutzt die interne Embedding-Engine von Ollama, wenn Du Ollama als Provider wählst. Alternativ kannst Du OpenAI-Embeddings oder das eingebaute AnythingLLM-Embedding-Modell verwenden. Für den rein lokalen Betrieb empfiehlt sich Ollama oder das eingebaute Modell.
Workspaces erstellen
Workspaces sind das zentrale Konzept in AnythingLLM. Ein Workspace ist ein eigener Bereich mit eigenen Dokumenten, eigenem Kontext und eigener Konfiguration. Du kannst beliebig viele Workspaces anlegen.
Beispiele für Workspaces:
- Handbücher: Alle PDF-Anleitungen für Deine Technik
- Verträge: Rechnungen, Verträge und rechtliche Dokumente
- Notizen: Eigene Aufzeichnungen und Markdown-Dateien
- Projekt: Dokumente, die zu einem bestimmten Projekt gehören
Jeder Workspace hat:
- Eigene Dokumentensammlung
- Eigenen Chat-Verlauf
- Eigene System-Prompt-Konfiguration
- Eigenen Kontext, das heißt, das Modell sieht nur die Dokumente dieses Workspaces
Das bedeutet: Wenn Du im Workspace “Handbücher” eine Frage stellst, sucht das Modell nur in den Handbüchern, nicht in Deinen Verträgen. Das hält Antworten präzise und vermeidet Verwirrung.
Einen Workspace legst Du über die Seitenleiste an. Klicke auf “New Workspace”, gib einen Namen ein und der Workspace ist bereit. Danach lädst Du Dokumente hoch und legst los.
Mehr zum Thema RAG findest Du in unserem Artikel Lokales RAG.
Dokumente hochladen und chatten
Sobald Du einen Workspace angelegt hast, lädst Du Dokumente hoch. AnythingLLM unterstützt folgende Formate:
- PDF: Der häufigste Fall, zum Beispiel Handbücher und Berichte
- DOCX: Word-Dokumente
- TXT: Reine Textdateien
- MD: Markdown-Dateien
- CSV: Tabellarische Daten
- HTML: Webseiten, als Datei gespeichert
Der Ablauf:
- Öffne den Workspace, in den Du Dokumente laden möchtest.
- Klicke auf “Upload Documents” oder ziehe Dateien per Drag-and-Drop in das Fenster.
- AnythingLLM verarbeitet die Dateien automatisch: Text wird extrahiert, in Stücke geteilt, in Embeddings umgewandelt und in der Vektordatenbank gespeichert.
- Sobald der Upload abgeschlossen ist, kannst Du im Chat Fragen zu den Dokumenten stellen.
Du musst Dich nicht um Embeddings, Chunking oder Vektordatenbank kümmern. AnythingLLM macht das im Hintergrund. Du lädst hoch, wartest kurz und chattest.
Ein typischer Ablauf: Du lädst ein 50-seitiges PDF ins Workspace “Handbücher”, stellst die Frage “Wie setze ich die Uhrzeit zurück?” und bekommst die Antwort mit Bezug auf die passende Stelle im Dokument.
Agent-Modus
AnythingLLM bringt einen Agent-Modus mit, der über einfaches Chatten hinausgeht. Im Agent-Modus kann das Modell Werkzeuge nutzen, um Aufgaben zu erledigen.
Verfügbare Werkzeuge umfassen:
- Web-Suche: Das Modell sucht im Internet nach aktuellen Informationen
- RAG: Das Modell durchsucht die Dokumente des aktuellen Workspaces
- Datei-Erstellung: Das Modell kann Dateien generieren und zum Download anbieten
- Zusammenfassung: Lange Dokumente automatisch zusammenfassen
- Listen und Tabellen: Strukturierte Ausgaben erzeugen
Du aktivierst den Agent-Modus im Chat-Fenster. Wähle den Modus aus und das Modell entscheidet selbst, welches Werkzeug es für Deine Frage nutzt. Wenn Du zum Beispiel fragst “Was steht in meinen Dokumenten zum Thema Datenschutz und was sagt die aktuelle DSGVO dazu?”, kombiniert der Agent RAG mit Web-Suche.
Der Agent-Modus ist besonders nützlich, wenn Du Informationen aus verschiedenen Quellen zusammenführen willst. Er funktioniert mit lokalen und Cloud-Modellen, allerdings nicht jedes Modell unterstützt alle Werkzeuge gleich gut.
AnythingLLM vs. Open WebUI vs. Custom RAG
Diese drei Ansätze werden oft verglichen, eignen sich aber für unterschiedliche Szenarien:
| Eigenschaft | AnythingLLM | Open WebUI | Custom RAG |
|---|---|---|---|
| Typ | Desktop-App | Web-Oberfläche | Eigenes Projekt |
| RAG ohne Code | Ja | Ja, begrenzt | Nein |
| Workspaces | Ja, zentrales Konzept | Nein | Selbst gebaut |
| Agent-Modus | Ja, eingebaut | Begrenzt | Selbst gebaut |
| Desktop-App | Ja | Nein | Nein |
| Docker-Support | Ja | Ja | Selbst gebaut |
| Multi-User | Ja, in Docker-Version | Ja | Selbst gebaut |
| Zielgruppe | Einzelnutzer, Wissensarbeiter | Teams, Familien | Entwickler |
Kurz gesagt: AnythingLLM ist die beste Wahl, wenn Du RAG ohne Code willst und Workspaces brauchst. Open WebUI ist besser, wenn Du mehrere Nutzer verwalten willst und eine reine Web-Oberfläche bevorzugst. Custom RAG ist nur sinnvoll, wenn Du volle Kontrolle brauchst und programmieren kannst. Mehr zu Open WebUI im Artikel Open WebUI.
Beispiel: PDFs mit AnythingLLM durchsuchen
Hier ein kompletter Ablauf von der Installation bis zur ersten Frage:
- AnythingLLM installieren: Lade die Desktop-App herunter und installiere sie. Starte die App.
- Setup-Assistenten durchlaufen: Wähle Ollama als LLM-Provider und Ollama als Embedding-Provider. Falls Ollama noch nicht läuft, installiere es zuerst und lade ein Modell mit
ollama pull llama3.1. - Workspace anlegen: Klicke auf “New Workspace”, nenne ihn zum Beispiel “Handbücher”.
- Dokumente hochladen: Klicke auf “Upload Documents” und wähle Deine PDFs aus. Warte, bis die Verarbeitung abgeschlossen ist.
- Frage stellen: Gib im Chat-Fenster eine Frage ein, zum Beispiel “Wie reinige ich den Filter?”.
- Antwort prüfen: AnythingLLM sucht in Deinen PDFs, findet die passende Stelle und baut die Antwort darauf auf.
- Nachfragen: Stell Folgefragen, um Details zu klären. Der Kontext bleibt erhalten.
Der ganze Ablauf dauert etwa 10 bis 15 Minuten, abhängig von der Menge der Dokumente und der Geschwindigkeit Deiner Hardware.
Typische Stolpersteine bei AnythingLLM
AnythingLLM ist einfach zu nutzen, aber ein paar Dinge sorgen regelmäßig für Fragen:
- Ollama wird nicht gefunden: Wenn Ollama nicht läuft oder auf einem anderen Port lauscht, kann AnythingLLM sich nicht verbinden. Prüfe, ob Ollama läuft und die Adresse in den Einstellungen stimmt.
- Embeddings sind langsam: Beim ersten Hochladen großer Dokumente dauert die Embedding-Erstellung eine Weile, besonders auf der CPU. Das ist normal und passiert nur einmal pro Dokument.
- Antworten sind ungenau: Wenn ein Workspace zu viele unterschiedliche Dokumente enthält, wird der Kontext unübersichtlich. Teile Inhalte in mehrere Workspaces auf.
- Dokumente werden nicht gefunden: AnythingLLM durchsucht nur den aktiven Workspace. Wenn Du im falschen Workspace fragst, findet das Modell nichts. Prüfe, in welchem Workspace Du Dich befindest.
- Speicherplatz vollläuft: Embeddings und Dokumente brauchen Platz. Bei vielen großen PDFs kann der Speicherbedarf schnell wachsen. Behalte den Speicher im Auge, besonders im Docker-Betrieb.
- Cloud-Provider senden Daten nach draußen: Wenn Du OpenAI oder Anthropic als Provider wählst, werden Deine Dokumente für die Anfrage an den Cloud-Dienst gesendet. Wer lokal bleiben will, sollte Ollama oder LM Studio nutzen.
- Agent-Modus liefert unerwartete Ergebnisse: Nicht jedes Modell unterstützt alle Werkzeuge gut. Wenn der Agent unbrauchbare Antworten liefert, wechsle das Modell oder schalte den Agent-Modus ab.
- Datenverlust nach Update: Ohne Volume-Mapping im Docker-Betrieb sind alle Workspaces nach einem Neustart weg. Der
-v-Parameter im Docker-Befehl ist wichtig.
Hardware, Kosten und Sicherheit bei AnythingLLM
Hardware: AnythingLLM selbst braucht wenig Ressourcen. Die Last entsteht durch das Sprachmodell und die Embedding-Berechnung. Für kleine Modelle bis 8 Milliarden Parameter reicht ein normaler Rechner mit 16 GB RAM. Für größere Modelle empfiehlt sich eine GPU mit ausreichend VRAM. Als Faustregel: 8 GB VRAM für Modelle bis 8 Milliarden Parameter, mehr für größere. Die Embedding-Berechnung läuft problemlos auf der CPU, ist dort aber langsamer.
Kosten: AnythingLLM ist Open Source und kostenlos. Du zahlst nichts für die Software selbst. Kosten entstehen nur durch Hardware, falls Du aufrüsten musst, und durch Strom. Wenn Du Cloud-Provider nutzt, kommen Kosten für API-Aufrufe hinzu.
Sicherheit: Wenn Du lokale Provider nutzt, bleiben Deine Daten auf Deinem Rechner. Das ist der größte Vorteil gegenüber Cloud-Diensten. Achte trotzdem auf folgendes:
- Nutze Cloud-Provider nur, wenn Du akzeptierst, dass Deine Dokumente den Rechner verlassen
- Setze AnythingLLM im Docker-Betrieb nicht ohne Authentifizierung ins offene Netz
- Halte die Software aktuell, um Sicherheitslücken zu schließen
- Trenne Workspaces sauber, besonders wenn mehrere Personen zugreifen
Weiterführende Links und Infos zu AnythingLLM
- AnythingLLM auf GitHub
- Offizielle Website
- AnythingLLM Dokumentation
- Ollama bei BotServ.de
- LM Studio bei BotServ.de
- Open WebUI bei BotServ.de
- Lokales RAG bei BotServ.de
- RAG Grundlagen bei BotServ.de
FAQ: AnythingLLM - Typische Fragen
Ist AnythingLLM kostenlos? Ja, AnythingLLM ist Open Source und kostenlos. Du zahlst nichts für die Software, nur für die Hardware, auf der es läuft. Cloud-Provider können zusätzliche Kosten verursachen.
Brauche ich Ollama für AnythingLLM? Nicht zwingend. AnythingLLM unterstützt auch LM Studio, OpenAI, Anthropic und weitere Provider. Ollama ist aber die häufigste und einfachste Wahl für lokale Modelle.
Kann ich AnythingLLM ohne Docker installieren? Ja, die Desktop-App installierst Du wie jedes andere Programm. Docker brauchst Du nur, wenn Du AnythingLLM auf einem Server betreiben willst.
Funktioniert AnythingLLM auf macOS?
Ja, es gibt eine native macOS-Version. Du lädst die .dmg-Datei herunter und installierst sie wie gewohnt.
Kann ich mehrere Workspaces gleichzeitig nutzen? Ja, Du kannst beliebig viele Workspaces anlegen und zwischen ihnen wechseln. Jeder Workspace hat eigene Dokumente und eigenen Kontext.
Welche Dateiformate unterstützt AnythingLLM? PDF, DOCX, TXT, MD, CSV und HTML gehören zu den unterstützten Formaten. Die genaue Liste findest Du in der Dokumentation.
Brauche ich eine GPU? Für kleine Modelle reicht die CPU. Für flüssiges Arbeiten mit größeren Modellen und schnelleren Embeddings ist eine GPU empfehlenswert.
Kann ich AnythingLLM mit Cloud-Diensten verbinden? Ja, Du kannst OpenAI, Anthropic und weitere Cloud-Provider einbinden. Dann laufen Anfragen aber über den Cloud-Dienst, und Deine Daten verlassen Deinen Rechner.
Wie aktualisiere ich AnythingLLM?
Bei der Desktop-App gibt es eine Update-Funktion in der App selbst. Bei Docker ziehst Du das neueste Image mit docker pull mintplexlabs/anythingllm und startest den Container neu. Das Volume erhält Deine Daten.
Was ist der Unterschied zwischen Workspaces und normalen Chats? Normale Chats haben keinen Bezug zu Deinen Dokumenten. Workspaces verknüpfen Chats mit einer spezifischen Dokumentensammlung, sodass das Modell gezielt darauf zugreift.
Kann ich Dokumente aus einem Workspace in einen anderen kopieren? Ja, Du kannst Dokumente mehreren Workspaces zuweisen. Das ist praktisch, wenn bestimmte Dateien in mehreren Kontexten relevant sind.
Ist der Agent-Modus mit jedem Modell verfügbar? Der Agent-Modus funktioniert mit den meisten Modellen, aber nicht jedes Modell unterstützt alle Werkzeuge gleich gut. Lokale Modelle ab 8 Milliarden Parameter liefern in der Regel brauchbare Ergebnisse.
Quellen und weiterführende Literatur
- AnythingLLM Dokumentation: https://docs.anythingllm.com/
- AnythingLLM GitHub-Repository: https://github.com/Mintplex-Labs/anything-llm
- Ollama Dokumentation: https://ollama.com/
- Weitere Artikel auf BotServ.de: Lokale KI Software, Was ist lokale KI?, Lokales RAG


