KI-Setup für Anfänger: In 4 Schritten zum eigenen KI-System
Was dieser Artikel behandelt
Ein sauberes KI-Einsteiger-Projekt, das Dir in vier Schritten nicht nur ein funktionierendes System gibt, sondern Dir beibringt, wie die Teile zusammenhängen:
- Brandkit-Textdatei: Alles, was die KI über Dich, Deine Brand oder Firma wissen muss.
- Second Brain: Obsidian als Wissensbasis, die aus dem Brandkit wächst.
- LiteLLM: Das Gateway, das Dir zeigt, wie Modelle, APIs und Kosten zusammenhängen.
- Hermes Agent: Der aktive Assistent, der alle drei Teile nutzt.
Am Ende hast Du kein Demo-Spielzeug, sondern eine Infrastruktur, die Du verstehst und erweitern kannst.
Warum dieses Setup KI verstehen lehrt
Die meisten Anfänger starten mit „irgendeine Chat-App” und lernen nichts über die Schichten darunter. Dieses Projekt zeigt Dir alle vier Ebenen, die jedes ernsthafte KI-System hat: Kontext (Brandkit), Wissen (Second Brain), Modell-Zugriff (LiteLLM) und Ausführung (Agent). Wer diese Schichten einmal selbst verdrahtet hat, versteht danach jedes KI-Tool, das ihm begegnet.
Schritt 1: Die Brandkit-Textdatei
Das Brandkit ist eine einzelne Markdown-Datei, die der KI sagt, für wen sie arbeitet. Sie wird später System-Prompt, RAG-Quelle und Agenten-Kontext zugleich. Erstelle brandkit.md:
# Brandkit: [Dein Name / Firma]
## Wer bin ich / wer sind wir
Freelancer für Webentwicklung, seit 2019, Bochum.
Ein-Mann-Betrieb, Kunden: lokale Handwerksbetriebe und Praxen.
## Ton & Stil
Du-Form, direkt, keine Floskeln. Technisch präzise, aber für
Nicht-Techniker verständlich. Keine Emojis in Kundentexten.
## Was ich anbiete
- Websites mit Astro (ab 2.500 €)
- SEO-Grundlagen & Wartung (150 €/Monat)
- E-Mail: info@example.de
## Was ich NICHT mache
Keine Online-Shops, keine App-Entwicklung, keine Rabatte unter 10 %.
## Zielgruppe
Inhaber kleiner Betriebe, 40-65 Jahre, wenig technisches Vorwissen.
## Wiederkehrende Formulierungen
„Festpreis ohne Überraschungen", „läuft lokal bei Ihnen"
Warum das mächtig ist: Jede Anfrage an die KI bekommt dieses File als Kontext. Die KI schreibt dann Angebotstexte in Deinem Ton, kennt Deine Preise, sagt „nein” zu Jobs, die Du nicht machst. Eine Textdatei, null Tooling, der wichtigste Qualitätshebel, den es gibt.
Regel: Aktualisiere sie, sobald sich etwas ändert. Sie ist lebendig.
Schritt 2: Das Second Brain mit Obsidian
Das Brandkit ist der Anfang. Jetzt kommt alles dazu, was die KI wissen soll: Projekte, Kundennotizen, Snippets, Learnings, Briefings. Obsidian ist dafür der Standard (kostenlos, lokale Markdown-Files, keine Cloud nötig). Alternativ geht jedes andere Notizsystem, das echte Dateien erzeugt (Logseq, Joplin, ein simpler Ordner).
mein-brain/
├── brandkit.md ← aus Schritt 1
├── kunden/
│ ├── schreiner-mueller.md
│ └── zahnarzt-dr-weber.md
├── projekte/
│ ├── website-relaunch.md
│ └── seo-checkliste.md
├── snippets/
│ ├── angebotstext-vorlage.md
│ └── einwandbehandlung.md
└── learnings/
└── was-funktionierte.md
Der Trick: Weil alles Markdown-Dateien sind, kann die KI den Ordner direkt lesen. Später wird daraus eine RAG-Wissensdatenbank (siehe Dokumentenbot-Projekt und RAG-Grundlagen). Für den Anfang reicht: Du referenzierst Dateien im Prompt.
Schritt 3: LiteLLM installieren, um zu verstehen, wie alles zusammenhängt
Jetzt der Infrastruktur-Teil. LiteLLM ist ein Gateway: Es stellt einen einheitlichen OpenAI-kompatiblen Endpoint vor allen Modellen, lokalen (Ollama) wie Cloud (OpenAI, Anthropic, Google). Ein Endpoint, alle Modelle, und Du siehst genau, was ein Request ist, was ein Token kostet, wie ein Modellwechsel aussieht.
# Installieren
pip install litellm[proxy]
# Oder per Docker
docker run -p 4000:4000 ghcr.io/berriai/litellm:main-latest
litellm-config.yaml:
model_list:
- model_name: lokal-qwen
litellm_params:
model: ollama/qwen3.8:27b
api_base: http://localhost:11434
- model_name: claude-sonnet
litellm_params:
model: anthropic/claude-sonnet-4-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: gpt-5-mini
litellm_params:
model: openai/gpt-5-mini
api_key: os.environ/OPENAI_API_KEY
general_settings:
master_key: sk-dein-key
litellm --config litellm-config.yaml --port 4000
# Testen: derselbe Call, zwei Modelle
curl http://localhost:4000/chat/completions \
-H "Authorization: Bearer sk-dein-key" \
-d '{"model": "lokal-qwen", "messages": [{"role": "user", "content": "Hallo"}]}'
Was Du hier lernst: Der Agent fragt nie direkt „OpenAI” oder „Ollama” an, sondern immer localhost:4000 mit einem Modellnamen. Wechselst Du das Modell, ändert sich nur ein String. Kosten-Tracking, Rate-Limits und Fallbacks (fallbacks: [{"lokal-qwen": ["claude-sonnet"]}]) kommen gratis dazu. Das ist exakt die Architektur, die Firmen intern fahren, nur in klein.
Schritt 4: Hermes als aktiver Assistent, der alles nutzt
Jetzt die Ausführungsebene. Hermes Agent ist ein persistenter KI-Assistent mit Gedächtnis, der dauerhaft läuft und Aufgaben abarbeitet. Angebunden wird er so:
Hermes Agent
├── System-Prompt/Kontext → brandkit.md (Schritt 1)
├── Wissensbasis → mein-brain/ (Schritt 2, lesbar/RAG)
└── Modell-Endpoint → LiteLLM :4000 (Schritt 3)
In der Hermes-Config setzt Du den LiteLLM-Endpoint als OpenAI-kompatible API:
llm:
base_url: http://localhost:4000
api_key: sk-dein-key
model: lokal-qwen
context_files:
- /home/du/mein-brain/brandkit.md
memory_dir: /home/du/mein-brain/
Damit passiert das eigentliche „KI verstehen”: Du fragst Hermes „schreib ein Angebot für den Müller-Auftrag”, er zieht das Brandkit (Ton, Preise), liest kunden/schreiner-mueller.md (Kontext), schickt es über LiteLLM an Dein lokales Modell, und Du siehst im LiteLLM-Log genau den Request, die Tokens, die Kosten. Jede Schicht ist sichtbar und austauschbar.
Was Du jetzt verstehst (und wohin es weitergeht)
Nach diesem Setup kannst Du beantworten, was die meisten KI-Nutzer nicht können:
- Was ein System-Prompt/Context-File ist und warum es alles entscheidet (Brandkit)
- Was eine Wissensbasis/RAG-Quelle ist (Second Brain)
- Was ein LLM-Gateway macht und wie ein API-Call aussieht (LiteLLM)
- Was ein Agent ist: ein Loop aus Kontext + Modell + Tools (Hermes)
Logische nächste Schritte: den Brain-Ordner als echte RAG-Datenbank anbinden, LiteLLM-Fallbacks und Kosten-Limits konfigurieren, Hermes mit n8n-Automationen verbinden (z. B. „neue E-Mail → Agent entwirft Antwort mit Brandkit-Ton”), oder ein lokales Modell für den Datenschutz-Teil.
Weiterführende Links
- IRC-Coding.de: Programmier-Tutorials.
- Hermes Agent: Der Agent im Detail.
- Ollama: Lokale Modelle hinter LiteLLM.
- RAG-Grundlagen: Vom Brain zur Wissensdatenbank.
- Dokumentenbot für Firmen: Das Fortgeschrittenen-Projekt.
- n8n-Workflows: Den Agenten automatisieren.
Key Takeaways:
- Das Einsteiger-Setup hat 4 Schichten: Brandkit (Kontext) → Obsidian Second Brain (Wissen) → LiteLLM (Modell-Gateway) → Hermes (Ausführung).
- Das Brandkit ist eine Markdown-Datei mit allem, was die KI über Dich/Deine Firma wissen muss: Ton, Angebot, Preise, Grenzen.
- Obsidian erzeugt lokale Markdown-Files, die die KI direkt lesen kann, der spätere RAG-Grundstock.
- LiteLLM zeigt Dir die Infrastruktur: ein OpenAI-kompatibler Endpoint für lokale und Cloud-Modelle, mit Logging und Kostenkontrolle.
- Hermes Agent verbindet alles: Brandkit als System-Prompt, Brain als Gedächtnis, LiteLLM als Modellquelle. Damit verstehst Du, wie jedes KI-System funktioniert.
FAQ
Was kommt in eine Brandkit-Textdatei?
Warum LiteLLM statt direkt Ollama oder OpenAI?
Muss das Second Brain Obsidian sein?
Was macht der Hermes Agent genau?
Was kostet das Setup?
Quellen und weiterführende Literatur
- LiteLLM (GitHub), Obsidian
- Hermes Agent, Ollama
- IRC-Coding.de: Programmier-Tutorials.


