Lokale KI
Was dieser Artikel behandelt
- Was lokale KI ist und wofür sie geeignet ist.
- Welche Inhalte im Bereich Lokale KI auf BotServ verfügbar sind.
- Verweise auf Grundlagen, Software, Modelle, RAG und verwandte Bereiche.
Einleitung
Lokale KI läuft auf dem eigenen Rechner oder Server. Datenschutz, Kontrolle und Unabhängigkeit von Cloud-Anbietern sind die Hauptvorteile. Dieser Bereich führt von den Grundlagen über Software und Modelle bis hin zu RAG und lokalen Agenten.
Warum brauche ich lokale KI?
Wer KI regelmäßig nutzt, zahlt bei Cloud-Anbietern schnell viel Geld für API-Aufrufe. Bei lokaler KI fallen diese laufenden Kosten weg. Du zahlst einmalig in Hardware und danach nur Strom. Dazu kommt Datenschutz: Sensible Daten verlassen nie Deinen Rechner.
Ein Beispiel: Du willst interne Dokumente mit RAG durchsuchbar machen. In der Cloud müsstest Du diese Dokumente an einen Anbieter hochladen. Lokal bleibt alles auf Deinem Rechner. Das ist für viele Unternehmen, Anwälte oder Privatpersonen ein entscheidender Vorteil.
Lokale KI kurz erklärt
Lokale KI lädt ein Sprachmodell auf Deinen Rechner und führt es dort aus. Dafür brauchst Du eine Laufzeitumgebung wie Ollama oder LM Studio, die das Modell lädt und eine API bereitstellt. Das Modell liegt im RAM oder VRAM und berechnet Antworten lokal. Keine Daten verlassen Deinen Rechner.
Für wen ist dieser Bereich gedacht?
- Du willst lokal KI betreiben und wissen, was Dein Rechner leisten kann.
- Du suchst Software, Modelle oder RAG-Lösungen für den Eigenbetrieb.
- Du bist Einsteiger und möchtest die Konzepte verstehen, bevor Du Ollama installierst.
- Du brauchst keine tiefen Vorkenntnisse. Technische Begriffe werden in den Artikeln inline erklärt.
Inhalt und Artikel
- Grundlagen - Was lokale KI ist, Quantisierung, Kontextlänge, RAM und VRAM.
- Software - Ollama, LM Studio und Tools für den lokalen Betrieb.
- Modelle - Wie man passende lokale Modelle findet.
- Lokales RAG - RAG-Grundlagen, Chunking, Embeddings und Vektordatenbanken.
Wichtige Begriffe
- LLM - Large Language Model, ein großes Sprachmodell. Beispiele sind Llama 3.1, Qwen 2.5 oder Mistral.
- Ollama - Lokale Laufzeitumgebung für Sprachmodelle. Lädt Modelle und bietet eine API.
- LM Studio - Grafische Anwendung für lokale Modelle mit Bedienoberfläche.
- Quantisierung - Reduziert die Genauigkeit eines Modells, um Speicher zu sparen.
- RAG - Retrieval-Augmented Generation. Sucht passende Textstellen aus einer Datenbank und gibt sie dem Modell als Kontext.
- Vektordatenbank - Speichert Embeddings für die RAG-Suche. Beispiele sind Chroma und Qdrant.
Typische Stolpersteine
- Modell passt nicht in den Speicher - Ohne Quantisierung laufen große Modelle nicht auf Consumer-Hardware. Prüfe vorher, wie viel Speicher das Modell braucht.
- Kontextfenster ist zu klein - Ein Modell mit 4K-Kontext versteht keine langen Dokumente. Für RAG brauchst Du ein Modell mit größerem Kontextfenster.
- Cloud-Kosten vs. Hardwarekosten - Lokale KI ist nicht gratis. Du zahlst in Hardware und Strom. Für seltene Nutzung kann die Cloud günstiger sein.
Weiterführende Links
FAQ - Häufige Fragen
Was ist lokale KI?
Lokale KI bedeutet, Sprachmodelle auf dem eigenen Rechner oder Server laufen zu lassen. Die Modelle liegen im RAM oder VRAM und berechnen Antworten lokal. Keine Daten verlassen Deinen Rechner. Mehr dazu in den Lokale KI Grundlagen.
Was ist der Unterschied zwischen lokaler KI und Cloud-KI?
Bei Cloud-KI schickst Du Eingaben an einen Server eines Anbieters. Bei lokaler KI bleibt alles auf Deinem Rechner. Lokale KI kostet keinen API-Cent, braucht aber passende Hardware.
Welche Software brauche ich für lokale KI?
Die einfachste Lösung ist Ollama. Es lädt Modelle und bietet eine API. LM Studio ist eine grafische Alternative. Mehr dazu in der Übersicht Lokale KI Software.
Was ist Quantisierung?
Quantisierung reduziert die Genauigkeit eines Modells, um Speicher zu sparen. Aus einem 16 GB großen Modell werden so 8 GB oder weniger. Das ermöglicht größere Modelle auf kleinerer Hardware.
Brauche ich eine Grafikkarte für lokale KI?
Für kleine Modelle reicht oft die CPU. Für schnellere Antworten und größere Modelle ist eine GPU mit ausreichend VRAM empfohlen.
Wie viel RAM brauche ich für lokale KI?
Für 7B-Modelle mindestens 16 GB RAM, besser 32 GB. Größere Modelle wie 70B benötigen 64 GB oder mehr.
Was ist RAG?
RAG steht für Retrieval-Augmented Generation. Das Modell sucht passende Textstellen aus einer Datenbank und nutzt sie als Kontext für die Antwort. Mehr dazu in der Übersicht Lokales RAG.
Was ist eine Vektordatenbank?
Eine Vektordatenbank speichert Embeddings, also numerische Darstellungen von Texten. Sie wird für die RAG-Suche genutzt. Beispiele sind Chroma und Qdrant.
Sind lokale Modelle so gut wie Cloud-Modelle?
Große lokale Modelle wie Llama 3.1 70B kommen nah an Cloud-Modelle heran. Kleine 7B-Modelle sind schwächer, aber für viele Aufgaben ausreichend. Der Abstand wird kleiner, je besser Open-Source-Modelle werden.
Kann ich lokale KI mit Docker betreiben?
Ja. Ollama, LM Studio und viele Frameworks lassen sich in Docker betreiben. Das ist besonders sinnvoll, wenn Du mehrere Dienste isoliert laufen lassen willst.


