Was ist lokale KI?
Was dieser Artikel über lokale KI behandelt
- Was lokale KI ist und wie sie sich von Cloud-Diensten wie ChatGPT unterscheidet
- Welche Hardware, Modelle und Software Du für den lokalen Betrieb brauchst
- Wie ein Prompt durch Dein System fließt, vom Download bis zur Antwort
- Welche Anwendungsfälle sich lohnen und wo die Grenzen liegen
- Welche Stolpersteine Anfänger erwarten und wie Du sie vermeidest
Einleitung: Lokale KI verständlich erklärt
Wer heute über KI spricht, meint meist Cloud-Dienste wie ChatGPT, Claude oder Gemini. Du tippt eine Anfrage ein, sie landet auf fremden Servern, das Modell antwortet, und die Antwort kommt zurück. Das funktioniert gut, solange Du damit einverstanden bist, dass fremde Rechner und Unternehmen Deine Daten verarbeiten.
Lokale KI dreht dieses Prinzip um. Hier läuft das Modell direkt auf Deinem Rechner, Server oder Mini-PC. Deine Daten verlassen Dein Netzwerk nicht. Du entscheidest, welche Software, welche Version und welche Modelle genutzt werden. Keine Abrechnung nach Token, kein Abo, keine Ratenlimits.
Warum ist das jetzt relevant? Weil lokale Modelle in den letzten zwei Jahren massiv besser geworden sind. Ein 7B- oder 8B-Modell auf einem modernen Laptop liefert Antworten, die 2023 noch großen Cloud-Diensten vorbehalten waren. Gleichzeitig steigen die Bedenken rund um Datenschutz, Abhängigkeit von einzelnen Anbietern und laufende Kosten. Lokale KI ist kein Nischenthema mehr, sondern eine realistische Option für Entwickler, kleine Unternehmen und technisch versierte Nutzer.
Dieser Artikel ist der Ausgangspunkt. Er erklärt die Grundlagen, zeigt die Komponenten und hilft Dir zu entscheiden, ob und wie Du lokale KI für Deine Zwecke einsetzen kannst. Vertiefende Artikel zu einzelnen Themen verlinken wir im Text.
Warum brauche ich lokale KI?
Die Frage klingt einfach, aber die Antwort hängt stark von Deinem Kontext ab. Drei Beispiele aus der Praxis zeigen, wann lokale KI nicht nur nett, sondern notwendig ist.
Beispiel 1: Rechtsanwalt mit sensiblen Verträgen. Eine Kanzlei will hunderte Seiten Verträge zusammenfassen, Klauseln finden und Risiken markieren. Diese Dokumente dürfen nicht an einen Cloud-Anbieter gehen, weil Mandantenbindung und Datenschutzrecht das verbieten. Mit einem lokalen Modell auf einem Arbeitsplatzrechner oder einem kleinen Server bleiben die Dokumente im Haus. Die Kanzlei kann trotzdem von automatischer Zusammenfassung und Klauselanalyse profitieren.
Beispiel 2: Entwickler mit internem Code. Ein Softwareentwickler arbeitet an einem proprietären Projekt. Quelltexte, Kommentare und Fehlerberichte sind vertraulich. Cloud-basierte Code-Assistenten wie GitHub Copilot senden Snippets an externe Server. Mit einem lokalen Code-Modell wie Qwen2.5-Coder oder DeepSeek-Coder bleibt der Code auf dem Rechner. Der Entwickler bekommt Autovervollständigung, Code-Erklärungen und Tests, ohne das Projekt zu verlassen.
Beispiel 3: Unternehmen mit internem Wissen. Eine mittelständische Firma hat tausende PDFs, Handbücher, interne Wikis und Support-Tickets. Mitarbeiter suchen täglich nach Antworten, die irgendwo in diesen Dokumenten stehen. Mit einem lokalen RAG-Setup (Retrieval-Augmented Generation) wird eine interne Wissensbasis aufgebaut. Die Mitarbeiter stellen Fragen, das Modell durchsucht die eigenen Dokumente und antwortet mit Quellenangabe. Nichts verlässt das Firmennetzwerk.
Kostenaspekt. Cloud-KI kostet pro Token oder pro Abonnement. Wer viel nutzt, zahlt schnell dreistellige Beträge pro Monat. Lokale KI kostet einmalig Hardware und laufend Strom. Wer bereits einen Rechner mit 16 GB VRAM oder einem Mac mit 32 GB Unified Memory besitzt, hat die Hardware schon. Die laufenden Kosten sind dann marginal. Bei intensiver Nutzung amortisiert sich ein lokaler Aufbau innerhalb weniger Monate. Mehr zum Vergleich findest Du unter Lokale KI vs. Cloud KI.
Was ist lokale KI? - In A Nutshell
Lokale KI bedeutet: Ein Sprachmodell, ein Code-Modell oder ein Multimodalmodell läuft auf Deiner eigenen Hardware. Es kommuniziert nicht mit einer Cloud-API, sondern wird über Software wie Ollama, LM Studio oder llama.cpp geladen und ausgeführt.
Stell Dir vor, Du hast eine Bibliothek. Bei Cloud-KI gehst Du in eine fremde Stadtbibliothek, gibst Deinen Lesewunsch ab, ein Bibliothekar sucht das Buch und Du bekommst eine Zusammenfassung. Dabei sieht der Bibliothekar genau, was Du liest. Bei lokaler KI hast Du die Bibliothek im eigenen Keller. Du gehst hin, suchst selbst, liest selbst. Niemand außerhalb Deines Hauses weiß, was Du liest.
Dafür musst Du die Regale selbst aufbauen (Hardware), die Bücher selbst beschaffen (Modelle herunterladen) und einen Leseraum einrichten (Laufzeitumgebung). Die Investition ist höher, aber die Autonomie auch.
Lokale KI eignet sich besonders für sensible Dokumente, interne Wissensdatenbanken, Entwicklungsumgebungen und Experimente, bei denen Du nicht von fremden Servern abhängig sein willst.
Für wen ist lokale KI gedacht?
Lokale KI ist nicht für jeden. Wer gelegentlich eine Frage hat und keine sensiblen Daten verarbeitet, ist mit Cloud-Diensten schneller bedient. Für folgende Gruppen lohnt sich der lokale Betrieb aber konkret:
- Entwickler und Entwicklerinnen, die Code-Assistenz ohne Cloud-Anbindung wollen. Sie nutzen lokale Code-Modelle direkt im Editor, über Plugins wie Continue oder Cline.
- Datenschutzaffine Nutzer, die nicht wollen, dass ihre Fragen, Dokumente oder Ideen auf fremden Servern landen.
- Kleinunternehmen und Kanzleien, die rechtlich oder vertraglich verpflichtet sind, Daten im Haus zu behalten.
- Forscher und Studierende, die mit Modellen experimentieren, Fine-Tuning betreiben oder Architekturen verstehen wollen.
- Self-Hoster und Homelab-Betreiber, die ohnehin eigene Server haben und KI als weiteren Dienst integrieren wollen.
- Teams in geschützten Netzwerken, etwa Behörden, Krankenhäuser oder Industrieunternehmen mit strengen Compliance-Vorgaben.
Wer in keine dieser Gruppen fällt, sollte ehrlich prüfen, ob der Aufwand den Nutzen übersteigt. Cloud-KI ist für Gelegenheitsnutzer einfacher und günstiger.
Wichtige Begriffe rund um lokale KI
Bevor wir in die Komponenten gehen, hier die zentralen Begriffe, die in diesem und den folgenden Artikeln immer wieder auftauchen.
| Begriff | Erklärung |
|---|---|
| LLM | Large Language Model. Ein Sprachmodell, das Text versteht und erzeugt. Beispiele: Llama, Qwen, Mistral. |
| Inferenz | Das Ausführen eines trainierten Modells. Training erzeugt das Modell, Inferenz nutzt es. |
| Training | Der Prozess, der ein Modell aus Daten lernt. Lokale Nutzer trainieren meist nicht, sie laden fertige Modelle. |
| Ollama | Eine Laufzeitumgebung, die Modelle herunterlädt, startet und per API bereitstellt. |
| LM Studio | Eine grafische Oberfläche zum Laden und Testen lokaler Modelle. |
| GGUF | Ein Dateiformat für quantisierte Modelle, das mit llama.cpp kompatibel ist. |
| Quantisierung | Reduzierung der Genauigkeit der Modellgewichte, um Speicher und Rechenbedarf zu senken. |
| Token | Ein Textabschnitt, etwa ein Wort oder Teil eines Wortes. Modelle verarbeiten Token, nicht Buchstaben. |
| Kontextlänge | Wie viel Text das Modell auf einmal verarbeiten kann. Mehr Kontext braucht mehr Speicher. |
| RAG | Retrieval-Augmented Generation. Eine Technik, bei der das Modell Antworten aus eigenen Dokumenten bezieht. |
| Embedding | Ein Zahlenvektor, der die Bedeutung eines Textes repräsentiert. Grundlage für RAG und Suche. |
| Vektordatenbank | Eine Datenbank, die Embeddings speichert und semantisch durchsuchbar macht. Beispiele: Chroma, Qdrant. |
Vertiefende Artikel gibt es zu Quantisierung, Kontextlänge und Lokales RAG.
Kernkomponenten lokaler KI
Damit lokale KI funktioniert, brauchst Du vier Bausteine: Hardware, Modell, Laufzeitumgebung und Client. Jeder Baustein hat seine eigenen Entscheidungen und Fallstricke.
Hardware
Hardware liefert Rechenleistung und Speicher. Lokale Modelle brauchen vor allem zwei Dinge: schnellen Speicher und ausreichend VRAM oder Arbeitsspeicher. Modelle werden heute meist als quantisierte Dateien verteilt, also Varianten mit reduzierter Genauigkeit und geringerem Speicherbedarf.
Konkret: Ein 7B-Modell in 4-Bit-Quantisierung braucht etwa 4 bis 5 GB VRAM. Ein 13B-Modell braucht rund 8 bis 10 GB. Ein 70B-Modell braucht 40 GB oder mehr. Die VRAM-Menge bestimmt, welches Modell Du laden kannst. Details dazu im Artikel RAM und VRAM Anforderungen.
Beispiele für Hardware:
- Ein Windows- oder Linux-PC mit einer RTX 3060 (12 GB VRAM) reicht für Modelle bis etwa 13B in 4-Bit.
- Ein Mac Studio mit M2 Ultra und 128 GB Unified Memory kann auch 70B-Modelle laden, weil Apple Silicon VRAM und RAM zusammenfasst.
- Ein Server mit zwei RTX 4090 (je 24 GB VRAM) ist ein typischer Aufbau für ernsthaftes lokales Hosting.
- Ein Mini-PC ohne dedizierte GPU kann kleine Modelle auf der CPU laufen lassen, ist aber langsam.
CPU-Betrieb ist möglich, aber deutlich langsamer. Für flüssiges Arbeiten ist eine dedizierte GPU oder Apple Silicon mit Unified Memory deutlich besser. Mehr dazu unter KI-Hardware Grundlagen.
Modell
Das Modell ist die trainierte Datei, die Deine Eingaben verarbeitet. Gängige Formate sind GGUF, Safetensors oder ONNX. Für den lokalen Betrieb ist GGUF besonders verbreitet, weil es sich gut quantisieren lässt und mit llama.cpp, Ollama und LM Studio kompatibel ist.
Beispiele für Modelle:
- Llama 3.1 8B von Meta, ein Allrounder für Chat und Text.
- Qwen2.5 7B von Alibaba, stark in mehreren Sprachen inklusive Deutsch.
- Qwen2.5-Coder 7B für Code-Aufgaben.
- Mistral 7B, ein kompakter Allrounder.
- DeepSeek-R1, ein Reasoning-Modell für komplexe Aufgaben.
- Llava, ein Vision-Modell, das Bilder beschreiben kann.
Welches Modell passt, hängt von Deiner Aufgabe ab. Für Chat reicht ein 7B-Allrounder, für Code ein Coder-Modell, für Bilder ein Vision-Modell. Du kannst mehrere Modelle vorhalten und je nach Aufgabe wechseln.
Laufzeitumgebung
Die Laufzeitumgebung kümmert sich darum, dass das Modell geladen, ausgeführt und per API oder Oberfläche bedient wird. Ohne sie ist eine Modelldatei nur eine Datei auf der Festplatte.
Beispiele:
- Ollama ist der einfachste Einstieg. Du installierst es, führst
ollama run llama3.1aus, und das Modell wird geladen und gestartet. Ollama stellt automatisch eine lokale API bereit. - LM Studio richtet sich an Nutzer, die eine grafische Oberfläche wollen. Du suchst Modelle in der integrierten Suche, lädst sie herunter und testest sie im Chat.
- llama.cpp ist die zugrunde liegende Engine, flexibel, aber erfordert mehr Konfiguration. Wer maximale Kontrolle will, kommt hier ran.
- vLLM ist eine Alternative für Server-Betrieb mit höherem Durchsatz.
Eine Übersicht aller Optionen findest Du unter Lokale KI Software.
Client
Der Client ist das, was Du als Nutzer siehst. Das kann ein Terminal-Kommando, ein Chat-Interface im Browser oder eine eigene Anwendung sein.
Beispiele:
- Open WebUI ist ein beliebtes Projekt, das eine moderne Weboberfläche für Ollama bereitstellt. Sie sieht aus wie ChatGPT, läuft aber lokal.
- Continue ist ein Plugin für VS Code und JetBrains, das lokale Modelle für Code-Assistenz nutzt.
- Cline ist ein VS-Code-Plugin, das lokale Modelle als Agenten einsetzt. Mehr zu Agenten unter Was ist ein KI-Agent?.
- Ein einfaches Terminal reicht für erste Tests.
ollama run llama3.1startet einen direkten Chat in der Kommandozeile.
Wie funktioniert lokale KI Schritt für Schritt?
Um zu verstehen, was lokal passiert, gehen wir den Weg eines Prompts von der Eingabe bis zur Antwort durch. Nehmen wir als konkretes Beispiel: Du fragst ein lokal laufendes Llama 3.1 8B nach einer Zusammenfassung eines Vertragsabschnitts.
Schritt 1: Modell herunterladen. Beim ersten Start lädt Ollama das Modell von einem Registry-Server, etwa registry.ollama.ai. Die Datei ist etwa 4,7 GB groß und landet lokal auf Deiner Festplatte. Danach ist kein Internet mehr nötig.
Schritt 2: Modell in den Speicher laden. Wenn Du das Modell startest, lädt Ollama die Gewichte in den VRAM Deiner GPU oder in den Arbeitsspeicher bei CPU-Betrieb. Bei 4-Bit-Quantisierung belegt das 8B-Modell etwa 5 GB. Solange das Modell läuft, bleibt es im Speicher.
Schritt 3: Prompt senden. Du gibst Deinen Text ein, etwa über Open WebUI oder das Terminal. Der Client schickt den Prompt an die lokale API von Ollama, typischerweise an http://localhost:11434.
Schritt 4: Tokenisierung. Die Laufzeitumgebung zerlegt Deinen Prompt in Token. Aus “Fasse diesen Vertrag zusammen” wird eine Sequenz von Zahlen, die das Modell verarbeiten kann.
Schritt 5: Modell berechnet. Das Modell nimmt die Token-Sequenz und berechnet, Token für Token, die wahrscheinlichste Fortsetzung. Jeder neue Token basiert auf allen vorherigen. Das nennt man Autoregressives Erzeugen. Die Berechnung läuft auf Deiner GPU oder CPU.
Schritt 6: Antwort zurückgeben. Jeder berechnete Token wird de-tokenisiert, also zurück in Text umgewandelt, und an den Client gestreamt. Du siehst die Antwort Wort für Wort erscheinen.
Schritt 7: Speicher freigeben oder halten. Wenn Du fertig bist, kann das Modell im Speicher bleiben für die nächste Frage, oder Ollama entlädt es nach einer Timeout-Spanne.
Der ganze Prozess dauert bei einer guten GPU und einem 8B-Modell wenige Sekunden für eine kurze Antwort. Bei CPU-Betrieb kann es 30 Sekunden oder länger dauern. Die Geschwindigkeit misst Du in Token pro Sekunde, typisch sind 20 bis 60 auf einer RTX 3060, 5 bis 15 auf einer CPU.
Arten von lokalen Modellen
Lokale Modelle sind nicht alle gleich. Es gibt verschiedene Typen, je nachdem, was sie verarbeiten sollen.
LLMs (Large Language Models). Allrounder für Text. Sie verstehen Anfragen, schreiben Texte, beantworten Fragen und können reasoning betreiben. Beispiele: Llama 3.1, Qwen2.5, Mistral, DeepSeek-R1. Das ist der häufigste Typ für den lokalen Einsatz. Mehr zum Betrieb im Artikel LLM lokal betreiben.
Code-Modelle. Spezialisiert auf Programmiersprachen. Sie kennen Syntax, Patterns und Bibliotheken. Sie eignen sich für Autovervollständigung, Code-Erklärung, Tests und Refactoring. Beispiele: Qwen2.5-Coder, DeepSeek-Coder, CodeLlama.
Vision-Modelle. Verarbeiten Bilder neben Text. Du kannst ein Bild hochladen und das Modell beschreibt es, beantwortet Fragen dazu oder extrahiert Text. Beispiele: Llava, Qwen2-VL, MiniCPM-V.
Embedding-Modelle. Erzeugen Vektoren aus Text, die für semantische Suche und RAG gebraucht werden. Sie erzeugen keine Antworten, sondern Zahlenrepräsentationen. Beispiele: nomic-embed-text, bge-m3, mxbai-embed-large. Diese brauchst Du, wenn Du ein Lokales RAG-Setup aufbaust.
Multimodal-Modelle. Kombinieren mehrere Eingabetypen, etwa Text, Bilder und Audio. Sie sind die Generalisten unter den Modellen. Beispiele: Qwen2-VL, Llava, Pixtral. Lokal sind multimodale Modelle anspruchsvoller, weil sie mehr Speicher und Rechenleistung brauchen.
Vorteile und Grenzen
Lokale KI hat klare Vorzüge, aber auch Grenzen. Wer beide Seiten kennt, kann besser entscheiden, wann ein lokaler Betrieb passt.
Vorteile:
- Datensouveränität. Deine Daten verlassen Dein Netzwerk nicht. Bei sensiblen Dokumenten, internem Code oder persönlichen Notizen ist das der wichtigste Grund.
- Keine laufenden API-Kosten. Du zahlst nicht pro Token. Bei intensiver Nutzung sparst Du mittelfristig Geld.
- Volle Kontrolle über Modell und Version. Du entscheidest, welches Modell in welcher Quantisierung läuft. Kein Anbieter ändert über Nacht das Verhalten.
- Offline-Betrieb möglich. Nach dem Download des Modells brauchst Du kein Internet. Das ist relevant für Reisen, abgeschottete Netzwerke oder instabile Verbindungen.
- Keine Ratenlimits. Cloud-Dienste drosseln Anfragen. Lokal kannst Du so viele Anfragen stellen, wie Deine Hardware verarbeitet.
- Anpassbarkeit. Du kannst Modelle quantisieren, System-Prompts festlegen, RAG aufbauen und alles an Deine Bedürfnisse anpassen.
Grenzen:
- Leistung hängt von Hardware ab. Wer kein passendes System hat, kommt nicht weit. Große Modelle brauchen teure Hardware.
- Top-Modelle laufen lokal nur eingeschränkt. Modelle wie GPT-4 oder Claude 3.5 Sonnet sind lokal nicht verfügbar. Die besten lokalen Modelle sind gut, aber nicht auf diesem Niveau.
- Eigenbetrieb bedeutet Wartung. Updates, Fehlersuche, Speichermanagement und Backups liegen bei Dir.
- Quantisierung kostet Qualität. 4-Bit-Modelle sind kompakt, aber etwas schwächer als die Originalgewichte. Der Unterschied ist bei Chat oft klein, bei anspruchsvollen Aufgaben spürbar.
- Kein automatisches Wissen über aktuelle Ereignisse. Lokale Modelle haben einen Trainingsstand und wissen nicht, was danach passiert. RAG hilft hier, ist aber zusätzlicher Aufwand.
- Energieverbrauch. Ein laufender Server mit GPU verbraucht Strom. Bei Dauerbetrieb ist das ein Faktor.
Typische Anwendungsfälle
Hier sind konkrete Szenarien, in denen lokale KI Sinn ergibt, mit Beispielen.
1. Interne Wissensbasis mit RAG. Ein Unternehmen hat Handbücher, Wikis und Support-Dokumente. Mitarbeiter stellen Fragen in einer lokalen Oberfläche, das Modell antwortet mit Quellenangabe aus den eigenen Dokumenten. Setup: Ollama, ein LLM wie Llama 3.1, ein Embedding-Modell, eine Vektordatenbank wie Chroma, und Open WebUI als Frontend.
2. Code-Assistenz ohne Cloud. Ein Entwickler nutzt Qwen2.5-Coder lokal im VS Code mit dem Plugin Continue. Autovervollständigung, Code-Erklärung und Test-Generierung laufen auf dem eigenen Rechner. Der Quelltext verlässt die Maschine nicht.
3. Zusammenfassung sensibler Dokumente. Eine Kanzlei lädt Verträge als PDF in eine lokale Oberfläche. Das Modell erstellt Zusammenfassungen, markiert Risikoklauseln und beantwortet Fragen zum Inhalt. Kein Dokument geht an einen Cloud-Anbieter.
4. Übersetzung offline. Wer in Gebieten ohne stabiles Internet arbeitet, etwa auf Reisen oder im Außeneinsatz, kann lokale Modelle für Übersetzungen nutzen. Qwen2.5 beherrscht mehrere Sprachen und läuft offline.
5. Lokaler Chat-Assistent für Notizen und Ideen. Ein Nutzer führt ein privates Tagebuch, brainstormt Projektideen oder plant Reisen. All das will er nicht an einen Cloud-Dienst geben. Ein lokales Modell auf dem Laptop reicht für diese Aufgaben.
6. Automatisierung mit Agenten. Ein Entwickler baut einen Agenten, der Dateien liest, Skripte ausführt und Berichte erstellt. Der Agent nutzt ein lokales Modell als Gehirn. Mehr dazu unter Was ist ein KI-Agent?.
7. Vision-Anwendungen für Dokumente. Ein Team will gescannte Rechnungen auswerten. Ein lokales Vision-Modell wie Qwen2-VL liest Beträge, Daten und Lieferanten aus den Bildern und gibt sie als strukturierte Daten zurück.
Typische Stolpersteine bei lokaler KI
Wer mit lokaler KI startet, trifft auf typische Probleme. Hier die häufigsten und wie Du sie vermeidest.
1. Zu großes Modell für die Hardware. Anfänger laden ein 70B-Modell auf einen Rechner mit 8 GB VRAM. Das Modell lädt nicht oder bricht ab. Lösung: Prüfe zuerst Deinen VRAM, dann wähle ein passendes Modell. Faustregel: 4-Bit-Modell braucht etwa 0,6 GB pro Milliarde Parameter.
2. Langsame Antwort auf der CPU. Wer keine GPU hat und ein 13B-Modell lädt, wartet ewig auf Antworten. Lösung: Nutze kleinere Modelle wie 3B oder 1,5B auf der CPU, oder besorge eine GPU. Auch Apple Silicon ist deutlich schneller als eine reine CPU.
3. Verwirrung über Formate. Es gibt GGUF, Safetensors, ONNX, AWQ, GPTQ. Anfänger wissen nicht, was sie laden sollen. Lösung: Für Ollama und LM Studio ist GGUF der Standard. Lade GGUF-Dateien von Hugging Face, idealerweise mit Q4_K_M-Quantisierung als ausgewogener Startpunkt.
4. Kontextlänge überschätzt. Du gibst ein langes Dokument rein und wunderst Dich, warum das Modell den Anfang vergisst oder abbricht. Lösung: Prüfe die Kontextlänge des Modells und Deiner Laufzeitumgebung. Mehr im Artikel Kontextlänge.
5. Keine klaren System-Prompts. Ohne Anweisung verhält sich ein Modell oft generisch. Lösung: Definiere einen System-Prompt, der Rolle, Ton und Format festlegt. Das verbessert die Qualität deutlich.
6. RAG falsch aufgesetzt. Embeddings passen nicht zum Modell, die Vektordatenbank ist leer, oder die Chunks sind zu groß. Lösung: Nutze ein Embedding-Modell, das zu Deiner Sprache passt, und teste mit kleinen Dokumentmengen zuerst. Mehr unter Lokales RAG.
7. Strom und Lautstärke unterschätzt. Ein Server mit zwei GPUs läuft laut und zieht 500 Watt unter Last. Lösung: Prüfe vor dem Kauf den Stromverbrauch und die Kühlung. Für den Hausgebrauch reicht oft ein Mac oder ein PC mit einer GPU.
Hardware, Kosten und Sicherheit bei lokaler KI
Hardware. Die wichtigste Frage ist: Wie viel VRAM oder Unified Memory hast Du? Daran entscheidet sich, welche Modelle laufen. Eine RTX 3060 mit 12 GB ist ein solider Einstieg. Ein Mac mit 32 GB Unified Memory ist flexibler. Wer 70B-Modelle will, braucht 48 GB oder mehr. Details unter RAM und VRAM Anforderungen und KI-Hardware Grundlagen.
Kosten. Lokale KI ist nicht kostenlos. Du zahlst einmalig für Hardware und laufend für Strom. Ein PC mit RTX 3060 kostet etwa 800 bis 1200 Euro. Ein Mac Studio mit 64 GB liegt bei 2500 Euro. Stromkosten bei gelegentlicher Nutzung sind gering, bei Dauerbetrieb kommen 10 bis 30 Euro pro Monat dazu. Gegenüber einem Cloud-Abo von 20 bis 50 Euro pro Nutzer pro Monat amortisiert sich ein lokaler Aufbau bei intensiver Nutzung innerhalb weniger Monate.
Sicherheit. Lokale KI ist nicht automatisch sicher. Ein lokales Modell kann falsche Antworten liefern, Halluzinationen erzeugen oder schädliche Code-Vorschläge machen. Zudem speichern manche Laufzeitumgebungen Chat-Verläufe lokal. Wer sensible Daten verarbeitet, sollte Zugriffe absichern, Chat-Verläufe regelmäßig löschen und das System nicht offen ins Internet stellen. Ein lokales Setup schützt vor Datenabfluss an Cloud-Anbieter, aber nicht vor Fehlern des Modells selbst.
Weiterführende Links und Infos zu lokaler KI
- Lokale KI vs. Cloud KI - Wann sich welcher Ansatz lohnt
- LLM lokal betreiben - Schritt-für-Schritt-Anleitung
- Quantisierung - Wie Modelle kleiner werden
- Kontextlänge - Wie viel Text ein Modell verarbeiten kann
- RAM und VRAM Anforderungen - Hardware planen
- Lokale KI Software - Übersicht aller Laufzeitumgebungen
- Ollama - Der einfachste Einstieg
- Lokales RAG - Eigene Dokumente durchsuchbar machen
- KI-Hardware Grundlagen - Hardware verstehen
- Was ist ein KI-Agent? - Agenten mit lokalen Modellen
FAQ - Typische Fragen zur lokalen KI
Brauche ich zwingend eine Grafikkarte für lokale KI?
Nein. Viele Modelle laufen auch auf der CPU, allerdings deutlich langsamer. Für ein flüssiges Erlebnis und größere Modelle ist eine GPU oder Apple Silicon deutlich besser geeignet.
Wie viel RAM oder VRAM brauche ich?
Das hängt vom Modell ab. Eine 7B-Variante in 4-Bit-Quantisierung braucht etwa 5 GB VRAM. Ein 13B-Modell braucht 8 bis 10 GB. Ein 70B-Modell braucht 40 GB oder mehr. Details im Artikel zu RAM und VRAM Anforderungen.
Sind lokale Modelle schlechter als ChatGPT?
Nicht generell. Große Cloud-Modelle haben oft mehr Parameter und Training. Lokale Modelle wie Llama 3.1 8B oder Qwen2.5 sind aber für viele Aufgaben ausreichend und teilweise besser als ältere Cloud-Dienste. Der Unterschied liegt vor allem in der benötigten Hardware und bei sehr anspruchsvollen Reasoning-Aufgaben.
Kann ich meine eigenen Dokumente mit lokaler KI nutzen?
Ja. Mit einem RAG-Setup verbindest Du ein lokales Modell mit einer Vektordatenbank, in der Deine eigenen Dokumente liegen. So beantwortet die KI Fragen auf Basis Deiner Inhalte. Mehr dazu unter Lokales RAG.
Ist lokale KI wirklich kostenlos?
Keine laufenden API-Kosten, aber Hardware, Strom und Zeit kosten Geld. Bei einem bestehenden Rechner mit ausreichend Leistung sind die laufenden Kosten gering. Bei einem Neukauf oder Server steigt die Anfangsinvestition.
Welches Modell soll ich als Anfänger nehmen?
Starte mit Llama 3.1 8B in 4-Bit-Quantisierung über Ollama. Es ist kompakt, stark und gut dokumentiert. Alternativ Qwen2.5 7B, wenn Du mehrsprachig arbeitest. Beide laufen auf Hardware ab 8 GB VRAM.
Kann ich lokale KI auf einem Laptop nutzen?
Ja, wenn der Laptop genug Speicher hat. Ein Mac mit M-Chip und 16 GB Unified Memory ist gut geeignet. Windows-Laptops mit dedizierter GPU ab 6 GB VRAM funktionieren für kleine Modelle. Reine CPU-Laptops sind möglich, aber langsam.
Wie schnell ist lokale KI?
Auf einer RTX 3060 mit einem 8B-Modell erreichst Du 20 bis 60 Token pro Sekunde. Auf einer CPU sind es 5 bis 15. Apple Silicon liegt je nach Modell zwischen 15 und 40. Die Geschwindigkeit hängt von Hardware, Modellgröße und Quantisierung ab.
Kann ich lokale KI mit dem Internet verbinden?
Ja. Du kannst Ollama oder LM Studio so konfigurieren, dass sie über das Netz erreichbar sind. Das solltest Du aber nur mit Absicherung machen, etwa über VPN oder Reverse Proxy mit Authentifizierung. Ein offener Port ist ein Sicherheitsrisiko.
Was ist der Unterschied zwischen Ollama und LM Studio?
Ollama ist kommandozeilenorientiert und stellt eine API bereit. LM Studio hat eine grafische Oberfläche zum Suchen, Laden und Testen von Modellen. Beide nutzen llama.cpp unter der Haube. Für Anfänger mit GUI-Vorliebe ist LM Studio einfacher, für Automatisierung und Server-Betrieb ist Ollama besser.
Brauche ich Internet, um lokale KI zu nutzen?
Nur für den Download des Modells. Danach läuft alles offline. Das ist einer der großen Vorteile gegenüber Cloud-Diensten.
Kann ich mehrere Modelle gleichzeitig laufen lassen?
Ja, solange Dein Speicher reicht. Jedes geladene Modell belegt VRAM oder RAM. Mit 16 GB VRAM kannst Du ein 7B-LLM und ein Embedding-Modell parallel halten. Bei mehreren großen Modellen stößt Du schnell an Grenzen.
Wie aktualisiere ich ein lokales Modell?
Du lädst die neue Version herunter und ersetzt die alte Datei. Bei Ollama reicht ein ollama pull modellname. Es gibt kein automatisches Update, Du entscheidest selbst, wann Du wechselst.
Sind lokale Modelle sicher für sensible Daten?
Lokale Modelle senden keine Daten nach außen. Das ist ein Sicherheitsgewinn gegenüber Cloud-Diensten. Das Modell selbst kann aber falsche Antworten liefern oder Halluzinationen erzeugen. Prüfe Antworten bei sensiblen Inhalten immer nach.
Quellen und weiterführende Literatur
- Ollama-Dokumentation: https://ollama.com
- llama.cpp-Projekt: https://github.com/ggerganov/llama.cpp
- LM Studio: https://lmstudio.ai
- Hugging Face Model Hub: https://huggingface.co
- Meta Llama: https://llama.meta.com
- Qwen-Modellreihe: https://qwenlm.github.io


