Skip to content
BotServBotServ
Lokale KIGrundlagenQuantisierungKontextlängelokale KI vs CloudOllamaLLM

Lokale KI Grundlagen

Lokale KI Grundlagen: Was lokale KI ist, Unterschied zur Cloud, Quantisierung, Kontextlänge, RAM und VRAM. Übersicht aller Grundlagen-Artikel für Einsteiger.

S

schutzgeist

5 min read
Lokale KI Grundlagen: Modelle, Speicher und Kontext

Lokale KI Grundlagen

Was dieser Artikel behandelt

  • Was lokale KI ist und wofür sie sinnvoll ist.
  • Den Unterschied zwischen lokaler und Cloud-KI.
  • Wichtige Konzepte wie Quantisierung, Kontextlänge und Speicheranforderungen.
  • Verweise auf alle Grundlagen-Artikel.

Einleitung

Lokale KI bedeutet, Sprachmodelle auf dem eigenen Rechner oder Server laufen zu lassen. Datenschutz, Unabhängigkeit von Anbietern und volle Kontrolle über Daten und Workflows sind die Hauptgründe. Wer einsteigt, sollte verstehen, welche Hardwareanforderungen existieren, wie man Modelle kleiner macht und warum das Kontextfenster wichtig ist.

Warum brauche ich lokale KI-Grundlagen?

Wer ohne Grundlagen startet, scheitert oft an scheinbar einfachen Dingen. Ein Beispiel: Du lädst ein 13B-Modell herunter und wunderst Dich, warum es auf Deinem Rechner mit 16 GB RAM nicht läuft. Ohne Grundlagenwissen weißt Du nicht, dass Du Quantisierung brauchst, um das Modell auf 8 GB zu verkleinern. Oder Du nutzt ein Modell mit kleinem Kontextfenster und wunderst Dich, warum es lange Dokumente nicht versteht.

Die Grundlagen helfen Dir auch zu entscheiden, ob lokale KI für Deinen Anwendungsfall sinnvoll ist. Für kurze Experimente reicht oft die Cloud. Für datenschutzsensitive Daten oder dauerhafte Nutzung ohne API-Kosten lohnt sich lokale KI.

Lokale KI kurz erklärt

Lokale KI lädt ein Sprachmodell auf Deinen Rechner und führt es dort aus. Dafür brauchst Du eine Laufzeitumgebung wie Ollama oder LM Studio, die das Modell lädt und eine API bereitstellt. Das Modell liegt im RAM oder VRAM und berechnet Antworten lokal. Keine Daten verlassen Deinen Rechner.

Der Unterschied zur Cloud-KI ist einfach: Bei Cloud-KI schickst Du Deine Eingaben an einen Server eines Anbieters wie OpenAI oder Anthropic. Bei lokaler KI bleibt alles auf Deinem Rechner. Das kostet keinen API-Cent, braucht aber passende Hardware.

Für wen ist dieser Bereich gedacht?

  • Du willst lokal KI betreiben und wissen, was Dein Rechner leisten kann.
  • Du überlegst, ob lokale KI für Deinen Anwendungsfall sinnvoll ist.
  • Du bist Einsteiger und möchtest die Konzepte verstehen, bevor Du Ollama installierst.
  • Du brauchst keine tiefen Vorkenntnisse. Technische Begriffe werden hier inline erklärt.

Wichtige Begriffe

  • LLM - Large Language Model, ein großes Sprachmodell. Beispiele sind Llama 3.1, Qwen 2.5 oder Mistral.
  • Quantisierung - Reduzierung der Modellgenauigkeit, um Speicher zu sparen. Aus 16 GB werden so 8 GB oder weniger.
  • Kontextlänge - Maximale Eingabelänge, die das Modell auf einmal verarbeiten kann. Gemessen in Token.
  • Ollama - Lokale Laufzeitumgebung für Sprachmodelle. Lädt Modelle und bietet eine API.
  • LM Studio - Grafische Anwendung für lokale Modelle mit Bedienoberfläche.
  • Token - Kleinstes Bedeutungselement für ein Sprachmodell. Ein Wort entspricht etwa 1,5 Token.
  • Inferenz - Das Ausführen eines Modells, um Antworten zu berechnen. Training ist das Erstellen, Inferenz das Nutzen.

Inhalt und Artikel

Typische Stolpersteine

  • Modell passt nicht in den Speicher - Ohne Quantisierung laufen große Modelle nicht auf Consumer-Hardware. Prüfe vorher, wie viel Speicher das Modell braucht.
  • Kontextfenster ist zu klein - Ein Modell mit 4K-Kontext versteht keine langen Dokumente. Für RAG brauchst Du ein Modell mit größerem Kontextfenster.
  • Cloud-Kosten vs. Hardwarekosten - Lokale KI ist nicht gratis. Du zahlst in Hardware und Strom. Für seltene Nutzung kann die Cloud günstiger sein.
  • Nicht jedes Modell läuft lokal - Manche Modelle sind für Cloud-Infrastruktur optimiert. Prüfe, ob eine quantisierte Version verfügbar ist.

FAQ - Häufige Fragen

Was ist lokale KI?

Lokale KI bedeutet, Sprachmodelle auf dem eigenen Rechner oder Server laufen zu lassen. Die Modelle liegen im RAM oder VRAM und berechnen Antworten lokal. Keine Daten verlassen Deinen Rechner. Mehr dazu im Artikel Was ist lokale KI?

Was ist der Unterschied zwischen lokaler KI und Cloud-KI?

Bei Cloud-KI schickst Du Eingaben an einen Server eines Anbieters. Bei lokaler KI bleibt alles auf Deinem Rechner. Lokale KI kostet keinen API-Cent, braucht aber passende Hardware. Mehr dazu im Artikel Lokale KI vs. Cloud-KI.

Was ist Quantisierung?

Quantisierung reduziert die Genauigkeit eines Modells, um Speicher zu sparen. Aus einem 16 GB großen Modell werden so 8 GB oder weniger. Das ermöglicht größere Modelle auf kleinerer Hardware. Mehr dazu im Artikel Quantisierung.

Was ist die Kontextlänge?

Die Kontextlänge ist die maximale Eingabelänge, die ein Modell auf einmal verarbeiten kann. Sie wird in Token gemessen. Ein Modell mit 8K-Kontext versteht längere Dokumente als eines mit 4K-Kontext. Mehr dazu im Artikel Kontextlänge.

Lohnt sich lokale KI für Einsteiger?

Ja. Tools wie Ollama ermöglichen den Einstieg mit wenig Aufwand. Für größere Modelle braucht man aber passende Hardware.

Brauche ich eine Grafikkarte für lokale KI?

Für kleine Modelle reicht oft die CPU. Für schnellere Antworten und größere Modelle ist eine GPU mit ausreichend VRAM empfohlen.

Wie viel RAM brauche ich für lokale KI?

Für 7B-Modelle mindestens 16 GB RAM, besser 32 GB. Größere Modelle wie 70B benötigen 64 GB oder mehr. Mehr dazu im Artikel RAM- und VRAM-Anforderungen.

Welche Software brauche ich für lokale KI?

Die einfachste Lösung ist Ollama. Es lädt Modelle und bietet eine API. LM Studio ist eine grafische Alternative. Mehr dazu in der Übersicht Lokale KI Software.

Was ist ein Token?

Ein Token ist das kleinste Bedeutungselement für ein Sprachmodell. Ein Wort entspricht etwa 1,5 Token. Die Kontextlänge wird in Token gemessen.

Was ist der Unterschied zwischen Training und Inferenz?

Training ist das Erstellen eines Modells mit großen Datenmengen. Inferenz ist das Ausführen eines fertigen Modells, um Antworten zu berechnen. Lokale KI nutzt Inferenz.

Sind lokale Modelle so gut wie Cloud-Modelle?

Große lokale Modelle wie Llama 3.1 70B kommen nah an Cloud-Modelle heran. Kleine 7B-Modelle sind schwächer, aber für viele Aufgaben ausreichend. Der Abstand wird kleiner, je besser Open-Source-Modelle werden.

Kann ich lokale KI mit Docker betreiben?

Ja. Ollama, LM Studio und viele Frameworks lassen sich in Docker betreiben. Das ist besonders sinnvoll, wenn Du mehrere Dienste isoliert laufen lassen willst.

Zurück zum KI Blog
Share:

Ähnliche Beiträge