Skip to content
BotServBotServ
GlossarBegriffeLLMQuantisierungTool-CallingRAMVRAMAgentRAG

KI-Grundlagen-Glossar

KI-Grundlagen-Glossar: Alle wichtigen Begriffe für lokale KI, KI-Agenten und KI-Hardware verständlich erklärt. Von LLM über Quantisierung bis Tool-Calling.

S

schutzgeist

12 min read
KI-Grundlagen-Glossar mit allen wichtigen Begriffen

KI-Grundlagen-Glossar

Was dieses KI-Grundlagen-Glossar behandelt

  • Alle wichtigen Begriffe aus den Grundlagen-Artikeln von BotServ.
  • Erklärungen verständlich für Anfänger, mit Beispielen.
  • Querverweise zu den Artikeln, in denen die Begriffe im Detail erklärt werden.
  • Sortiert nach Themenbereichen: Lokale KI, KI-Agenten, KI-Hardware.

Einleitung: KI-Grundlagen-Glossar

Wer sich in lokale KI, KI-Agenten und KI-Hardware einarbeitet, trifft auf viele Fachbegriffe. Dieses Glossar sammelt alle zentralen Begriffe aus den Grundlagen-Artikeln von BotServ an einem Ort. Jeder Begriff wird kurz und verständlich erklärt, oft mit einem Beispiel. Wer mehr Details braucht, findet einen Link zum passenden Grundlagen-Artikel.

Begriffe der lokalen KI

LLM

LLM steht für Large Language Model, also ein großes Sprachmodell. Ein LLM ist eine KI, die Text verarbeiten und erzeugen kann. Beispiele sind Llama 3.1, Qwen 2.5 oder Mistral. Ein LLM besteht aus Milliarden von Parametern und wurde mit großen Textmengen trainiert. Mehr dazu im Artikel Was ist lokale KI?.

Inferenz

Inferenz ist der Vorgang, bei dem ein fertig trainiertes Modell eine Eingabe verarbeitet und eine Antwort erzeugt. Wenn Du Ollama startest, einen Prompt eingibst und eine Antwort bekommst, ist das Inferenz. Das Gegenteil ist Training, also das Erstellen des Modells. Mehr dazu im Artikel LLM lokal betreiben.

Training

Training ist das Erstellen eines Modells. Dabei wird das Modell mit großen Datenmengen trainiert, damit es Texte verstehen und erzeugen kann. Training braucht enorme Rechenleistung und dauert Wochen oder Monate. Inferenz ist das Nutzen des fertigen Modells. Mehr dazu im Artikel Was ist lokale KI?.

Token

Ein Token ist die kleinste Einheit, die ein Sprachmodell verarbeitet. Ein Token kann ein Wort, ein Wortteil oder ein Zeichen sein. Ein Wort entspricht im Deutschen etwa 1,3 bis 1,5 Token. Die Kontextlänge eines Modells wird in Token gemessen. Mehr dazu im Artikel Kontextlänge.

Kontextlänge

Die Kontextlänge, auch Kontextfenster genannt, ist die maximale Anzahl an Token, die ein Modell auf einmal verarbeiten kann. Ein Modell mit 8.000 Token Kontext kann etwa 6.000 Wörter auf einmal lesen. Längere Texte müssen geteilt oder gekürzt werden. Mehr dazu im Artikel Kontextlänge.

Kontextfenster

Synonym für Kontextlänge. Beide Begriffe bezeichnen die maximale Eingabelänge eines Modells in Token.

KV-Cache

Der KV-Cache ist ein Zwischenspeicher, den das Modell während der Inferenz aufbaut. Er speichert Zwischenwerte für jeden bereits verarbeiteten Token. Bei langen Kontexten wächst der KV-Cache und verbraucht zusätzlichen Speicher. Das ist der Grund, warum lange Kontexte mehr VRAM oder RAM brauchen. Mehr dazu im Artikel Kontextlänge.

Prompt

Ein Prompt ist die Eingabe, die Du einem Sprachmodell gibst. Das kann eine Frage, ein Auftrag oder ein Text sein, den das Modell bearbeiten soll. Der Prompt plus die Antwort des Modells müssen zusammen in das Kontextfenster passen.

Completion

Completion ist die Antwort, die das Modell nach einem Prompt erzeugt. Bei Chat-Modellen besteht die Completion aus der Nachricht, die das Modell zurückgibt.

System Prompt

Der System Prompt ist eine Anweisung, die das Modell am Anfang eines Gesprächs erhält. Er definiert Rolle, Verhalten und Grenzen des Modells. Beispiel: “Du bist ein hilfreicher Assistent für lokale KI. Antworte auf Deutsch.”

Ollama

Ollama ist eine Laufzeitumgebung für lokale Sprachmodelle. Es lädt Modelle herunter, startet sie und bietet eine API an. Ollama ist der einfachste Einstieg in lokale KI. Mehr dazu im Artikel LLM lokal betreiben und unter Ollama.

LM Studio

LM Studio ist eine grafische Anwendung für lokale Sprachmodelle. Es bietet eine Bedienoberfläche zum Laden und Testen von Modellen. LM Studio ist eine Alternative zu Ollama für Nutzer, die lieber klicken als tippen. Mehr dazu im Artikel LLM lokal betreiben.

GGUF

GGUF ist ein Dateiformat für quantisierte Sprachmodelle. Es wird von llama.cpp und Ollama verwendet. GGUF-Dateien enthalten das Modell in komprimierter Form, sodass es mit weniger Speicher läuft. Mehr dazu im Artikel Quantisierung.

Quantisierung

Quantisierung reduziert die Genauigkeit der Modellgewichte, um Speicher zu sparen. Ein Modell, das ursprünglich mit 16-Bit-Werten trainiert wurde, wird auf 4, 5 oder 8 Bit reduziert. Dadurch sinkt der Speicherbedarf deutlich. Der Nachteil: Die Antwortqualität kann leicht abnehmen. Mehr dazu im Artikel Quantisierung.

FP16

FP16 steht für 16-Bit-Gleitkommazahlen. Das ist das Standardformat, in dem Modelle trainiert werden. Ein FP16-Modell ist groß und braucht viel Speicher. Für lokale KI wird es meist quantisiert.

INT8

INT8 ist eine 8-Bit-Ganzzahldarstellung. Ein Modell in INT8 braucht etwa halb so viel Speicher wie in FP16. Die Qualität bleibt meist nahe am Original.

INT4

INT4 ist eine 4-Bit-Darstellung. Ein Modell in INT4 braucht etwa ein Viertel des Speichers von FP16. INT4 ist die häufigste Quantisierungsstufe für lokale KI auf Consumer-Hardware.

Q4, Q5, Q6, Q8

Diese Abkürzungen bezeichnen Quantisierungsstufen mit 4, 5, 6 oder 8 Bit. Q4 spart am meisten Speicher, Q8 bietet die beste Qualität. Mehr dazu im Artikel Quantisierung.

K-Quantisierung

K-Quantisierung ist eine verbesserte Mischquantisierung. Sie speichert empfindlichere Teile des Modells mit mehr Bits als weniger empfindliche. Q4_K_M ist besser als Q4_0, weil sie wichtigen Gewichten mehr Präzision gibt. Mehr dazu im Artikel Quantisierung.

RAG

RAG steht für Retrieval-Augmented Generation. Das Modell sucht passende Textstellen aus einer Datenbank und nutzt sie als Kontext für die Antwort. RAG erlaubt es, ein Modell mit eigenen Dokumenten zu nutzen, ohne es neu zu trainieren. Mehr dazu unter Lokales RAG.

Embedding

Ein Embedding ist eine numerische Darstellung von Text. Der Text wird in einen Vektor aus Zahlen umgewandelt, der seine Bedeutung erfasst. Embeddings werden für die RAG-Suche genutzt. Mehr dazu im Artikel Embedding-Modelle.

Vektordatenbank

Eine Vektordatenbank speichert Embeddings und ermöglicht die Suche nach ähnlichen Texten. Beispiele sind Chroma und Qdrant. Vektordatenbanken sind ein zentraler Bestandteil von RAG-Systemen. Mehr dazu unter Vektordatenbanken.

Chunking

Chunking ist das Aufteilen von Dokumenten in kleinere Stücke, bevor sie in eine Vektordatenbank geladen werden. Jeder Chunk wird zu einem Embedding. Gutes Chunking ist wichtig für gute RAG-Ergebnisse. Mehr dazu im Artikel Chunking.

Self-Hosting

Self-Hosting bedeutet, Software auf eigener Hardware zu betreiben, statt sie als Cloud-Dienst zu nutzen. Lokale KI ist eine Form von Self-Hosting. Mehr dazu im Artikel Was ist lokale KI?.

Cloud KI

Cloud KI bedeutet, dass das Modell auf Servern eines Anbieters läuft. Du sendest Deine Eingabe per API oder Browser, die Antwort kommt zurück. Beispiele sind ChatGPT, Claude und Gemini. Mehr dazu im Artikel Lokale KI vs. Cloud KI.

API

API steht für Application Programming Interface. Eine API ist eine Schnittstelle, über die Programme miteinander kommunizieren. Ollama bietet beispielsweise eine API unter http://localhost:11434 an, über die andere Programme das Modell ansprechen können.

Hybrid

Ein hybrides Setup kombiniert lokale KI und Cloud KI. Einfache oder unsensible Aufgaben laufen in der Cloud, sensible oder häufige Aufgaben lokal. Mehr dazu im Artikel Lokale KI vs. Cloud KI.

DSGVO

Die DSGVO (Datenschutz-Grundverordnung) regelt den Umgang mit personenbezogenen Daten in der EU. Lokale KI hilft bei der Einhaltung, weil Daten das eigene Netzwerk nicht verlassen. Mehr dazu im Artikel Lokale KI vs. Cloud KI.

Modelfile

Ein Modelfile ist eine Konfigurationsdatei für Ollama. Sie definiert, welches Modell geladen wird, welche System-Prompt verwendet wird und welche Parameter gelten. Ähnlich wie ein Dockerfile, aber für KI-Modelle.

Parameter

Parameter sind die Gewichte eines Modells. Sie werden beim Training gelernt und bestimmen, wie das Modell Eingaben verarbeitet. Modelle werden oft nach ihrer Parameteranzahl benannt, zum Beispiel 7B für 7 Milliarden Parameter.

Begriffe der KI-Agenten

Agent

Ein Agent ist ein KI-System, das ein Ziel verfolgt und eigenständig Aktionen ausführt. Er beobachtet seine Umgebung, plant Schritte und nutzt Werkzeuge, um das Ziel zu erreichen. Mehr dazu im Artikel Was ist ein KI-Agent?.

KI-Agent

Synonym für Agent. Ein KI-Agent nutzt ein Sprachmodell als Gehirn und Tools als Hände, um Aufgaben zu erledigen.

Chatbot

Ein Chatbot ist ein Dialogsystem, das auf Eingaben mit Text antwortet. Er reagiert, plant aber nicht eigenständig und nutzt keine Tools. Mehr dazu im Artikel Chatbot vs. KI-Agent.

Tool

Ein Tool ist eine externe Funktion, die ein Agent aufrufen kann. Beispiele sind Websuche, Dateizugriff, Datenbankabfragen oder E-Mail-Versand. Tools machen einen Agenten erst nützlich.

Tool-Calling

Tool-Calling ist die Fähigkeit eines Sprachmodells, externe Funktionen aufzurufen. Das Modell erzeugt nicht nur Text, sondern eine strukturierte Nachricht mit Funktionsname und Parametern. Dein Programm führt die Funktion aus und gibt das Ergebnis zurück. Mehr dazu im Artikel Tool-Calling.

Function Calling

Synonym für Tool-Calling. Beide Begriffe bezeichnen dieselbe Fähigkeit.

Schema

Ein Schema beschreibt ein Tool für das Modell. Es enthält den Namen, eine Beschreibung und die Parameter mit Typen. Das Modell nutzt das Schema, um zu entscheiden, ob und wie es das Tool aufruft.

Gedächtnis

Gedächtnis (Memory) ist der Speicher eines Agenten. Kurzzeitgedächtnis hält aktuelle Schritte und Zwischenergebnisse. Langzeitgedächtnis speichert Wissen über mehrere Sessions hinweg.

Memory

Englischer Begriff für Gedächtnis. Siehe oben.

Planung

Planung ist die Aufteilung eines Ziels in einzelne Schritte. Der Agent plant, welche Aktion er als Nächstes ausführt, und passt den Plan an Zwischenergebnisse an.

Autonomie

Autonomie beschreibt, wie selbstständig ein Agent Entscheidungen trifft. Mehr Autonomie bedeutet mehr Möglichkeiten, aber auch mehr Risiko. Autonome Agenten sollten in Sandbox-Umgebungen laufen.

Multi-Agenten

Multi-Agenten bedeutet, dass mehrere Agenten mit unterschiedlichen Rollen zusammenarbeiten. Ein Agent schreibt Code, ein anderer prüft ihn, ein dritter dokumentiert. Beispiele sind CrewAI und AutoGen. Mehr dazu in der Frameworks-Übersicht.

Workflow

Ein Workflow ist eine Abfolge von Schritten, die ein Agent abarbeitet. Workflows können linear oder verzweigt sein. Ein Recherche-Workflow könnte so aussehen: suchen, lesen, zusammenfassen, speichern.

MCP

MCP steht für Model Context Protocol. Es ist ein Standard für Werkzeuge und Kontext, den Agenten nutzen können. MCP macht es einfacher, Werkzeuge zwischen verschiedenen Frameworks zu teilen.

Reasoning

Reasoning ist die Fähigkeit eines Modells, logisch zu denken und Schlussfolgerungen zu ziehen. Modelle mit gutem Reasoning sind für Agenten besser geeignet, weil sie Schritte besser planen.

ReAct

ReAct ist eine Agenten-Architektur, die Reasoning und Acting kombiniert. Der Agent denkt zuerst (Reason), dann handelt er (Act), dann beobachtet er das Ergebnis (Observe) und beginnt von vorn. Mehr dazu im Artikel Was ist ein KI-Agent?.

Plan-and-Execute

Plan-and-Execute ist eine Agenten-Architektur, bei der der Agent zuerst einen kompletten Plan erstellt und dann Schritt für Schritt ausführt. Im Gegensatz zu ReAct wird der Plan vorab erstellt, nicht Schritt für Schritt.

Sandbox

Eine Sandbox ist eine isolierte Umgebung, in der ein Agent läuft. Sie verhindert, dass der Agent unerwartete Aktionen auf dem echten System ausführt. Sandboxing ist wichtig für Sicherheit bei autonomen Agenten.

Menschliche Freigabe

Menschliche Freigabe (Human-in-the-Loop) bedeutet, dass kritische Aktionen eines Agenten vor der Ausführung von einem Menschen bestätigt werden müssen. Das erhöht die Sicherheit bei autonomen Workflows.

Framework

Ein Framework ist eine Software-Bibliothek, die Dir hilft, Agenten zu bauen. Frameworks übernehmen die Schleife aus Beobachten, Planen und Ausführen. Beispiele sind LangGraph, CrewAI und AutoGen. Mehr dazu in der Frameworks-Übersicht.

Begriffe der KI-Hardware

RAM

RAM (Random Access Memory) ist der Arbeitsspeicher Deines Rechners. Er steht der CPU und allen Programmen zur Verfügung. Bei CPU-Inferenz liegt das Modell im RAM. Mehr dazu im Artikel RAM vs. VRAM.

VRAM

VRAM (Video RAM) ist der Speicher auf einer dedizierten Grafikkarte. Er steht der GPU exklusiv zur Verfügung und ist für KI-Berechnungen deutlich schneller als RAM. Bei GPU-Inferenz liegt das Modell im VRAM. Mehr dazu im Artikel RAM vs. VRAM.

GPU

GPU steht für Graphics Processing Unit, also den Prozessor auf der Grafikkarte. GPUs haben viele parallele Rechenkerne und sind für KI-Inferenz deutlich schneller als CPUs. Mehr dazu im Artikel RAM vs. VRAM.

CPU

CPU steht für Central Processing Unit, also den Hauptprozessor des Rechners. CPUs haben wenige, aber flexible Kerne. KI-Inferenz auf der CPU ist möglich, aber langsamer als auf der GPU.

GPU-Offloading

GPU-Offloading bedeutet, dass Teile eines Modells auf die GPU ausgelagert werden, wenn es nicht vollständig in den VRAM passt. Der Rest bleibt im RAM. Das ist langsamer als volle GPU-Inferenz, aber schneller als reine CPU-Inferenz. Mehr dazu im Artikel RAM vs. VRAM.

Speicherbandbreite

Speicherbandbreite ist die Geschwindigkeit, mit der Daten zwischen Speicher und Prozessor übertragen werden. Hohe Bandbreite ist für KI wichtig, weil viele Daten bewegt werden müssen. VRAM hat meist höhere Bandbreite als RAM.

Unified Memory

Unified Memory bedeutet, dass CPU und GPU sich denselben Arbeitsspeicher teilen. Ein Mac mit 32 GB RAM kann diese 32 GB auch für die GPU nutzen. Bei einer klassischen Grafikkarte ist der VRAM separat. Mehr dazu im Artikel RAM vs. VRAM.

Shared Memory

Synonym für Unified Memory. Beide Begriffe bezeichnen gemeinsamen Speicher für CPU und GPU.

APU

APU steht für Accelerated Processing Unit. Eine APU vereint CPU und GPU auf einem Chip. Beispiele sind Apple Silicon und AMD Ryzen AI Max. Der Vorteil ist, dass beide Prozessoren auf denselben Speicher zugreifen können. Mehr dazu in den KI-Hardware Grundlagen.

Apple Silicon

Apple Silicon ist die Bezeichnung für Apples eigene Chips, wie M1, M2, M3, M4. Sie vereinen CPU und GPU auf einem Chip und nutzen Unified Memory. Apple Silicon ist für lokale KI sehr beliebt, weil es viel Speicher effizient nutzt. Mehr dazu im Artikel RAM vs. VRAM.

TOPS

TOPS steht für Tera Operations Per Second. Es ist die Maßeinheit für KI-Rechenleistung. Ein höherer TOPS-Wert bedeutet, dass ein Chip potenziell mehr KI-Operationen pro Sekunde ausführen kann. TOPS sagen aber nicht alles, weil Speicherbandbreite und Architektur genauso wichtig sind. Mehr dazu in den KI-Hardware Grundlagen.

NTOPS

NTOPS steht für NPU TOPS, also die KI-Rechenleistung der NPU (Neural Processing Unit). NPUs sind spezialisierte KI-Beschleuniger in modernen Chips. NTOPS messen nur die NPU-Leistung, nicht die der GPU.

SSD

SSD steht für Solid State Drive, also einen Flash-Speicher. Eine SSD lädt Modelle deutlich schneller als eine klassische Festplatte (HDD). NVMe-SSDs sind noch schneller als SATA-SSDs.

NVMe

NVMe ist ein Schnittstellenstandard für SSDs. NVMe-SSDs sind deutlich schneller als SATA-SSDs und laden große Modelle in Sekunden statt Minuten. Für lokale KI ist eine NVMe-SSD empfohlen.

Speicherbedarf

Speicherbedarf ist der RAM oder VRAM, den ein Modell während der Inferenz benötigt. Er ergibt sich aus Modellgröße, Quantisierung und KV-Cache. Mehr dazu im Artikel RAM und VRAM Anforderungen.

FAQ - Häufige Fragen zum Glossar

Was ist der Unterschied zwischen Training und Inferenz?

Training ist das Erstellen eines Modells mit großen Datenmengen. Inferenz ist das Nutzen des fertigen Modells, um Antworten zu berechnen. Lokale KI nutzt Inferenz.

Was ist der Unterschied zwischen RAM und VRAM?

RAM ist der Arbeitsspeicher des Rechners, VRAM ist der Speicher der Grafikkarte. Bei CPU-Inferenz liegt das Modell im RAM, bei GPU-Inferenz im VRAM. GPU-Inferenz ist deutlich schneller. Mehr dazu im Artikel RAM vs. VRAM.

Was ist der Unterschied zwischen Tool-Calling und Function Calling?

Nichts. Beide Begriffe bezeichnen dieselbe Fähigkeit: ein Sprachmodell, das externe Funktionen aufrufen kann. Mehr dazu im Artikel Tool-Calling.

Was ist der Unterschied zwischen Kontextlänge und Kontextfenster?

Nichts. Beide Begriffe bezeichnen die maximale Anzahl an Token, die ein Modell auf einmal verarbeiten kann. Mehr dazu im Artikel Kontextlänge.

Was ist der Unterschied zwischen Quantisierung und Komprimierung?

Quantisierung ist eine spezielle Form der Komprimierung. Sie reduziert die Genauigkeit der Modellgewichte von beispielsweise 16 Bit auf 4 Bit. Komprimierung ist der allgemeinere Begriff.

Was ist der Unterschied zwischen Agent und Chatbot?

Ein Chatbot reagiert auf Eingaben mit Text. Ein Agent plant mehrere Schritte, nutzt Tools und verfolgt ein Ziel. Mehr dazu im Artikel Chatbot vs. KI-Agent.

Was ist der Unterschied zwischen Unified Memory und Shared Memory?

Nichts. Beide Begriffe bezeichnen gemeinsamen Speicher für CPU und GPU, wie bei Apple Silicon oder Ryzen AI Max.

Was ist der Unterschied zwischen Q4_0 und Q4_K_M?

Q4_0 quantisiert alle Gewichte gleich. Q4_K_M verwendet eine Mischquantisierung, die empfindlichere Teile des Modells mit mehr Bits speichert. Q4_K_M liefert meist bessere Ergebnisse. Mehr dazu im Artikel Quantisierung.

Was bedeutet GGUF?

GGUF ist ein Dateiformat für quantisierte Sprachmodelle. Es wird von llama.cpp und Ollama verwendet. GGUF-Dateien enthalten das Modell in komprimierter Form.

Was ist der Unterschied zwischen RAG und Fine-Tuning?

RAG sucht passende Textstellen aus einer Datenbank und gibt sie dem Modell als Kontext. Fine-Tuning trainiert das Modell mit neuen Daten weiter. RAG ist einfacher und flexibler, Fine-Tuning ist aufwändiger aber tiefer integriert.

Was ist der Unterschied zwischen TOPS und TFLOPS?

TOPS misst ganzzahlige Operationen (INT), TFLOPS misst Gleitkomma-Operationen (FP). Für KI-Inferenz mit quantisierten Modellen ist TOPS relevanter. Für Training ist TFLOPS wichtiger.

Was ist der Unterschied zwischen MCP und Tool-Calling?

Tool-Calling ist die Fähigkeit des Modells, Funktionen aufzurufen. MCP ist ein Standard, der definiert, wie Werkzeuge und Kontext strukturiert bereitgestellt werden. MCP nutzt Tool-Calling als Mechanismus.

Zurück zum KI Blog
Share:

Nächster Artikel in Lokale KI

Weiterlesen
Kontextlänge

Ähnliche Beiträge