KI-Grundlagen-Glossar
Was dieses KI-Grundlagen-Glossar behandelt
- Alle wichtigen Begriffe aus den Grundlagen-Artikeln von BotServ.
- Erklärungen verständlich für Anfänger, mit Beispielen.
- Querverweise zu den Artikeln, in denen die Begriffe im Detail erklärt werden.
- Sortiert nach Themenbereichen: Lokale KI, KI-Agenten, KI-Hardware.
Einleitung: KI-Grundlagen-Glossar
Wer sich in lokale KI, KI-Agenten und KI-Hardware einarbeitet, trifft auf viele Fachbegriffe. Dieses Glossar sammelt alle zentralen Begriffe aus den Grundlagen-Artikeln von BotServ an einem Ort. Jeder Begriff wird kurz und verständlich erklärt, oft mit einem Beispiel. Wer mehr Details braucht, findet einen Link zum passenden Grundlagen-Artikel.
Begriffe der lokalen KI
LLM
LLM steht für Large Language Model, also ein großes Sprachmodell. Ein LLM ist eine KI, die Text verarbeiten und erzeugen kann. Beispiele sind Llama 3.1, Qwen 2.5 oder Mistral. Ein LLM besteht aus Milliarden von Parametern und wurde mit großen Textmengen trainiert. Mehr dazu im Artikel Was ist lokale KI?.
Inferenz
Inferenz ist der Vorgang, bei dem ein fertig trainiertes Modell eine Eingabe verarbeitet und eine Antwort erzeugt. Wenn Du Ollama startest, einen Prompt eingibst und eine Antwort bekommst, ist das Inferenz. Das Gegenteil ist Training, also das Erstellen des Modells. Mehr dazu im Artikel LLM lokal betreiben.
Training
Training ist das Erstellen eines Modells. Dabei wird das Modell mit großen Datenmengen trainiert, damit es Texte verstehen und erzeugen kann. Training braucht enorme Rechenleistung und dauert Wochen oder Monate. Inferenz ist das Nutzen des fertigen Modells. Mehr dazu im Artikel Was ist lokale KI?.
Token
Ein Token ist die kleinste Einheit, die ein Sprachmodell verarbeitet. Ein Token kann ein Wort, ein Wortteil oder ein Zeichen sein. Ein Wort entspricht im Deutschen etwa 1,3 bis 1,5 Token. Die Kontextlänge eines Modells wird in Token gemessen. Mehr dazu im Artikel Kontextlänge.
Kontextlänge
Die Kontextlänge, auch Kontextfenster genannt, ist die maximale Anzahl an Token, die ein Modell auf einmal verarbeiten kann. Ein Modell mit 8.000 Token Kontext kann etwa 6.000 Wörter auf einmal lesen. Längere Texte müssen geteilt oder gekürzt werden. Mehr dazu im Artikel Kontextlänge.
Kontextfenster
Synonym für Kontextlänge. Beide Begriffe bezeichnen die maximale Eingabelänge eines Modells in Token.
KV-Cache
Der KV-Cache ist ein Zwischenspeicher, den das Modell während der Inferenz aufbaut. Er speichert Zwischenwerte für jeden bereits verarbeiteten Token. Bei langen Kontexten wächst der KV-Cache und verbraucht zusätzlichen Speicher. Das ist der Grund, warum lange Kontexte mehr VRAM oder RAM brauchen. Mehr dazu im Artikel Kontextlänge.
Prompt
Ein Prompt ist die Eingabe, die Du einem Sprachmodell gibst. Das kann eine Frage, ein Auftrag oder ein Text sein, den das Modell bearbeiten soll. Der Prompt plus die Antwort des Modells müssen zusammen in das Kontextfenster passen.
Completion
Completion ist die Antwort, die das Modell nach einem Prompt erzeugt. Bei Chat-Modellen besteht die Completion aus der Nachricht, die das Modell zurückgibt.
System Prompt
Der System Prompt ist eine Anweisung, die das Modell am Anfang eines Gesprächs erhält. Er definiert Rolle, Verhalten und Grenzen des Modells. Beispiel: “Du bist ein hilfreicher Assistent für lokale KI. Antworte auf Deutsch.”
Ollama
Ollama ist eine Laufzeitumgebung für lokale Sprachmodelle. Es lädt Modelle herunter, startet sie und bietet eine API an. Ollama ist der einfachste Einstieg in lokale KI. Mehr dazu im Artikel LLM lokal betreiben und unter Ollama.
LM Studio
LM Studio ist eine grafische Anwendung für lokale Sprachmodelle. Es bietet eine Bedienoberfläche zum Laden und Testen von Modellen. LM Studio ist eine Alternative zu Ollama für Nutzer, die lieber klicken als tippen. Mehr dazu im Artikel LLM lokal betreiben.
GGUF
GGUF ist ein Dateiformat für quantisierte Sprachmodelle. Es wird von llama.cpp und Ollama verwendet. GGUF-Dateien enthalten das Modell in komprimierter Form, sodass es mit weniger Speicher läuft. Mehr dazu im Artikel Quantisierung.
Quantisierung
Quantisierung reduziert die Genauigkeit der Modellgewichte, um Speicher zu sparen. Ein Modell, das ursprünglich mit 16-Bit-Werten trainiert wurde, wird auf 4, 5 oder 8 Bit reduziert. Dadurch sinkt der Speicherbedarf deutlich. Der Nachteil: Die Antwortqualität kann leicht abnehmen. Mehr dazu im Artikel Quantisierung.
FP16
FP16 steht für 16-Bit-Gleitkommazahlen. Das ist das Standardformat, in dem Modelle trainiert werden. Ein FP16-Modell ist groß und braucht viel Speicher. Für lokale KI wird es meist quantisiert.
INT8
INT8 ist eine 8-Bit-Ganzzahldarstellung. Ein Modell in INT8 braucht etwa halb so viel Speicher wie in FP16. Die Qualität bleibt meist nahe am Original.
INT4
INT4 ist eine 4-Bit-Darstellung. Ein Modell in INT4 braucht etwa ein Viertel des Speichers von FP16. INT4 ist die häufigste Quantisierungsstufe für lokale KI auf Consumer-Hardware.
Q4, Q5, Q6, Q8
Diese Abkürzungen bezeichnen Quantisierungsstufen mit 4, 5, 6 oder 8 Bit. Q4 spart am meisten Speicher, Q8 bietet die beste Qualität. Mehr dazu im Artikel Quantisierung.
K-Quantisierung
K-Quantisierung ist eine verbesserte Mischquantisierung. Sie speichert empfindlichere Teile des Modells mit mehr Bits als weniger empfindliche. Q4_K_M ist besser als Q4_0, weil sie wichtigen Gewichten mehr Präzision gibt. Mehr dazu im Artikel Quantisierung.
RAG
RAG steht für Retrieval-Augmented Generation. Das Modell sucht passende Textstellen aus einer Datenbank und nutzt sie als Kontext für die Antwort. RAG erlaubt es, ein Modell mit eigenen Dokumenten zu nutzen, ohne es neu zu trainieren. Mehr dazu unter Lokales RAG.
Embedding
Ein Embedding ist eine numerische Darstellung von Text. Der Text wird in einen Vektor aus Zahlen umgewandelt, der seine Bedeutung erfasst. Embeddings werden für die RAG-Suche genutzt. Mehr dazu im Artikel Embedding-Modelle.
Vektordatenbank
Eine Vektordatenbank speichert Embeddings und ermöglicht die Suche nach ähnlichen Texten. Beispiele sind Chroma und Qdrant. Vektordatenbanken sind ein zentraler Bestandteil von RAG-Systemen. Mehr dazu unter Vektordatenbanken.
Chunking
Chunking ist das Aufteilen von Dokumenten in kleinere Stücke, bevor sie in eine Vektordatenbank geladen werden. Jeder Chunk wird zu einem Embedding. Gutes Chunking ist wichtig für gute RAG-Ergebnisse. Mehr dazu im Artikel Chunking.
Self-Hosting
Self-Hosting bedeutet, Software auf eigener Hardware zu betreiben, statt sie als Cloud-Dienst zu nutzen. Lokale KI ist eine Form von Self-Hosting. Mehr dazu im Artikel Was ist lokale KI?.
Cloud KI
Cloud KI bedeutet, dass das Modell auf Servern eines Anbieters läuft. Du sendest Deine Eingabe per API oder Browser, die Antwort kommt zurück. Beispiele sind ChatGPT, Claude und Gemini. Mehr dazu im Artikel Lokale KI vs. Cloud KI.
API
API steht für Application Programming Interface. Eine API ist eine Schnittstelle, über die Programme miteinander kommunizieren. Ollama bietet beispielsweise eine API unter http://localhost:11434 an, über die andere Programme das Modell ansprechen können.
Hybrid
Ein hybrides Setup kombiniert lokale KI und Cloud KI. Einfache oder unsensible Aufgaben laufen in der Cloud, sensible oder häufige Aufgaben lokal. Mehr dazu im Artikel Lokale KI vs. Cloud KI.
DSGVO
Die DSGVO (Datenschutz-Grundverordnung) regelt den Umgang mit personenbezogenen Daten in der EU. Lokale KI hilft bei der Einhaltung, weil Daten das eigene Netzwerk nicht verlassen. Mehr dazu im Artikel Lokale KI vs. Cloud KI.
Modelfile
Ein Modelfile ist eine Konfigurationsdatei für Ollama. Sie definiert, welches Modell geladen wird, welche System-Prompt verwendet wird und welche Parameter gelten. Ähnlich wie ein Dockerfile, aber für KI-Modelle.
Parameter
Parameter sind die Gewichte eines Modells. Sie werden beim Training gelernt und bestimmen, wie das Modell Eingaben verarbeitet. Modelle werden oft nach ihrer Parameteranzahl benannt, zum Beispiel 7B für 7 Milliarden Parameter.
Begriffe der KI-Agenten
Agent
Ein Agent ist ein KI-System, das ein Ziel verfolgt und eigenständig Aktionen ausführt. Er beobachtet seine Umgebung, plant Schritte und nutzt Werkzeuge, um das Ziel zu erreichen. Mehr dazu im Artikel Was ist ein KI-Agent?.
KI-Agent
Synonym für Agent. Ein KI-Agent nutzt ein Sprachmodell als Gehirn und Tools als Hände, um Aufgaben zu erledigen.
Chatbot
Ein Chatbot ist ein Dialogsystem, das auf Eingaben mit Text antwortet. Er reagiert, plant aber nicht eigenständig und nutzt keine Tools. Mehr dazu im Artikel Chatbot vs. KI-Agent.
Tool
Ein Tool ist eine externe Funktion, die ein Agent aufrufen kann. Beispiele sind Websuche, Dateizugriff, Datenbankabfragen oder E-Mail-Versand. Tools machen einen Agenten erst nützlich.
Tool-Calling
Tool-Calling ist die Fähigkeit eines Sprachmodells, externe Funktionen aufzurufen. Das Modell erzeugt nicht nur Text, sondern eine strukturierte Nachricht mit Funktionsname und Parametern. Dein Programm führt die Funktion aus und gibt das Ergebnis zurück. Mehr dazu im Artikel Tool-Calling.
Function Calling
Synonym für Tool-Calling. Beide Begriffe bezeichnen dieselbe Fähigkeit.
Schema
Ein Schema beschreibt ein Tool für das Modell. Es enthält den Namen, eine Beschreibung und die Parameter mit Typen. Das Modell nutzt das Schema, um zu entscheiden, ob und wie es das Tool aufruft.
Gedächtnis
Gedächtnis (Memory) ist der Speicher eines Agenten. Kurzzeitgedächtnis hält aktuelle Schritte und Zwischenergebnisse. Langzeitgedächtnis speichert Wissen über mehrere Sessions hinweg.
Memory
Englischer Begriff für Gedächtnis. Siehe oben.
Planung
Planung ist die Aufteilung eines Ziels in einzelne Schritte. Der Agent plant, welche Aktion er als Nächstes ausführt, und passt den Plan an Zwischenergebnisse an.
Autonomie
Autonomie beschreibt, wie selbstständig ein Agent Entscheidungen trifft. Mehr Autonomie bedeutet mehr Möglichkeiten, aber auch mehr Risiko. Autonome Agenten sollten in Sandbox-Umgebungen laufen.
Multi-Agenten
Multi-Agenten bedeutet, dass mehrere Agenten mit unterschiedlichen Rollen zusammenarbeiten. Ein Agent schreibt Code, ein anderer prüft ihn, ein dritter dokumentiert. Beispiele sind CrewAI und AutoGen. Mehr dazu in der Frameworks-Übersicht.
Workflow
Ein Workflow ist eine Abfolge von Schritten, die ein Agent abarbeitet. Workflows können linear oder verzweigt sein. Ein Recherche-Workflow könnte so aussehen: suchen, lesen, zusammenfassen, speichern.
MCP
MCP steht für Model Context Protocol. Es ist ein Standard für Werkzeuge und Kontext, den Agenten nutzen können. MCP macht es einfacher, Werkzeuge zwischen verschiedenen Frameworks zu teilen.
Reasoning
Reasoning ist die Fähigkeit eines Modells, logisch zu denken und Schlussfolgerungen zu ziehen. Modelle mit gutem Reasoning sind für Agenten besser geeignet, weil sie Schritte besser planen.
ReAct
ReAct ist eine Agenten-Architektur, die Reasoning und Acting kombiniert. Der Agent denkt zuerst (Reason), dann handelt er (Act), dann beobachtet er das Ergebnis (Observe) und beginnt von vorn. Mehr dazu im Artikel Was ist ein KI-Agent?.
Plan-and-Execute
Plan-and-Execute ist eine Agenten-Architektur, bei der der Agent zuerst einen kompletten Plan erstellt und dann Schritt für Schritt ausführt. Im Gegensatz zu ReAct wird der Plan vorab erstellt, nicht Schritt für Schritt.
Sandbox
Eine Sandbox ist eine isolierte Umgebung, in der ein Agent läuft. Sie verhindert, dass der Agent unerwartete Aktionen auf dem echten System ausführt. Sandboxing ist wichtig für Sicherheit bei autonomen Agenten.
Menschliche Freigabe
Menschliche Freigabe (Human-in-the-Loop) bedeutet, dass kritische Aktionen eines Agenten vor der Ausführung von einem Menschen bestätigt werden müssen. Das erhöht die Sicherheit bei autonomen Workflows.
Framework
Ein Framework ist eine Software-Bibliothek, die Dir hilft, Agenten zu bauen. Frameworks übernehmen die Schleife aus Beobachten, Planen und Ausführen. Beispiele sind LangGraph, CrewAI und AutoGen. Mehr dazu in der Frameworks-Übersicht.
Begriffe der KI-Hardware
RAM
RAM (Random Access Memory) ist der Arbeitsspeicher Deines Rechners. Er steht der CPU und allen Programmen zur Verfügung. Bei CPU-Inferenz liegt das Modell im RAM. Mehr dazu im Artikel RAM vs. VRAM.
VRAM
VRAM (Video RAM) ist der Speicher auf einer dedizierten Grafikkarte. Er steht der GPU exklusiv zur Verfügung und ist für KI-Berechnungen deutlich schneller als RAM. Bei GPU-Inferenz liegt das Modell im VRAM. Mehr dazu im Artikel RAM vs. VRAM.
GPU
GPU steht für Graphics Processing Unit, also den Prozessor auf der Grafikkarte. GPUs haben viele parallele Rechenkerne und sind für KI-Inferenz deutlich schneller als CPUs. Mehr dazu im Artikel RAM vs. VRAM.
CPU
CPU steht für Central Processing Unit, also den Hauptprozessor des Rechners. CPUs haben wenige, aber flexible Kerne. KI-Inferenz auf der CPU ist möglich, aber langsamer als auf der GPU.
GPU-Offloading
GPU-Offloading bedeutet, dass Teile eines Modells auf die GPU ausgelagert werden, wenn es nicht vollständig in den VRAM passt. Der Rest bleibt im RAM. Das ist langsamer als volle GPU-Inferenz, aber schneller als reine CPU-Inferenz. Mehr dazu im Artikel RAM vs. VRAM.
Speicherbandbreite
Speicherbandbreite ist die Geschwindigkeit, mit der Daten zwischen Speicher und Prozessor übertragen werden. Hohe Bandbreite ist für KI wichtig, weil viele Daten bewegt werden müssen. VRAM hat meist höhere Bandbreite als RAM.
Unified Memory
Unified Memory bedeutet, dass CPU und GPU sich denselben Arbeitsspeicher teilen. Ein Mac mit 32 GB RAM kann diese 32 GB auch für die GPU nutzen. Bei einer klassischen Grafikkarte ist der VRAM separat. Mehr dazu im Artikel RAM vs. VRAM.
Shared Memory
Synonym für Unified Memory. Beide Begriffe bezeichnen gemeinsamen Speicher für CPU und GPU.
APU
APU steht für Accelerated Processing Unit. Eine APU vereint CPU und GPU auf einem Chip. Beispiele sind Apple Silicon und AMD Ryzen AI Max. Der Vorteil ist, dass beide Prozessoren auf denselben Speicher zugreifen können. Mehr dazu in den KI-Hardware Grundlagen.
Apple Silicon
Apple Silicon ist die Bezeichnung für Apples eigene Chips, wie M1, M2, M3, M4. Sie vereinen CPU und GPU auf einem Chip und nutzen Unified Memory. Apple Silicon ist für lokale KI sehr beliebt, weil es viel Speicher effizient nutzt. Mehr dazu im Artikel RAM vs. VRAM.
TOPS
TOPS steht für Tera Operations Per Second. Es ist die Maßeinheit für KI-Rechenleistung. Ein höherer TOPS-Wert bedeutet, dass ein Chip potenziell mehr KI-Operationen pro Sekunde ausführen kann. TOPS sagen aber nicht alles, weil Speicherbandbreite und Architektur genauso wichtig sind. Mehr dazu in den KI-Hardware Grundlagen.
NTOPS
NTOPS steht für NPU TOPS, also die KI-Rechenleistung der NPU (Neural Processing Unit). NPUs sind spezialisierte KI-Beschleuniger in modernen Chips. NTOPS messen nur die NPU-Leistung, nicht die der GPU.
SSD
SSD steht für Solid State Drive, also einen Flash-Speicher. Eine SSD lädt Modelle deutlich schneller als eine klassische Festplatte (HDD). NVMe-SSDs sind noch schneller als SATA-SSDs.
NVMe
NVMe ist ein Schnittstellenstandard für SSDs. NVMe-SSDs sind deutlich schneller als SATA-SSDs und laden große Modelle in Sekunden statt Minuten. Für lokale KI ist eine NVMe-SSD empfohlen.
Speicherbedarf
Speicherbedarf ist der RAM oder VRAM, den ein Modell während der Inferenz benötigt. Er ergibt sich aus Modellgröße, Quantisierung und KV-Cache. Mehr dazu im Artikel RAM und VRAM Anforderungen.
Weiterführende Links und Infos zum Glossar
- Lokale KI Grundlagen
- KI-Agenten Grundlagen
- KI-Hardware Grundlagen
- Was ist lokale KI?
- Was ist ein KI-Agent?
- RAM vs. VRAM
FAQ - Häufige Fragen zum Glossar
Was ist der Unterschied zwischen Training und Inferenz?
Training ist das Erstellen eines Modells mit großen Datenmengen. Inferenz ist das Nutzen des fertigen Modells, um Antworten zu berechnen. Lokale KI nutzt Inferenz.
Was ist der Unterschied zwischen RAM und VRAM?
RAM ist der Arbeitsspeicher des Rechners, VRAM ist der Speicher der Grafikkarte. Bei CPU-Inferenz liegt das Modell im RAM, bei GPU-Inferenz im VRAM. GPU-Inferenz ist deutlich schneller. Mehr dazu im Artikel RAM vs. VRAM.
Was ist der Unterschied zwischen Tool-Calling und Function Calling?
Nichts. Beide Begriffe bezeichnen dieselbe Fähigkeit: ein Sprachmodell, das externe Funktionen aufrufen kann. Mehr dazu im Artikel Tool-Calling.
Was ist der Unterschied zwischen Kontextlänge und Kontextfenster?
Nichts. Beide Begriffe bezeichnen die maximale Anzahl an Token, die ein Modell auf einmal verarbeiten kann. Mehr dazu im Artikel Kontextlänge.
Was ist der Unterschied zwischen Quantisierung und Komprimierung?
Quantisierung ist eine spezielle Form der Komprimierung. Sie reduziert die Genauigkeit der Modellgewichte von beispielsweise 16 Bit auf 4 Bit. Komprimierung ist der allgemeinere Begriff.
Was ist der Unterschied zwischen Agent und Chatbot?
Ein Chatbot reagiert auf Eingaben mit Text. Ein Agent plant mehrere Schritte, nutzt Tools und verfolgt ein Ziel. Mehr dazu im Artikel Chatbot vs. KI-Agent.
Was ist der Unterschied zwischen Unified Memory und Shared Memory?
Nichts. Beide Begriffe bezeichnen gemeinsamen Speicher für CPU und GPU, wie bei Apple Silicon oder Ryzen AI Max.
Was ist der Unterschied zwischen Q4_0 und Q4_K_M?
Q4_0 quantisiert alle Gewichte gleich. Q4_K_M verwendet eine Mischquantisierung, die empfindlichere Teile des Modells mit mehr Bits speichert. Q4_K_M liefert meist bessere Ergebnisse. Mehr dazu im Artikel Quantisierung.
Was bedeutet GGUF?
GGUF ist ein Dateiformat für quantisierte Sprachmodelle. Es wird von llama.cpp und Ollama verwendet. GGUF-Dateien enthalten das Modell in komprimierter Form.
Was ist der Unterschied zwischen RAG und Fine-Tuning?
RAG sucht passende Textstellen aus einer Datenbank und gibt sie dem Modell als Kontext. Fine-Tuning trainiert das Modell mit neuen Daten weiter. RAG ist einfacher und flexibler, Fine-Tuning ist aufwändiger aber tiefer integriert.
Was ist der Unterschied zwischen TOPS und TFLOPS?
TOPS misst ganzzahlige Operationen (INT), TFLOPS misst Gleitkomma-Operationen (FP). Für KI-Inferenz mit quantisierten Modellen ist TOPS relevanter. Für Training ist TFLOPS wichtiger.
Was ist der Unterschied zwischen MCP und Tool-Calling?
Tool-Calling ist die Fähigkeit des Modells, Funktionen aufzurufen. MCP ist ein Standard, der definiert, wie Werkzeuge und Kontext strukturiert bereitgestellt werden. MCP nutzt Tool-Calling als Mechanismus.


