Glossar: KI-Begriffe verständlich erklärt
Was dieser Artikel über KI-Begriffe behandelt
- Die wichtigsten KI-Begriffe verständlich erklärt.
- Von LLM über RAG bis Embedding und Agent.
- Wann jeder Begriff relevant ist und was er bedeutet.
- Verständliche Erklärungen ohne Fachjargon.
- Links zu detaillierten Artikeln für Vertiefung.
Einleitung: KI-Begriffe verständlich erklärt
Die KI-Welt ist voller Fachbegriffe: LLM, RAG, Embedding, Agent, Tool-Calling, Fine-Tuning, Prompt Injection. Dieses Glossar erklärt die wichtigsten Begriffe verständlich, für Einsteiger und Fortgeschrittene.
Dieser Artikel richtet sich an alle, die KI-Begriffe verstehen wollen. Grundlagen findest Du in Was ist lokale KI?.
Warum brauche ich ein Glossar?
Stell Dir vor, Du liest einen Artikel über „RAG mit Embeddings und Tool-Calling”. Was bedeutet das? Dieses Glossar erklärt: RAG = Dokumente durchsuchen + Antworten generieren. Embedding = Text zu Zahlen. Tool-Calling = Werkzeuge nutzen. Verständlich, ohne Fachjargon.
Die wichtigsten KI-Begriffe
A
Agent (KI-Agent) Ein KI-System, das autonom handelt: Es plant, nutzt Tools und führt Aktionen aus. Nicht nur „Frage beantworten”, sondern „Aufgabe lösen”. Siehe KI-Agenten.
API (Application Programming Interface) Schnittstelle für Programme. Für KI: Wie Du mit Modellen kommunizierst (Ollama-API, OpenAI-API).
B
Batch-Processing Viele Requests gleichzeitig verarbeiten. Für Performance: vLLM nutzt Batch-Processing für parallele Anfragen.
Benchmark Test zur Leistungsbewertung. Für Modelle: Wie gut ist es? MMLU, HumanEval, etc.
C
Chunking Text in kleine Teile aufteilen. Für RAG: Dokumente in Chunks teilen, damit sie in den Kontext passen. Siehe Chunking.
Cloud-KI KI-Dienste in der Cloud: OpenAI, Anthropic, Google. Daten gehen an Dritte. Gegenteil: Lokale KI.
Context Window Wie viel Text das Modell verarbeiten kann. 4K, 8K, 32K, 128K Token. Siehe Kontextlänge.
D
Datenschutz Schutz personenbezogener Daten. Für KI: Lokale Verarbeitung statt Cloud. Siehe Datenschutz.
Docker Container-Plattform. Für KI: Ollama, Qdrant, Agenten in Containern betreiben. Siehe Docker.
E
Embedding Text in Zahlen (Vektoren) umwandeln. Für semantische Suche: Ähnliche Texte haben ähnliche Vektoren. Siehe Embeddings.
Embedding-Modell Modell, das Embeddings erstellt: nomic-embed-text, multilingual-e5, bge-m3. Siehe Embedding-Modelle.
F
Fine-Tuning Modell auf spezifische Daten trainieren. Für spezialisierte Aufgaben: Medizin, Recht, eigene Dokumente.
Function-Calling Modell ruft Funktionen auf. Für Agenten: LLM entscheidet, welches Tool es nutzt. Siehe Function-Calling.
G
GGUF Dateiformat für quantisierte Modelle. Für Ollama, LM Studio: Modelle im GGUF-Format laden.
GPU (Graphics Processing Unit) Grafikkarte für LLM-Inference. Für KI: VRAM für Modellgröße. Siehe Hardware.
H
Halluzination Modell erfindet Fakten. Für RAG: Quellenangaben helfen gegen Halluzinationen. Siehe Halluzinationen.
Hardware Rechner für KI: GPU, VRAM, RAM, CPU. Siehe Hardware-Anforderungen.
I
Inference Modell generiert Antworten. Für KI: LLM-Inference auf GPU.
L
LLM (Large Language Model) Großes Sprachmodell: llama3.1, mistral, qwen. Für Textgenerierung, Chat, Analyse. Siehe Textmodelle.
Lokale KI KI auf eigenem Rechner: Ollama, LM Studio. Keine Daten an Dritte. Siehe Lokale KI.
M
MCP (Model Context Protocol) Protokoll für Tool-Integration. Für Agenten: Verbindung zu Dateisystem, Datenbanken, APIs. Siehe MCP.
Modell KI-Modell: LLM, Vision, Embedding. Für verschiedene Aufgaben: Text, Bild, Suche.
O
Ollama Lokaler Modellserver für LLMs. Für lokale KI: Modelle laden, API nutzen. Siehe Ollama.
OCR (Optical Character Recognition) Text aus Bildern extrahieren. Für Dokumente: Tesseract oder Vision-Modelle. Siehe OCR.
P
Prompt Anweisung für das Modell. Für KI: Was soll das Modell tun? Siehe Prompting.
Prompt Injection Angriff: Modell wird manipuliert, schädliche Aktionen auszuführen. Für Sicherheit: Input-Validierung, Berechtigungen. Siehe Prompt Injection.
Q
Quantisierung Modell komprimieren (weniger Speicher). Q4, Q8: Kleinere Modelle, weniger VRAM. Für lokale KI: Q4 ist Standard.
Query-Engine Suchmaschine für RAG. Für LlamaIndex: Findet relevante Dokumente, generiert Antworten.
R
RAG (Retrieval-Augmented Generation) Erst suchen, dann antworten: Dokumente durchsuchen (Retrieval), Antwort generieren (Generation). Für Q&A. Siehe Lokales RAG.
Reasoning-Modell Modell, das „denkt” vor Antworten: DeepSeek-R1, QwQ. Für komplexe Probleme: Mathe, Logik, Debugging. Siehe Reasoning-Modelle.
S
Sandboxing Isolation für kritische Tools. Für Sicherheit: Code in Container ausführen, keine System-Zugriffe. Siehe Sandboxing.
Semantische Suche Suche nach Bedeutung, nicht Keywords. Für RAG: Embeddings finden ähnliche Texte.
System-Prompt Anweisung für das Modell (Rolle, Verhalten). Für Agenten: „Du bist ein hilfreicher Assistent.”
T
Token Kleinste Einheit für LLMs. 1 Token ≈ 0.75 Wörter. Für Kosten: Cloud-APIs kosten pro Token.
Tool-Calling Modell ruft Werkzeuge auf. Für Agenten: LLM entscheidet, welches Tool es nutzt. Siehe Tool-Calling.
V
Vektordatenbank Datenbank für Embeddings: Qdrant, ChromaDB, Weaviate. Für RAG: Speicher für Embeddings. Siehe Vektordatenbanken.
Vision-Modell Modell, das Bilder versteht: LLaVA, MiniCPM-V. Für Bildanalyse, OCR, Diagramme. Siehe Vision-Modelle.
VRAM (Video RAM) GPU-Speicher für LLMs. Für KI: Wie viel VRAM braucht das Modell? Siehe VRAM-Rechner.
W
Workflow Automatisierter Prozess: Trigger → Verarbeitung → Aktion. Für n8n, Node-RED: Workflows bauen.
Weiterführende Links
- Was ist lokale KI? - Grundlagen.
- KI-Agenten - Agenten-Grundlagen.
- Lokales RAG - RAG-Grundlagen.
- Embeddings - Embedding-Grundlagen.
- Ollama - Modellserver.
FAQ
Was ist ein LLM?
Was ist RAG?
Was ist ein Embedding?
Was ist ein KI-Agent?
Was ist MCP?
Was ist VRAM?
Was ist Ollama?
Was ist Prompt Injection?
Quellen und weiterführende Literatur
- Ollama - Lokaler Modellserver.
- HuggingFace - Modelle und Ressourcen.
- Prompting Guide - Prompting-Techniken.


