Skip to content
BotServBotServ
GlossarKI-BegriffeLLMRAGEmbeddingAgent

Glossar: KI-Begriffe verständlich erklärt

Glossar der wichtigsten KI-Begriffe. LLM, RAG, Embedding, Agent, Tool-Calling und mehr, einfach erklärt.

S

schutzgeist

4 min read
Glossar: KI-Begriffe verständlich erklärt

Glossar: KI-Begriffe verständlich erklärt

Was dieser Artikel über KI-Begriffe behandelt

  • Die wichtigsten KI-Begriffe verständlich erklärt.
  • Von LLM über RAG bis Embedding und Agent.
  • Wann jeder Begriff relevant ist und was er bedeutet.
  • Verständliche Erklärungen ohne Fachjargon.
  • Links zu detaillierten Artikeln für Vertiefung.

Einleitung: KI-Begriffe verständlich erklärt

Die KI-Welt ist voller Fachbegriffe: LLM, RAG, Embedding, Agent, Tool-Calling, Fine-Tuning, Prompt Injection. Dieses Glossar erklärt die wichtigsten Begriffe verständlich, für Einsteiger und Fortgeschrittene.

Dieser Artikel richtet sich an alle, die KI-Begriffe verstehen wollen. Grundlagen findest Du in Was ist lokale KI?.

Warum brauche ich ein Glossar?

Stell Dir vor, Du liest einen Artikel über „RAG mit Embeddings und Tool-Calling”. Was bedeutet das? Dieses Glossar erklärt: RAG = Dokumente durchsuchen + Antworten generieren. Embedding = Text zu Zahlen. Tool-Calling = Werkzeuge nutzen. Verständlich, ohne Fachjargon.

Die wichtigsten KI-Begriffe

A

Agent (KI-Agent) Ein KI-System, das autonom handelt: Es plant, nutzt Tools und führt Aktionen aus. Nicht nur „Frage beantworten”, sondern „Aufgabe lösen”. Siehe KI-Agenten.

API (Application Programming Interface) Schnittstelle für Programme. Für KI: Wie Du mit Modellen kommunizierst (Ollama-API, OpenAI-API).

B

Batch-Processing Viele Requests gleichzeitig verarbeiten. Für Performance: vLLM nutzt Batch-Processing für parallele Anfragen.

Benchmark Test zur Leistungsbewertung. Für Modelle: Wie gut ist es? MMLU, HumanEval, etc.

C

Chunking Text in kleine Teile aufteilen. Für RAG: Dokumente in Chunks teilen, damit sie in den Kontext passen. Siehe Chunking.

Cloud-KI KI-Dienste in der Cloud: OpenAI, Anthropic, Google. Daten gehen an Dritte. Gegenteil: Lokale KI.

Context Window Wie viel Text das Modell verarbeiten kann. 4K, 8K, 32K, 128K Token. Siehe Kontextlänge.

D

Datenschutz Schutz personenbezogener Daten. Für KI: Lokale Verarbeitung statt Cloud. Siehe Datenschutz.

Docker Container-Plattform. Für KI: Ollama, Qdrant, Agenten in Containern betreiben. Siehe Docker.

E

Embedding Text in Zahlen (Vektoren) umwandeln. Für semantische Suche: Ähnliche Texte haben ähnliche Vektoren. Siehe Embeddings.

Embedding-Modell Modell, das Embeddings erstellt: nomic-embed-text, multilingual-e5, bge-m3. Siehe Embedding-Modelle.

F

Fine-Tuning Modell auf spezifische Daten trainieren. Für spezialisierte Aufgaben: Medizin, Recht, eigene Dokumente.

Function-Calling Modell ruft Funktionen auf. Für Agenten: LLM entscheidet, welches Tool es nutzt. Siehe Function-Calling.

G

GGUF Dateiformat für quantisierte Modelle. Für Ollama, LM Studio: Modelle im GGUF-Format laden.

GPU (Graphics Processing Unit) Grafikkarte für LLM-Inference. Für KI: VRAM für Modellgröße. Siehe Hardware.

H

Halluzination Modell erfindet Fakten. Für RAG: Quellenangaben helfen gegen Halluzinationen. Siehe Halluzinationen.

Hardware Rechner für KI: GPU, VRAM, RAM, CPU. Siehe Hardware-Anforderungen.

I

Inference Modell generiert Antworten. Für KI: LLM-Inference auf GPU.

L

LLM (Large Language Model) Großes Sprachmodell: llama3.1, mistral, qwen. Für Textgenerierung, Chat, Analyse. Siehe Textmodelle.

Lokale KI KI auf eigenem Rechner: Ollama, LM Studio. Keine Daten an Dritte. Siehe Lokale KI.

M

MCP (Model Context Protocol) Protokoll für Tool-Integration. Für Agenten: Verbindung zu Dateisystem, Datenbanken, APIs. Siehe MCP.

Modell KI-Modell: LLM, Vision, Embedding. Für verschiedene Aufgaben: Text, Bild, Suche.

O

Ollama Lokaler Modellserver für LLMs. Für lokale KI: Modelle laden, API nutzen. Siehe Ollama.

OCR (Optical Character Recognition) Text aus Bildern extrahieren. Für Dokumente: Tesseract oder Vision-Modelle. Siehe OCR.

P

Prompt Anweisung für das Modell. Für KI: Was soll das Modell tun? Siehe Prompting.

Prompt Injection Angriff: Modell wird manipuliert, schädliche Aktionen auszuführen. Für Sicherheit: Input-Validierung, Berechtigungen. Siehe Prompt Injection.

Q

Quantisierung Modell komprimieren (weniger Speicher). Q4, Q8: Kleinere Modelle, weniger VRAM. Für lokale KI: Q4 ist Standard.

Query-Engine Suchmaschine für RAG. Für LlamaIndex: Findet relevante Dokumente, generiert Antworten.

R

RAG (Retrieval-Augmented Generation) Erst suchen, dann antworten: Dokumente durchsuchen (Retrieval), Antwort generieren (Generation). Für Q&A. Siehe Lokales RAG.

Reasoning-Modell Modell, das „denkt” vor Antworten: DeepSeek-R1, QwQ. Für komplexe Probleme: Mathe, Logik, Debugging. Siehe Reasoning-Modelle.

S

Sandboxing Isolation für kritische Tools. Für Sicherheit: Code in Container ausführen, keine System-Zugriffe. Siehe Sandboxing.

Semantische Suche Suche nach Bedeutung, nicht Keywords. Für RAG: Embeddings finden ähnliche Texte.

System-Prompt Anweisung für das Modell (Rolle, Verhalten). Für Agenten: „Du bist ein hilfreicher Assistent.”

T

Token Kleinste Einheit für LLMs. 1 Token ≈ 0.75 Wörter. Für Kosten: Cloud-APIs kosten pro Token.

Tool-Calling Modell ruft Werkzeuge auf. Für Agenten: LLM entscheidet, welches Tool es nutzt. Siehe Tool-Calling.

V

Vektordatenbank Datenbank für Embeddings: Qdrant, ChromaDB, Weaviate. Für RAG: Speicher für Embeddings. Siehe Vektordatenbanken.

Vision-Modell Modell, das Bilder versteht: LLaVA, MiniCPM-V. Für Bildanalyse, OCR, Diagramme. Siehe Vision-Modelle.

VRAM (Video RAM) GPU-Speicher für LLMs. Für KI: Wie viel VRAM braucht das Modell? Siehe VRAM-Rechner.

W

Workflow Automatisierter Prozess: Trigger → Verarbeitung → Aktion. Für n8n, Node-RED: Workflows bauen.

FAQ

Was ist ein LLM?

Large Language Model: Ein großes Sprachmodell wie llama3.1, GPT-4 oder Claude. Es versteht und generiert Text für Chat, Analyse, Code, etc.

Was ist RAG?

Retrieval-Augmented Generation: Erst Dokumente durchsuchen (Retrieval), dann Antwort generieren (Generation). Für Q&A-Systeme und Wissensdatenbanken.

Was ist ein Embedding?

Text in Zahlen (Vektoren) umwandeln. Ähnliche Texte haben ähnliche Vektoren. Für semantische Suche und RAG.

Was ist ein KI-Agent?

Ein KI-System, das autonom handelt: Es plant, nutzt Tools und führt Aktionen aus. Nicht nur „Frage beantworten”, sondern „Aufgabe lösen”.

Was ist MCP?

Model Context Protocol: Ein Protokoll für Tool-Integration. Verbindet Agenten mit Dateisystem, Datenbanken, APIs und anderen Tools.

Was ist VRAM?

Video RAM: GPU-Speicher für LLMs. Je größer das Modell, desto mehr VRAM braucht es. 8B-Modell: ~5 GB. 70B: ~40 GB.

Was ist Ollama?

Ein lokaler Modellserver für LLMs: Modelle laden, API nutzen, alles lokal. Für Privacy und keine Cloud-Kosten.

Was ist Prompt Injection?

Ein Angriff, bei dem das Modell manipuliert wird, schädliche Aktionen auszuführen. Verhindert durch Input-Validierung, Berechtigungen und Sandboxing.

Quellen und weiterführende Literatur

Zurück zum KI Blog
Share:

Ähnliche Beiträge