Skip to content
BotServBotServ
KI PapersTransformerAttention is all you needRAG PaperLLM ForschungarXiv

Wichtige KI-Papers: Transformer, LLM, RAG und Agenten

Die wichtigsten KI-Papers verständlich eingeordnet. Transformer, LLaMA, RAG, Mixture of Experts und mehr, mit Erklärung und Einordnung für Praktiker.

S

schutzgeist

5 min read

Wichtige KI-Papers: Transformer, LLM, RAG und Agenten

Was dieser Artikel behandelt

  • Welche Papers das moderne KI-Ökosystem geprägt haben.
  • Worum es in jedem Paper geht, in einfachen Worten.
  • Welche Papers für Einsteiger geeignet sind und welche Fortgeschrittenen vorbehalten bleiben.
  • Wo Du die Papers kostenlos findest (fast alle auf arXiv).

Einleitung

Hinter jedem Tool wie Ollama, vLLM oder einem RAG-System steht ein Paper. Wer versteht, was die Grundidee war, versteht auch, warum heutige Tools so funktionieren wie sie funktionieren. Diese Übersicht sortiert die wichtigsten Arbeiten nach Thema und Schwierigkeit. Die Einordnung ist auf Praktiker zugeschnitten: Was bringt Dir das Paper, nicht was ist mathematisch elegant.

Grundlagen: Transformer und Aufmerksamkeit

Attention Is All You Need (Vaswani et al., 2017)

Das Papier, das alles änderte. Es führte die Transformer-Architektur ein: Statt Text Wort für Wort zu verarbeiten (wie RNNs), schaut das Modell auf alle Wörter gleichzeitig und gewichtet, welche zueinander wichtig sind. Diese “Attention” ist der Grund, warum moderne LLMs existieren.

  • Warum lesen: Alle heutigen LLMs (Llama, Qwen, GPT) bauen auf dieser Idee auf. Wer Quantisierung, Kontextfenster oder Attention-Optimierungen verstehen will, braucht diese Grundlage.
  • Schwierigkeit: Mittel. Konzept einfach, Formeln mittel.
  • Link: arXiv:1706.03762

BERT (Devlin et al., 2018)

Bidirectional Encoder Representations from Transformers. BERT las Text in beide Richtungen und revolutionierte Textverständnis-Aufgaben. Weniger relevant für Chatbots, wichtig für Embeddings und Klassifikation.

  • Warum lesen: Embeddings für RAG und semantische Suche stammen aus dieser Linie. Wer Vektordatenbanken nutzt, sollte wissen, woher Embeddings kommen.
  • Schwierigkeit: Mittel.
  • Link: arXiv:1810.04805

GPT-3: Language Models are Few-Shot Learners (Brown et al., 2020)

Das Paper, das zeigte: Wenn ein Modell groß genug ist, kann es Aufgaben lösen, ohne dafür trainiert worden zu sein. Few-Shot Learning nur durch Beispiele im Prompt. Der Startpunkt der Chatbot-Ära.

  • Warum lesen: Erklärt, warum Prompt Engineering funktioniert und warum Modellgröße zählt.
  • Schwierigkeit: Einfach bis mittel. Der Kernteil ist lesbar, Details zu Trainingssetup sind optional.
  • Link: arXiv:2005.14165

Open-Weight-Modelle

LLaMA: Open and Efficient Foundation Language Models (Touvron et al., 2023)

Meta veröffentlichte LLaMA als Open-Weight-Modell. Das Paper dokumentiert, wie man ein starkes Modell mit weniger Parametern durch mehr und bessere Daten trainiert. Danach kamen Llama 2, 3 und Derivate.

Mistral 7B (Jiang et al., 2023)

Ein 7B-Modell, das größere schlug. Das Paper zeigt Techniken wie Grouped-Query Attention und Sliding-Window Attention, die heute Standard sind.

  • Warum lesen: Wer verstehen will, warum ein “kleines” Modell gut sein kann, und was Sliding-Window bedeutet.
  • Schwierigkeit: Mittel.
  • Link: arXiv:2310.06825

Mixtral of Experts (Jiang et al., 2024)

Mixture of Experts: Das Modell hat viele “Experten”, aber pro Token werden nur einige aktiviert. Spart Rechenleistung bei gleicher Qualität. Heute Basis vieler großer Open-Modelle.

  • Warum lesen: Erklärt, warum Mixtral, Qwen-MoE und ähnliche Modelle existieren. Relevant für MoE-Modelle.
  • Schwierigkeit: Mittel bis fortgeschritten.
  • Link: arXiv:2401.04088

Retrieval-Augmented Generation (RAG)

RAG: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (Lewis et al., 2020)

Das Original-RAG-Paper. Ein Modell holt sich Wissen aus einem Dokumentenspeicher statt alles im Training zu lernen. Dadurch kann es aktuelle oder private Daten nutzen, ohne neu trainiert zu werden.

  • Warum lesen: Alle lokalen Wissensbots und RAG-Setups bauen auf dieser Idee auf.
  • Schwierigkeit: Mittel. Die Idee ist simpel, Details optional.
  • Link: arXiv:2005.11401

Dense Passage Retrieval (Karpukhin et al., 2020)

Zeigt, dass Embedding-basierte Suche Keyword-Suche schlägt, wenn man gute Embeddings hat. Grundlage für semantische Suche und Vektordatenbanken.

  • Warum lesen: Wer mit Chroma, Qdrant oder ähnlichen arbeitet, nutzt Techniken aus diesem Paper.
  • Schwierigkeit: Fortgeschritten.
  • Link: arXiv:2004.04906

Agenten und Tool-Nutzung

ReAct: Synergizing Reasoning and Acting (Yao et al., 2022)

Das Modell denkt (Reasoning) und handelt (Acting) abwechselnd. So entstehen Agenten, die erst überlegen, dann ein Tool aufrufen, dann weiterdenken. Basis für fast alle Agent-Frameworks.

Toolformer (Schick et al., 2023)

Ein Modell lernt selbst, wann es welches Tool aufrufen soll. Wegbereiter für Function Calling und MCP-artige Schnittstellen.

  • Warum lesen: Erklärt die Logik hinter Tool-Nutzung, relevant für MCP.
  • Schwierigkeit: Fortgeschritten.
  • Link: arXiv:2302.04761

Effizienz: Warum lokale KI überhaupt geht

GPTQ / AWQ / GGUF-Quantisierung

Es gibt nicht ein einzelnes Paper, sondern eine Reihe: GPTQ (2022) zeigte, dass man ein Modell auf 4 Bit quantisieren kann ohne großen Verlust. AWQ und weitere folgten. Diese Arbeiten machen lokale KI auf Consumer-Hardware erst möglich.

FlashAttention (Dao et al., 2022)

Ein Trick, der die Speichernutzung der Attention-Operation massiv senkt. Dadurch werden lange Kontexte und schnellere Inferenz möglich. Heute in fast jeder Inferenz-Engine eingebaut.

  • Warum lesen: Erklärt, warum Kontextlängen von 100k+ möglich sind und warum VRAM so wichtig ist.
  • Schwierigkeit: Fortgeschritten.
  • Link: arXiv:2205.14135

Wie finde ich mehr Papers?

  • arXiv.org - Der Hauptpreprint-Server. Suche nach “cs.CL” (Computation and Language) oder “cs.LG” (Machine Learning).
  • Papers with Code - paperswithcode.com verlinkt Papers mit dem dazugehörigen Code.
  • Semantic Scholar - semanticscholar.org findet verwandte Arbeiten.
  • Hugging Face Daily Papers - huggingface.co/papers kuratiert täglich neue relevante Arbeiten.

Tipps zum Lesen

  1. Abstract und Conclusion zuerst. Wenn das nicht reicht, Diagramme ansehen.
  2. Nicht jede Formel verstehen. Die Idee ist wichtiger als die Herleitung.
  3. Verwandte Arbeiten scannen. Oft sind verwandte Papers einfacher geschrieben.
  4. TL;DR-Seiten nutzen. Für viele Papers gibt es Community-Erklärungen (z.B. auf Hugging Face oder in Blogposts).
  • Literatur - Übersicht über Bücher, Papers und Blogs.
  • Blogs - Empfohlene Blogs und Newsletter.
  • Lokale KI - Praktische Umsetzung der Konzepte aus den Papers.
  • Glossar - Begriffe wie Attention, Embedding und MoE verständlich erklärt.

FAQ - Häufige Fragen

Muss ich diese Papers lesen, um lokale KI zu nutzen? Nein. Für den praktischen Einsatz reichen die Artikel auf BotServ. Papers sind für die, die verstehen wollen, warum Dinge funktionieren.

Welches Paper ist am einfachsten für den Einstieg? “Attention Is All You Need” und “ReAct” sind relativ lesbar. GPTQ und FlashAttention sind für Fortgeschrittene.

Warum sind Papers auf arXiv kostenlos? arXiv ist ein Preprint-Server: Autoren laden ihre Arbeiten vor dem offiziellen Peer-Review hoch. Das macht Wissenschaft zugänglich und beschleunigt den Austausch.

Wie aktuell ist diese Liste? Die Liste enthält Grundlagenpapiere, die nicht veralten. Für die neuesten Arbeiten siehe die Blog- und Newsletter-Empfehlungen auf der Blogs-Seite.

Zurück zum KI Blog
Share:

Ähnliche Beiträge