Gemma Modelle: Googles leichtgewichtige KI
Was dieser Artikel behandelt
- Was Gemma ist und wie sich die Modellfamilie entwickelt hat
- Welche Gemma-Versionen es gibt und wofür sie sich eignen
- Wie viel VRAM Du für die verschiedenen Gemma-Modelle brauchst
- Wie Du Gemma mit Ollama lokal startest und nutzt
- Wo die Stärken und Schwächen der Modellfamilie liegen
Einleitung
Gemma ist Googles Beitrag zur Open-Source-KI-Welt. Der Name leitet sich von “gem” ab, was für die lateinischen Buchstaben G-E-M-M-A steht und an Gemini erinnert, Googles großes kommerzielles KI-Modell. Der wichtige Unterschied: Während Gemini ein Cloud-Dienst ist, sind Gemma-Modelle Open Source und können lokal auf Deinem Rechner laufen.
Gemma-Modelle zeichnen sich durch ihre kompakte Größe aus. Schon die kleinste Version mit 2 Milliarden Parametern liefert erstaunlich gute Ergebnisse für ihre Größe. Die größte Version mit 27 Milliarden Parametern konkurriert mit Modellen, die deutlich mehr Parameter haben. Das macht Gemma besonders attraktiv für Nutzer mit begrenzter Hardware, die trotzdem Qualität wollen.
In diesem Artikel lernst Du, welche Gemma-Versionen es gibt, wie sie sich unterscheiden und wie Du sie lokal mit Ollama betreibst. Wenn Du noch unsicher bist, welches Modell überhaupt zu Dir passt, schau zuerst in die Modell-Übersicht und den Artikel Modell finden.
Warum brauche ich Gemma?
Stell Dir vor, Du hast einen Laptop mit 16 GB RAM und möchtest trotzdem ein ordentliches KI-Modell lokal betreiben. Viele der bekannten Modelle wie Llama 3 70B oder DeepSeek-R1 sind für solche Hardware zu groß. Hier kommt Gemma ins Spiel: Die 2B-Version läuft auf fast jedem modernen Rechner und die 9B-Version braucht nur etwa 6 GB VRAM in Q4_K_M.
Gemma ist besonders interessant, wenn Dir drei Dinge wichtig sind: kompakte Größe, gute Qualität pro Parameter und eine solide Basis für Experimente. Google hat die Modelle mit derselben Forschung und denselben Techniken trainiert, die auch in Gemini stecken. Das bedeutet, Du bekommst Google-Qualität in einem Paket, das auf Consumer-Hardware läuft.
Wenn Du bereits Llama-Modelle oder Phi-Modelle kennst, ergänzt Gemma Deine Auswahl um eine weitere kompakte Option. Besonders die 9B-Version ist ein starker Konkurrent zu Llama 3 8B, und die 27B-Version liefert Qualität auf einem Niveau, das sonst nur 30B- oder 70B-Modelle erreichen.
Gemma Modelle kurz erklärt
Die Gemma-Modellfamilie hat sich über mehrere Generationen entwickelt. Hier ist ein Überblick über die wichtigsten Versionen:
Gemma 1 war die erste Generation, mit Versionen in 2B und 7B. Sie wurde im Februar 2024 veröffentlicht und zeigte, dass Google kompakte Open-Source-Modelle bauen kann. Für heutige Anwendungen ist Gemma 1 weniger relevant, da die Nachfolger deutlich besser sind.
Gemma 2 ist die zweite Generation, veröffentlicht im Juni 2024. Sie kommt in drei Größen: 2B, 9B und 27B. Gemma 2 nutzt eine verbesserte Architektur mit Grouped-Query Attention und lokalem Sliding-Window-Attention, was die Qualität bei gleicher Parameterzahl deutlich erhöht. Die 9B-Version erreicht Benchmark-Ergebnisse, die mit Llama 3 8B konkurrieren. Die 27B-Version schlägt Modelle, die doppelt so groß sind.
Gemma 3 ist die neueste Generation. Sie erweitert die Familie um multimodale Fähigkeiten, kann also auch Bilder verarbeiten, und bietet ein größeres Kontextfenster. Gemma 3 ist in mehreren Größen erhältlich und richtet sich an Nutzer, die ein kompaktes Allround-Modell mit Bildverständnis suchen.
Für den lokalen Betrieb sind Gemma 2 und Gemma 3 die relevantesten Versionen. Gemma 1 wird kaum noch genutzt, da die Nachfolger in jeder Hinsicht überlegen sind.
Für wen ist dieser Artikel gedacht?
Dieser Artikel richtet sich an Dich, wenn Du:
- ein kompaktes Modell für begrenzte Hardware suchst
- Google-Technologie ausprobieren willst, ohne Cloud-Abhängigkeit
- ein leichtgewichtiges Modell für einen Laptop oder Mac betreiben willst
- wissen möchtest, ob Gemma eine Alternative zu Llama oder Phi für Dich ist
- ein Modell suchst, das auch auf 8 GB VRAM gut funktioniert
Du brauchst keine Vorkenntnisse über Googles KI-Forschung. Wenn Du weißt, was ein LLM ist und wie man Ollama bedient, kannst Du direkt loslegen.
Wichtige Begriffe
| Begriff | Bedeutung |
|---|---|
| Gemma | Googles Open-Source-Modellfamilie, abgeleitet von Gemini-Forschung |
| Gemini | Googles kommerzielle KI-Modellreihe, nur als Cloud-Dienst |
| Grouped-Query Attention | Effiziente Attention-Methode, die Speicher und Rechenleistung spart |
| Sliding-Window Attention | Attention-Verfahren, das nur ein Fenster der letzten Tokens betrachtet |
| Multimodal | Fähigkeit eines Modells, mehrere Eingabetypen wie Text und Bilder zu verarbeiten |
| Kontextfenster | Maximale Anzahl an Tokens, die das Modell gleichzeitig verarbeiten kann |
| Parameter | Lermbare Werte im Modell, bestimmen Größe und Fähigkeiten |
| Quantisierung | Reduktion der Speichergenauigkeit, um den Speicherbedarf zu senken |
| Tokenizer | Komponente, die Text in Tokens zerlegt, die das Modell verarbeitet |
| Instruction-Tuned | Modell, das auf das Befolgen von Anweisungen trainiert wurde |
Gemma 2: Die zweite Generation
Gemma 2 ist die Version, die die meisten lokalen Nutzer aktuell nutzen. Die drei Größen decken unterschiedliche Hardware-Anforderungen ab:
Gemma 2 2B ist die kleinste Version und läuft auf fast jeder Hardware. Mit nur 2 Milliarden Parametern braucht sie in Q4_K_M etwa 1,5 GB Speicher. Das reicht für einfache Chat-Aufgaben, Zusammenfassungen und grundlegende Textverarbeitung. Auf einem Laptop mit 8 GB RAM läuft sie problemlos. Die Qualität ist für die Größe gut, aber sie stößt bei komplexen Aufgaben schnell an Grenzen.
Gemma 2 9B ist der Sweet Spot der Familie. Mit 9 Milliarden Parametern liefert sie Qualität auf dem Niveau von Llama 3 8B, teilweise darüber. In Q4_K_M braucht sie etwa 6 GB VRAM, was auf den meisten modernen Grafikkarten mit 8 GB oder mehr problemlos läuft. Die 9B-Version ist die beste Wahl für Nutzer, die ein starkes Allround-Modell suchen, das nicht zu viel Speicher braucht.
Gemma 2 27B ist das Flaggschiff der Familie. Mit 27 Milliarden Parametern erreicht sie Benchmark-Ergebnisse, die mit Modellen konkurrieren, die 50 bis 70 Milliarden Parameter haben. In Q4_K_M braucht sie etwa 16 GB VRAM. Das passt auf eine RTX 4080 mit 16 GB oder einen Mac mit 24 GB Unified Memory. Die 27B-Version ist ideal für Nutzer, die maximale Qualität wollen und die entsprechende Hardware haben.
| Modell | Parameter | VRAM (Q4_K_M) | VRAM (Q5_K_M) | VRAM (Q8_0) | Eignung |
|---|---|---|---|---|---|
| Gemma 2 2B | 2B | ca. 1,5 GB | ca. 2 GB | ca. 2,5 GB | Laptops, minimale Hardware |
| Gemma 2 9B | 9B | ca. 6 GB | ca. 7 GB | ca. 10 GB | Allrounder für 8 GB+ GPUs |
| Gemma 2 27B | 27B | ca. 16 GB | ca. 19 GB | ca. 28 GB | High-End, maximale Qualität |
Mehr zu den Speicheranforderungen findest Du im Artikel RAM und VRAM Anforderungen und im Artikel Modellgroesse und Speicherbedarf.
Gemma 3: Multimodal und flexibel
Gemma 3 erweitert die Familie um mehrere wichtige Funktionen. Die wichtigste Neuerung ist die multimodale Fähigkeit: Gemma 3 kann Bilder verarbeiten und beschreiben, nicht nur Text. Das macht es interessant für Anwendungen wie Bildbeschreibung, visuelle Frage-Antwort-Systeme oder die Analyse von Diagrammen.
Zusätzlich bietet Gemma 3 ein deutlich größeres Kontextfenster als Gemma 2. Während Gemma 2 auf 8.192 Tokens begrenzt ist, kann Gemma 3 deutlich mehr Kontext verarbeiten. Das ist wichtig, wenn Du lange Dokumente analysieren oder ausgedehnte Konversationen führen willst. Mehr zum Thema Kontext findest Du im Artikel Kontextlaenge.
Gemma 3 ist in mehreren Größen erhältlich, die von sehr klein bis mittel reichen. Die Architektur wurde weiter optimiert, um bei gleicher Parameterzahl bessere Ergebnisse zu liefern. Für die meisten lokalen Nutzer ist Gemma 3 die erste Wahl, wenn sie ein kompaktes Modell mit Bildverständnis suchen.
Architektur: Was Gemma besonders macht
Gemma 2 und 3 nutzen mehrere Architekturmerkmale, die sie von anderen Modellen unterscheiden:
Grouped-Query Attention (GQA): Diese Technik reduziert den Speicherbedarf des KV-Cache, ohne die Qualität zu beeinträchtigen. Statt für jeden Attention-Kopf separate Werte zu speichern, teilen sich mehrere Köpfe dieselben Werte. Das macht Gemma besonders effizient bei längeren Kontexten.
Local Sliding-Window Attention: Gemma 2 nutzt eine Kombination aus globaler und lokaler Attention. Die lokale Attention betrachtet nur ein Fenster der letzten Tokens, was Rechenleistung spart. Globale Attention wird periodisch eingestreut, um den Überblick über den gesamten Kontext zu behalten.
Knowledge Distillation: Bei Gemma 2 wurde Knowledge Distillation aus größeren Modellen eingesetzt. Das bedeutet, dass die kleineren Gemma-Modelle von den Antworten größerer Modelle gelernt haben. Das erklärt, warum Gemma 2 9B und 27B so stark für ihre Größe sind.
Diese Techniken zusammen erklären, warum Gemma-Modelle bei Benchmarks oft über ihren Gewicht schlagen. Google hat hier die Forschung aus Gemini in kompakte Open-Source-Modelle übersetzt.
Gemma lokal mit Ollama starten
Der einfachste Weg, Gemma lokal zu betreiben, geht über Ollama. Hier sind die wichtigsten Befehle:
# Gemma 2 2B starten
ollama run gemma2:2b
# Gemma 2 9B starten
ollama run gemma2:9b
# Gemma 2 27B starten
ollama run gemma2:27b
# Gemma 3 4B starten
ollama run gemma3:4b
# Gemma 3 12B starten
ollama run gemma3:12b
# Gemma 3 27B starten
ollama run gemma3:27b
Ollama lädt automatisch die Q4_K_M-Variante herunter. Wenn Du eine andere Quantisierung möchtest, kannst Du diese angeben, zum Beispiel ollama run gemma2:9b-q5_K_M. Mehr zu Quantisierung findest Du im Artikel Quantisierung.
Gemma im Vergleich zu anderen Modellen
Wie schlägt sich Gemma gegen die Konkurrenz? Hier eine grobe Orientierung:
- Gemma 2 9B vs. Llama 3 8B: Beide sind etwa gleich stark. Gemma 2 9B ist bei einigen Benchmarks minimal besser, Llama 3 8B bei anderen. Beide brauchen ähnlich viel VRAM.
- Gemma 2 9B vs. Phi-3: Phi-3 ist kleiner und ressourcenschonender, aber Gemma 2 9B liefert bei den meisten Aufgaben bessere Qualität.
- Gemma 2 27B vs. Llama 3 70B: Llama 3 70B ist insgesamt stärker, braucht aber deutlich mehr VRAM. Gemma 2 27B ist die bessere Wahl, wenn Du nicht 40 GB VRAM hast.
- Gemma 3 vs. Gemma 2: Gemma 3 ist der Nachfolger und in den meisten Fällen die bessere Wahl, besonders wenn Du Bildverständnis oder längere Kontexte brauchst.
Die Wahl hängt letztlich von Deiner Hardware und Deinem Anwendungsfall ab. Wenn Du 8 GB VRAM hast, sind Gemma 2 9B und Gemma 3 4B oder 12B gute Optionen. Wenn Du 16 GB oder mehr hast, probiere Gemma 2 27B oder Gemma 3 27B.
Typische Stolpersteine
1. Gemma mit Gemini verwechselt: Gemini ist Googles Cloud-Modell und nicht lokal verfügbar. Gemma ist die Open-Source-Version, die Du lokal betreiben kannst. Sie sind verwandt, aber nicht identisch.
2. Alte Gemma-1-Versionen genutzt: Gemma 1 ist deutlich schwächer als Gemma 2 und 3. Wenn Du Gemma nutzt, stelle sicher, dass Du die aktuelle Version hast. In Ollama heißt Gemma 2 gemma2, nicht gemma.
3. Kontextfenster bei Gemma 2 unterschätzt: Gemma 2 hat ein Kontextfenster von 8.192 Tokens, was kleiner ist als bei vielen Konkurrenten. Bei langen Dokumenten kann das einschränkend sein. Gemma 3 bietet hier ein größeres Fenster.
4. 27B-Version auf zu kleiner Hardware gestartet: Gemma 2 27B braucht in Q4_K_M etwa 16 GB VRAM. Auf einer 12-GB-Grafikkarte läuft sie nur mit Auslagerung in den System-RAM und wird damit langsam. Wähle stattdessen die 9B-Version.
5. Deutsche Antworten schwächer als englische: Gemma-Modelle wurden primär auf Englisch trainiert. Deutsch funktioniert, ist aber nicht so stark wie bei Modellen wie Qwen oder Llama 3, die mehrsprachig optimiert wurden.
6. Multimodale Funktionen bei Gemma 2 erwartet: Nur Gemma 3 kann Bilder verarbeiten. Gemma 2 ist ein reines Textmodell. Wenn Du Bildverständnis brauchst, wähle Gemma 3.
7. Quantisierung zu aggressiv gewählt: Bei der 2B-Version kann Q3 oder Q2 zu deutlichen Qualitätseinbußen führen, weil das Modell ohnehin schon klein ist. Nutze mindestens Q4_K_M, besser Q5_K_M bei kleinen Modellen.
Hardware, Kosten und Sicherheit
Hardware: Gemma-Modelle sind besonders hardware-freundlich. Die 2B-Version läuft auf fast jedem Rechner mit 4 GB RAM oder mehr. Die 9B-Version braucht eine Grafikkarte mit 8 GB VRAM oder einen Mac mit 16 GB Unified Memory. Die 27B-Version empfiehlt eine Grafikkarte mit 16 GB VRAM oder einen Mac mit 24 GB oder mehr. Eine RTX 3060 mit 12 GB ist für die 9B-Version ideal.
Kosten: Alle Gemma-Modelle sind Open Source und kostenlos. Die Modellgewichte stehen auf Hugging Face und in der Ollama-Bibliothek zur Verfügung. Die Gemma-Lizenz erlaubt kommerzielle Nutzung, hat aber einige Bedingungen, die Du prüfen solltest. Für die meisten Anwendungen ist die Nutzung unproblematisch.
Sicherheit: Wie bei allen lokalen Modellen bleiben Deine Daten auf Deinem Rechner. Das ist ein Vorteil gegenüber Googles Gemini Cloud-Dienst, bei dem Daten an Google gesendet werden. Mit Gemma lokal hast Du die Google-Qualität ohne Cloud-Abhängigkeit. Prüfe dennoch, ob Deine Software (Ollama, LM Studio) Telemetrie-Funktionen hat.
Weiterführende Links
- Modell-Übersicht - Alle Modell-Artikel im Überblick
- Modell finden - Wie Du das passende Modell findest
- Llama-Modelle - Metas Modellfamilie im Vergleich
- Phi-Modelle - Microsofts kompakte Modelle
- Ollama - Die einfachste Methode für lokale Modelle
- Quantisierung - Wie Modelle kleiner werden
- RAM und VRAM Anforderungen - Wie viel Speicher Du brauchst
- Modellgroesse und Speicherbedarf - Zusammenhang von Größe und Speicher
FAQ
Was ist der Unterschied zwischen Gemma und Gemini?
Gemini ist Googles kommerzielles Cloud-KI-Modell, das nur über API oder Webinterface nutzbar ist. Gemma ist die Open-Source-Modellfamilie, die Du lokal auf Deinem Rechner betreiben kannst. Beide basieren auf ähnlicher Forschung, sind aber unterschiedliche Modelle.
Sind Gemma-Modelle kostenlos?
Ja, alle Gemma-Modelle sind kostenlos nutzbar. Die Modellgewichte stehen auf Hugging Face und in der Ollama-Bibliothek zur Verfügung. Die Gemma-Lizenz erlaubt auch kommerzielle Nutzung unter bestimmten Bedingungen.
Welche Gemma-Version soll ich wählen?
Mit 8 GB VRAM nimm Gemma 2 9B oder Gemma 3 12B. Mit 16 GB VRAM oder mehr nimm Gemma 2 27B oder Gemma 3 27B. Wenn Du nur 4 GB VRAM hast, nimm Gemma 2 2B oder Gemma 3 4B. Für die meisten Nutzer ist Gemma 2 9B der beste Einstieg.
Kann Gemma Bilder verarbeiten?
Nur Gemma 3 ist multimodal und kann Bilder verarbeiten. Gemma 2 ist ein reines Textmodell. Wenn Du Bildverständnis brauchst, wähle Gemma 3.
Ist Gemma 2 9B besser als Llama 3 8B?
Beide Modelle sind etwa gleich stark. Bei einigen Benchmarks ist Gemma 2 9B minimal besser, bei anderen Llama 3 8B. Beide brauchen ähnlich viel VRAM. Probiere beide aus und vergleiche an Deinen eigenen Aufgaben.
Wie groß ist das Kontextfenster von Gemma?
Gemma 2 hat ein Kontextfenster von 8.192 Tokens. Gemma 3 bietet ein deutlich größeres Kontextfenster. Wenn Du lange Dokumente verarbeitest, ist Gemma 3 die bessere Wahl.
Kann ich Gemma auf einem Mac mit Apple Silicon nutzen?
Ja, Gemma läuft problemlos auf Apple Silicon. Ein Mac mit 16 GB Unified Memory schafft Gemma 2 9B problemlos. Ein Mac mit 24 GB oder mehr kann auch Gemma 2 27B oder Gemma 3 27B betreiben.
Brauche ich eine Nvidia-GPU für Gemma?
Nein. Gemma läuft auf CPU, Apple Silicon und AMD-GPUs. Ollama unterstützt alle diese Plattformen. Eine Nvidia-GPU ist am schnellsten, aber für die kleinen Versionen reicht auch ein normaler Laptop-Prozessor.
Kann ich Gemma kommerziell nutzen?
Ja, die Gemma-Lizenz erlaubt kommerzielle Nutzung. Du solltest dennoch die genauen Lizenzbedingungen prüfen, besonders wenn Du Gemma in ein Produkt integrierst. Für die meisten Anwendungsfälle ist die Nutzung unproblematisch.
Wo finde ich quantisierte Gemma-Modelle?
Ollama lädt automatisch eine Q4_K_M-Variante, wenn Du ein Gemma-Modell startest. Auf Hugging Face findest Du weitere Quantisierungen von Anbietern wie bartowski oder TheBloke. Suche nach “gemma2” plus “GGUF” auf Hugging Face.
Ist Gemma 3 immer besser als Gemma 2?
In den meisten Fällen ja, besonders wenn Du Bildverständnis oder längere Kontexte brauchst. Bei reinen Text-Aufgaben sind die Unterschiede kleiner. Wenn Du Gemma 2 bereits nutzt und zufrieden bist, ist ein Wechsel nicht zwingend nötig.
Quellen
- Google DeepMind: Gemma Modellveröffentlichungen und Technical Reports
- Hugging Face: Gemma Modellkarten und Gewichte
- Ollama Modellbibliothek: Gemma-Modelle
- Google AI Blog: Ankündigungen zu Gemma 2 und Gemma 3
- Gemma-Lizenz auf der offiziellen Gemma-Website


