Quantisierungs-Vergleich: Q4, Q5, Q8 in der Praxis
Was dieser Artikel behandelt
- Wie sich die Quantisierungsstufen Q4_K_M, Q5_K_M, Q6_K und Q8_0 in der Praxis unterscheiden
- Welchen Einfluss Quantisierung auf Qualität, Geschwindigkeit und Speicherbedarf hat
- Eine praktische Vergleichstabelle mit demselben Modell in verschiedenen Stufen
- Wann welche Quantisierungsstufe die richtige Wahl ist
- Wie Du den Sweet Spot zwischen Qualität und Speicherbedarf findest
Einleitung
Quantisierung ist das wichtigste Werkzeug, um große KI-Modelle auf Consumer-Hardware laufen zu lassen. Aber welche Stufe sollst Du wählen? Q4_K_M ist die Standardempfehlung, aber ist Q5_K_M wirklich viel besser? Lohnt sich Q8_0, wenn Du den Speicherplatz hast? Und was ist mit Q6_K?
Diese Fragen stellen sich alle, die lokale KI betreiben. Die Theorie der Quantisierung ist im Artikel Quantisierung ausführlich erklärt. Dieser Artikel hier geht einen Schritt weiter: Er vergleicht die Stufen direkt in der Praxis und hilft Dir, die richtige Wahl für Deinen Anwendungsfall zu treffen.
Wir nehmen ein konkretes Modell, vergleichen es in verschiedenen Quantisierungsstufen und schauen auf Qualität, Geschwindigkeit und Speicherbedarf. Das Ergebnis ist ein praktischer Leitfaden, der Dir bei der nächsten Modellwahl Zeit und Nerven spart.
Warum brauche ich einen Quantisierungs-Vergleich?
Stell Dir vor, Du hast eine Grafikkarte mit 12 GB VRAM und möchtest Llama 3 8B betreiben. In Q4_K_M braucht das Modell etwa 5 GB, in Q5_K_M etwa 6 GB, in Q8_0 etwa 8 GB. Alle drei passen auf Deine Grafikkarte. Welche sollst Du nehmen?
Ohne Vergleich würdest Du wahrscheinlich Q4_K_M wählen, weil es die Standardempfehlung ist. Aber wenn Du 12 GB VRAM hast, verschwendest Du mit Q4_K_M Speicher, den Du für einen größeren Kontext oder ein größeres Modell nutzen könntest. Q5_K_M oder sogar Q6_K könnten die bessere Wahl sein.
Umgekehrt: Wenn Du nur 8 GB VRAM hast und Q8_0 wählen würdest, hättest Du kaum noch Platz für den Kontext. Das Modell würde starten, aber bei längeren Konversationen abstürzen. Hier wäre Q4_K_M die sichere Wahl.
Ein Quantisierungs-Vergleich hilft Dir also, die optimale Stufe für Deine Hardware und Deinen Anwendungsfall zu finden. Es geht nicht darum, die höchste oder niedrigste Stufe zu wählen, sondern die, die am besten zu Deinem Setup passt.
Quantisierungs-Stufen kurz erklärt
Bevor wir vergleichen, hier eine kurze Wiederholung der wichtigsten Stufen. Eine ausführliche Erklärung findest Du im Artikel Quantisierung.
Q4_K_M ist die Standardstufe für die meisten lokalen Nutzer. Sie nutzt 4 Bit pro Gewicht mit K-Quantisierung, bei der empfindliche Schichten mit mehr Bits gespeichert werden. Das “M” steht für “Medium”, einen Kompromiss aus Größe und Qualität. Q4_K_M reduziert den Speicherbedarf auf etwa ein Drittel bis ein Viertel des Originals.
Q5_K_M ist die nächste Stufe. Sie nutzt 5 Bit pro Gewicht und bietet spürbar bessere Qualität als Q4, braucht aber etwa 25 Prozent mehr Speicher. Für viele Nutzer ist Q5_K_M der Sweet Spot, wenn sie etwas mehr VRAM haben.
Q6_K nutzt 6 Bit pro Gewicht und ist qualitativ sehr nah am Original. Der Speicherbedarf ist etwa 50 Prozent höher als bei Q4_K_M. Q6_K ist eine gute Wahl, wenn Qualität oberste Priorität hat und der Speicherplatz ausreicht.
Q8_0 nutzt 8 Bit pro Gewicht und ist praktisch nicht vom Original (FP16) zu unterscheiden. Der Speicherbedarf ist etwa doppelt so hoch wie bei Q4_K_M. Q8_0 ist die Wahl für maximale Qualität, wenn Speicher kein Problem ist.
Für wen ist dieser Artikel gedacht?
Dieser Artikel richtet sich an Dich, wenn Du:
- bereits ein Modell lokal betreibst und wissen willst, ob eine andere Quantisierungsstufe besser wäre
- eine neue Grafikkarte hast und die optimale Stufe dafür finden willst
- verstehen willst, wie viel Qualität Du durch niedrigere Quantisierung verlierst
- vor der Entscheidung stehst, mehrere Modelle in verschiedenen Stufen zu vergleichen
- wissen willst, ob sich der Wechsel von Q4 auf Q5 oder Q6 lohnt
Du solltest grundlegend verstehen, was Quantisierung ist. Wenn nicht, lies zuerst den Artikel Quantisierung.
Wichtige Begriffe
| Begriff | Bedeutung |
|---|---|
| Q4_K_M | 4-Bit-K-Quantisierung, Medium-Variante, Standardwahl für die meisten Nutzer |
| Q5_K_M | 5-Bit-K-Quantisierung, Medium-Variante, höherer Qualität als Q4 |
| Q6_K | 6-Bit-K-Quantisierung, sehr nah am Original |
| Q8_0 | 8-Bit-Quantisierung, praktisch identisch mit dem Original |
| FP16 | 16-Bit-Gleitkomma, das Originalformat trainierter Modelle |
| GGUF | Dateiformat für quantisierte Modelle, genutzt von llama.cpp und Ollama |
| K-Quantisierung | Mischquantisierung, die empfindliche Schichten mit mehr Bits speichert |
| Bits per Weight | Anzahl der Speicherbits pro Parameterwert |
| Tokens per Second | Metrik für die Ausführungsgeschwindigkeit eines Modells |
| KV-Cache | Zwischenspeicher für Attention-Werte, wächst mit der Kontextlänge |
Praxisvergleich: Dasselbe Modell in verschiedenen Stufen
Um den Vergleich konkret zu machen, nehmen wir Llama 3 8B als Beispiel. Das Modell hat 8 Milliarden Parameter und ist eines der beliebtesten Modelle für den lokalen Betrieb. Die folgende Tabelle zeigt das Modell in verschiedenen Quantisierungsstufen:
| Stufe | Dateigröße | VRAM-Bedarf | Qualität | Geschwindigkeit | Eignung |
|---|---|---|---|---|---|
| FP16 | ca. 16 GB | ca. 18 GB | Original | Basis | Server, High-End-Workstations |
| Q8_0 | ca. 8 GB | ca. 10 GB | Praktisch identisch | Sehr schnell | 12+ GB VRAM, maximale Qualität |
| Q6_K | ca. 6,5 GB | ca. 8,5 GB | Ausgezeichnet | Sehr schnell | 12+ GB VRAM, Qualität hat Priorität |
| Q5_K_M | ca. 5,7 GB | ca. 7,5 GB | Sehr gut | Sehr schnell | 8+ GB VRAM, solider Kompromiss |
| Q4_K_M | ca. 4,7 GB | ca. 6,5 GB | Gut | Sehr schnell | 8 GB VRAM, Standardwahl |
| Q4_0 | ca. 4,4 GB | ca. 6 GB | Etwas schwächer | Sehr schnell | Wenn jeder GB zählt |
| Q3_K_M | ca. 3,5 GB | ca. 5 GB | Spürbar schwächer | Sehr schnell | Notlösung bei sehr wenig VRAM |
| Q2_K | ca. 2,7 GB | ca. 4 GB | Deutlich eingeschränkt | Sehr schnell | Nur für Experimente |
Die VRAM-Werte beinhalten einen Puffer von etwa 2 GB für den KV-Cache und Overhead. Die tatsächlichen Werte variieren leicht je nach Kontextlänge und Framework.
Mehr zu den Speicheranforderungen findest Du im Artikel RAM und VRAM Anforderungen und im Artikel Modellgroesse und Speicherbedarf.
Qualität: Wie viel verlierst Du wirklich?
Die wichtigste Frage ist: Wie viel Qualität verlierst Du durch niedrigere Quantisierung? Die Antwort hängt von der Aufgabe ab.
Bei Chat und allgemeinen Texten ist der Unterschied zwischen Q4_K_M und Q8_0 für die meisten Nutzer kaum spürbar. Q4_K_M produziert flüssige, kohärente Antworten, die für alltägliche Konversationen völlig ausreichen. Wenn Du das Modell nur zum Chatten oder für einfache Zusammenfassungen nutzt, wirst Du den Unterschied wahrscheinlich nicht bemerken.
Bei Programmieraufgaben wird der Unterschied deutlicher. Q4_K_M kann bei komplexen Code-Aufgaben gelegentlich Fehler machen, die bei Q5_K_M oder Q6_K nicht auftreten. Wenn Du das Modell fürs Programmieren nutzt, empfiehlt sich mindestens Q5_K_M, besser Q6_K.
Bei Mathematik und Logik ist der Unterschied am deutlichsten. Niedrige Quantisierungen können bei mehrschrittigen Berechnungen Fehler machen, weil die Präzision der Zwischenergebnisse abnimmt. Für mathematische Aufgaben solltest Du Q5_K_M oder höher wählen.
Bei mehrsprachigen Aufgaben kann Q4_K_M gelegentlich Sprachen verwechseln oder ungewöhnliche Wortwahl produzieren. Q5_K_M und höher sind hier stabiler, besonders bei weniger verbreiteten Sprachen.
Zusammenfassend: Für einfache Aufgaben reicht Q4_K_M. Für anspruchsvolle Aufgaben wie Coding, Mathematik oder mehrsprachige Texte solltest Du Q5_K_M oder Q6_K wählen. Q8_0 ist nur dann nötig, wenn Du maximale Qualität brauchst und den Speicherplatz hast.
Geschwindigkeit: Ist weniger Bits schneller?
Ein überraschender Effekt der Quantisierung ist, dass niedrigere Stufen oft schneller sind. Das liegt daran, dass weniger Daten zwischen dem Speicher und dem Prozessor bewegt werden müssen. Der VRAM ist schnell, aber die Bandbreite ist begrenzt. Weniger Bits pro Gewicht bedeutet weniger Datenverkehr, was die Ausführung beschleunigt.
In der Praxis sieht das so aus:
| Stufe | Relative Geschwindigkeit (GPU) | Relative Geschwindigkeit (CPU) |
|---|---|---|
| FP16 | 1,0x | 1,0x |
| Q8_0 | ca. 1,5x | ca. 1,3x |
| Q6_K | ca. 1,8x | ca. 1,5x |
| Q5_K_M | ca. 2,0x | ca. 1,7x |
| Q4_K_M | ca. 2,2x | ca. 2,0x |
| Q3_K_M | ca. 2,3x | ca. 2,1x |
Diese Werte sind Richtwerte und variieren je nach GPU, CPU und Framework. Auf einer RTX 3060 kann Q4_K_M etwa 50 Prozent schneller sein als Q8_0. Auf einer CPU ist der Unterschied noch größer, weil die Speicherbandbreite hier der Hauptflaschenhals ist.
Das bedeutet: Niedrigere Quantisierung spart nicht nur Speicher, sondern kann auch die Geschwindigkeit erhöhen. Wenn Dir Geschwindigkeit wichtiger ist als maximale Qualität, ist Q4_K_M die bessere Wahl, nicht Q8_0.
Speicherbedarf: Der entscheidende Faktor
Für die meisten lokalen Nutzer ist der Speicherbedarf der entscheidende Faktor. Die Grafikkarte hat einen festen VRAM, und das Modell muss hineinpassen. Hier ist eine Übersicht, welches Modell in welcher Stufe auf welche Grafikkarte passt:
| VRAM | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| 8 GB | bis 8B | bis 7B | bis 7B | bis 4B |
| 12 GB | bis 13B | bis 13B | bis 10B | bis 8B |
| 16 GB | bis 14B | bis 14B | bis 13B | bis 13B |
| 24 GB | bis 30B | bis 27B | bis 27B | bis 22B |
Diese Werte beinhalten etwa 2 GB Puffer für KV-Cache und Overhead. Bei längeren Kontexten brauchst Du mehr Puffer, was die maximale Modellgröße reduziert.
Die Tabelle zeigt: Mit 8 GB VRAM bist Du auf Q4_K_M für 8B-Modelle beschränkt. Mit 12 GB VRAM kannst Du bei 8B-Modellen auf Q6_K oder Q8_0 hochgehen. Mit 24 GB VRAM hast Du bei 8B-Modellen freie Wahl und kannst sogar 30B-Modelle in Q4_K_M betreiben.
Wann wähle ich welche Stufe?
Hier ist ein praktischer Entscheidungsleitfaden:
Wähle Q4_K_M, wenn:
- Du 8 GB VRAM oder weniger hast
- Du das Modell für Chat, Zusammenfassungen oder einfache Texte nutzt
- Geschwindigkeit Dir wichtiger ist als maximale Qualität
- Du mehrere Modelle gleichzeitig betreiben willst
Wähle Q5_K_M, wenn:
- Du 12 GB VRAM oder mehr hast und ein 8B- bis 13B-Modell betreibst
- Du das Modell für Coding oder Mathematik nutzt
- Du einen guten Kompromiss aus Qualität und Speicher suchst
- Du längere Kontexte brauchst und noch VRAM übrig haben willst
Wähle Q6_K, wenn:
- Du 16 GB VRAM oder mehr hast
- Qualität oberste Priorität hat, aber Du nicht Q8_0 brauchst
- Du komplexe Coding- oder Logikaufgaben löst
- Du einen Mac mit 24 GB oder mehr Unified Memory nutzt
Wähle Q8_0, wenn:
- Du 16 GB VRAM oder mehr hast und ein 8B-Modell betreibst
- Du maximale Qualität brauchst und Speicher kein Problem ist
- Du das Modell für Fine-Tuning oder als Basis für weiteres Training nutzt
- Du Benchmark-Ergebnisse reproduzieren willst, die mit FP16 erzielt wurden
Als allgemeine Faustregel: Wenn Du Dir unsicher bist, nimm Q4_K_M. Wenn Du mehr VRAM hast als das Modell in Q4_K_M braucht, steige auf Q5_K_M hoch. Wenn Dir Q5_K_M nicht gut genug ist, nimm Q6_K. Q8_0 ist für Spezialfälle reserviert.
Quantisierung in Ollama wechseln
Mit Ollama kannst Du verschiedene Quantisierungsstufen desselben Modells installieren und nutzen. Hier sind die wichtigsten Befehle:
# Standardinstallation (Q4_K_M)
ollama run llama3:8b
# Spezifische Quantisierung wählen
ollama run llama3:8b-q5_K_M
ollama run llama3:8b-q6_K
ollama run llama3:8b-q8_0
# Installierte Modelle anzeigen
ollama list
# Modell entfernen, wenn nicht mehr benötigt
ollama rm llama3:8b-q8_0
Ollama lädt die entsprechende GGUF-Datei automatisch herunter. Mehr zur Modellverwaltung findest Du im Artikel Modelle verwalten.
Typische Stolpersteine
1. Q8_0 auf zu kleiner Hardware gestartet: Q8_0 braucht doppelt so viel Speicher wie Q4_K_M. Wenn das Modell gerade so in den VRAM passt, bleibt kein Platz für den Kontext. Das Modell stürzt bei längeren Konversationen ab. Wähle eine niedrigere Stufe.
2. Q4_0 statt Q4_K_M gewählt: Q4_0 ist die ältere, einfachere Variante. Q4_K_M liefert bei fast gleichem Speicherbedarf deutlich bessere Qualität. Wenn Du Q4 nutzt, nimm immer Q4_K_M, nie Q4_0.
3. Kontextbedarf nicht eingerechnet: Der VRAM-Bedarf besteht nicht nur aus dem Modell, sondern auch aus dem KV-Cache. Bei 8192 Tokens Kontext kommen 1 bis 3 GB dazu. Plane entsprechend und wähle eine niedrigere Stufe, wenn der Kontext groß wird.
4. Qualitätseinbußen bei Q3 und Q2 unterschätzt: Q3_K_M und Q2_K sind Notlösungen für sehr wenig VRAM. Die Qualitätseinbußen sind spürbar bis deutlich. Das Modell kann Halluzinationen produzieren oder logische Fehler machen. Nutze diese Stufen nur, wenn keine andere Option bleibt.
5. Geschwindigkeitsvorteil niedriger Quantisierung ignoriert: Niedrigere Quantisierung ist nicht nur kleiner, sondern auch schneller. Wenn Dir Geschwindigkeit wichtig ist, kann Q4_K_M besser sein als Q8_0, selbst wenn Du den Speicherplatz für Q8_0 hättest.
6. Verschiedene Modelle in verschiedenen Stufen verglichen: Wenn Du Modell A in Q4_K_M mit Modell B in Q8_0 vergleichst, ist der Vergleich unfair. Vergleiche immer Modelle in derselben Quantisierungsstufe, sonst weißt Du nicht, ob der Unterschied vom Modell oder von der Quantisierung kommt.
7. Benchmark-Ergebnisse ohne Quantisierungskontext gelesen: Die meisten Benchmark-Ergebnisse werden mit FP16 oder Q8_0 erhoben. Ein Q4_K_M-Modell kann 1 bis 3 Prozentpunkte schlechter abschneiden. Vergleiche immer mit demselben Quantisierungsniveau. Mehr dazu im Artikel Benchmarks.
Hardware, Kosten und Sicherheit
Hardware: Die Wahl der Quantisierungsstufe bestimmt, welche Hardware Du brauchst. Mit Q4_K_M kommst Du mit einer RTX 3060 mit 12 GB VRAM weit. Mit Q8_0 brauchst Du für dasselbe Modell mindestens 16 GB VRAM. Apple Silicon Nutzer profitieren besonders von Q4_K_M, weil der Unified Memory begrenzt ist.
Kosten: Quantisierte Modelle sind kostenlos. Die Kostenersparnis entsteht durch die Hardware: Mit Q4_K_M reicht eine günstige Grafikkarte, mit Q8_0 brauchst Du eine teurere. Der Unterschied kann Hunderte Euro ausmachen. Eine RTX 3060 mit 12 GB kostet unter 300 EUR, eine RTX 4080 mit 16 GB kostet über 900 EUR.
Sicherheit: Quantisierung hat keine Sicherheitsauswirkungen. Das quantisierte Modell ist eine komprimierte Version desselben Modells. Wenn Du es lokal ausführst, bleiben alle Daten auf Deinem Rechner. Es werden keine Informationen an Cloud-Dienste gesendet. Quantisierung ändert nichts an der Datensicherheit.
Weiterführende Links
- Modell-Übersicht - Alle Modell-Artikel im Überblick
- Quantisierung - Grundlagen ausführlich erklärt
- Llama-Modelle - Metas Modellfamilie
- Benchmarks - Modelle objektiv vergleichen
- Ollama - Die einfachste Methode für lokale Modelle
- Modelle verwalten - Modelle in Ollama verwalten
- Modellgroesse und Speicherbedarf - Zusammenhang von Größe und Speicher
- RAM und VRAM Anforderungen - Wie viel Speicher Du brauchst
FAQ
Lohnt sich der Wechsel von Q4_K_M auf Q5_K_M?
Wenn Du genug VRAM hast, ja. Q5_K_M bietet spürbar bessere Qualität bei Coding und Mathematik, bei nur etwa 25 Prozent mehr Speicherbedarf. Wenn Dein Modell in Q5_K_M noch bequem in den VRAM passt, nimm Q5_K_M.
Ist Q8_0 wirklich besser als Q6_K?
Der Unterschied ist für die meisten Anwendungen nicht spürbar. Q8_0 ist praktisch identisch mit dem Original, Q6_K ist sehr nah dran. Q6_K braucht etwa 20 Prozent weniger Speicher. Wenn Du zwischen Q6_K und Q8_0 schwankst, nimm Q6_K, es sei denn Du brauchst absolute Maximalqualität.
Kann ich die Quantisierungsstufe wechseln, ohne das Modell neu herunterzuladen?
Nein. Jede Quantisierungsstufe ist eine separate Datei. Mit Ollama kannst Du verschiedene Stufen installieren und zwischen ihnen wechseln, aber jede muss separat heruntergeladen werden.
Was ist der Unterschied zwischen Q4_0 und Q4_K_M?
Q4_0 quantisiert alle Gewichte gleichmäßig auf 4 Bit. Q4_K_M nutzt K-Quantisierung, bei der empfindliche Schichten mit mehr Bits gespeichert werden. Q4_K_M liefert bei fast gleichem Speicherbedarf deutlich bessere Qualität. Wähle immer Q4_K_M, nie Q4_0.
Wie viel VRAM brauche ich für Q5_K_M bei einem 8B-Modell?
Etwa 7 bis 8 GB inklusive KV-Cache und Overhead. Mit 8 GB VRAM wird es knapp, mit 12 GB VRAM bist Du entspannt. Plane etwa 2 GB Puffer für den Kontext ein.
Ist Q3_K_M noch brauchbar?
Q3_K_M ist eine Notlösung für sehr begrenzte Hardware. Die Qualitätseinbußen sind spürbar, besonders bei komplexen Aufgaben. Für einfache Chat-Anwendungen kann es funktionieren, für Coding oder Mathematik ist es nicht empfehlenswert. Besser ein kleineres Modell in Q4_K_M als ein großes in Q3_K_M.
Welche Quantisierungsstufe ist am schnellsten?
Je niedriger die Bit-Anzahl, desto schneller die Ausführung, weil weniger Daten bewegt werden. Q4_K_M ist auf den meisten GPUs etwa 50 Prozent schneller als Q8_0. Q3 und Q2 sind noch schneller, aber die Qualitätseinbußen wiegen den Geschwindigkeitsvorteil nicht auf.
Soll ich auf Apple Silicon eine andere Stufe wählen?
Die Prinzipien sind dieselben, aber Apple Silicon hat Unified Memory. Das bedeutet, Du teilst den Speicher mit dem Betriebssystem. Q4_K_M ist auch hier die Standardwahl. Bei Macs mit 16 GB RAM nimm Q4_K_M, bei 32 GB oder mehr kannst Du Q5_K_M oder Q6_K wählen.
Wie vergleiche ich zwei Quantisierungsstufen selbst?
Lade beide Stufen in Ollama, stelle dieselben Fragen und vergleiche die Antworten. Für objektivere Vergleiche nutze Benchmarks wie MMLU oder HumanEval mit lm-evaluation-harness. Mehr dazu im Artikel Benchmarks.
Macht Quantisierung bei sehr kleinen Modellen wie 2B Sinn?
Ja, aber der Qualitätsverlust ist bei kleinen Modellen spürbarer, weil jedes Gewicht mehr Einfluss hat. Bei einem 2B-Modell solltest Du mindestens Q5_K_M oder Q6_K wählen, um die Qualität nicht zu sehr zu beeinträchtigen. Q4_K_M ist für 2B-Modelle die unterste Grenze.
Beeinflusst Quantisierung die Kontextlänge?
Indirekt ja. Quantisierung reduziert den Speicherbedarf des Modells, wodurch mehr VRAM für den KV-Cache übrig bleibt. Mit Q4_K_M kannst Du bei gleichem VRAM einen längeren Kontext nutzen als mit Q8_0. Wenn Dir lange Kontexte wichtig sind, kann eine niedrigere Quantisierungsstufe besser sein.
Quellen
- llama.cpp Quantisierungs-Dokumentation auf GitHub
- Hugging Face Modellkatalog und GGUF-Quantisierungen
- Ollama Dokumentation zur Modellverwaltung
- TheBloke und bartowski GGUF-Modell-Sammlungen auf Hugging Face
- K-Quantisierung Technical Report


