Skip to content
BotServBotServ
QuantisierungGGUFKI-ModellVRAMQ4_K_MQ5_K_M

Quantisierung

Quantisierung für KI-Modelle verstehen: Wie man Modelle verkleinert, welche Kompromisse entstehen und welche Varianten sich für lokale KI eignen.

S

schutzgeist

16 min read
Darstellung von Quantisierungsstufen

Quantisierung

Was dieser Artikel über Quantisierung behandelt

  • Was Quantisierung ist und warum sie für lokale KI unverzichtbar ist
  • Wie Du mit Quantisierung große Modelle auf begrenzten Grafikkarten betreibst
  • Welche Formate und Methoden es gibt, von GGUF über AWQ bis EXL2
  • Wie Du die passende Quantisierungsstufe für Deine Hardware findest
  • Welche Stolpersteine und Kompromisse Du kennen solltest

Einleitung: Quantisierung verständlich erklärt

Wenn Du Dich für lokale KI interessierst, kommst Du an einem Begriff nicht vorbei: Quantisierung. Moderne Sprachmodelle haben Milliarden von Parametern, und jedes dieser Parameter belegt Speicherplatz. Ein unquantisiertes Modell mit 13 Milliarden Parametern braucht rund 26 GB Speicher. Die meisten Consumer-Grafikkarten bieten aber nur 8 bis 12 GB VRAM. Ohne Quantisierung wäre das Betreiben solcher Modelle zu Hause schlicht nicht möglich.

Quantisierung ist der Schritt, der lokale KI erst alltagstauglich macht. Sie reduziert die Speichergröße eines Modells, ohne es komplett neu zu trainieren. Dadurch passen große Modelle auf kleinere Grafikkarten, laden schneller und verbrauchen weniger Strom. In diesem Artikel lernst Du, wie das funktioniert, welche Methoden es gibt und welche Stufe Du für Deinen Anwendungsfall wählen solltest.

Mehr Hintergrund zum lokalen Betrieb findest Du im Artikel LLM lokal betreiben.

Warum brauche ich Quantisierung?

Ein konkretes Beispiel macht das Problem sofort klar. Stell Dir vor, Du möchtest ein 13B-Modell wie Llama 2 13B lokal ausführen. Im Originalzustand ist dieses Modell in FP16 gespeichert, also mit 16 Bit pro Parameter. Bei 13 Milliarden Parametern ergibt das rund 26 GB Speicherbedarf.

Jetzt schaust Du auf Deine Grafikkarte. Eine typische Consumer-GPU wie die RTX 3060 hat 12 GB VRAM. Das unquantisierte Modell passt dort nicht hinein, nicht ansatzweise. Du könntest es auf den Arbeitsspeicher auslagern, aber dann wird die Ausführung extrem langsam, weil der System-RAM viel weniger Bandbreite bietet als der VRAM der Grafikkarte. Details dazu findest Du im Artikel RAM vs. VRAM.

Mit Quantisierung auf Q4, also 4 Bit pro Parameter, schrumpft das Modell auf etwa 8 GB. Das passt locker auf eine 12-GB-Grafikkarte, mit Platz für den Kontext und die Zwischenergebnisse während der Texterzeugung. Das Modell läuft schnell, flüssig und vollständig auf der GPU, ohne Auslagerung.

Das ist der Kernpunkt: Quantisierung ist kein optionales Optimierungsdetail, sondern die Voraussetzung, um große Modelle überhaupt auf normaler Hardware laufen zu lassen.

Quantisierung - In A Nutshell

Quantisierung bedeutet, die Zahlenwerte eines Modells mit weniger Bits darzustellen als im Original. Ein Modell, das ursprünglich mit 16-Bit-Gleitkommazahlen (FP16) gespeichert ist, wird auf 8, 5 oder 4 Bit reduziert. Weniger Bits bedeuten weniger Speicherbedarf und schnellere Berechnungen.

Ein guter Vergleich ist die Bildkompression. Ein PNG-Bild speichert jeden Pixel verlustfrei und ist entsprechend groß. Ein JPG-Bild komprimiert die Daten, wirft also Informationen weg, sieht aber für das menschliche Auge fast genauso gut aus. Quantisierung funktioniert ähnlich: Du reduzierst die Genauigkeit der gespeicherten Werte, aber das Modell produziert trotzdem brauchbare, oft kaum unterscheidbare Ergebnisse.

Ein 7B-Modell in FP16 braucht etwa 14 GB. In Q4 benötigt es nur noch rund 4 bis 5 GB. Auf einer Grafikkarte mit 8 GB VRAM läuft es damit problemlos. Der Preis für diese Ersparnis ist ein möglicher, meist kleiner Qualitätsverlust, besonders bei sehr niedrigen Stufen wie Q4 oder Q3.

Für wen ist Quantisierung gedacht?

Quantisierung richtet sich an alle, die Sprachmodelle lokal betreiben wollen, ohne Tausende Euro in Server-Hardware zu investieren. Konkret betrifft das:

  • Heimanwender mit einer Consumer-Grafikkarte, die ein leistungsfähiges Modell ausführen möchten
  • Entwickler, die Modelle auf Workstations testen, bevor sie in Produktion gehen
  • Datenschützer, die Modelle offline nutzen wollen, um keine Daten an Cloud-Dienste zu senden
  • Forscher und Studierende, die mit begrenztem Budget experimentieren
  • Apple-Silicon-Nutzer, die den vereinheitlichten Speicher ihres Macs effizient nutzen wollen

Kurz gesagt: Wenn Du lokale KI betreiben willst, brauchst Du Quantisierung. Es gibt praktisch keinen Weg daran vorbei.

Wichtige Begriffe rund um Quantisierung

BegriffBedeutung
FP1616-Bit-Gleitkommadarstellung, das Standardformat für trainierte Modelle
INT88-Bit-Ganzzahldarstellung, halbiert den Speicherbedarf gegenüber FP16
INT44-Bit-Ganzzahldarstellung, reduziert den Speicher auf ein Viertel von FP16
Q4Quantisierungsstufe mit 4 Bit pro Gewicht
Q5Quantisierungsstufe mit 5 Bit pro Gewicht
Q6Quantisierungsstufe mit 6 Bit pro Gewicht
Q8Quantisierungsstufe mit 8 Bit pro Gewicht, nahe am Original
GGUFDateiformat für quantisierte Modelle, genutzt von llama.cpp und Ollama
K-QuantisierungMischquantisierungsverfahren, das empfindliche Gewichte mit mehr Bits speichert
BitsAnzahl der Speicherbits pro Parameterwert, bestimmt Genauigkeit und Speicherbedarf
GewichteDie gelernten Parameter des Modells, die während des Trainings angepasst wurden
AktivierungenDie Zwischenwerte, die während der Ausführung des Modells berechnet werden

Wie funktioniert Quantisierung?

Um Quantisierung zu verstehen, musst Du wissen, wie ein Modell Zahlen speichert. Jeder Parameter, also jedes Gewicht im Modell, ist eine Zahl. Im unquantisierten Zustand wird diese Zahl als Gleitkommazahl mit 16 Bit gespeichert, im FP16-Format. 16 Bit können etwa 65.500 verschiedene Werte darstellen, was eine hohe Genauigkeit erlaubt.

Bei der Quantisierung nimmst Du diese 16-Bit-Zahlen und wandelst sie in Zahlen mit weniger Bits um. Bei 8 Bit sind es noch 256 mögliche Werte, bei 4 Bit nur noch 16. Das bedeutet, Du gruppierst benachbarte Werte und weist ihnen einen gemeinsamen, gröberen Wert zu. Aus einer Zahl wie 0,123456 wird beispielsweise 0,125, weil das die nächstgelegene Stufe ist, die mit 4 Bit darstellbar ist.

Warum spart das Speicher? Ganz einfach: Weniger Bits pro Wert bedeuten weniger Bytes insgesamt. Ein 13B-Modell hat 13 Milliarden Werte. Bei 16 Bit, also 2 Byte pro Wert, brauchst Du 26 GB. Bei 4 Bit, also 0,5 Byte pro Wert, brauchst Du nur noch 6,5 GB. Der Speicherbedarf sinkt proportional zur Bit-Anzahl.

Es gibt zwei grundsätzliche Ansätze:

1. Post-Training Quantisierung (PTQ): Das Modell wird normal trainiert und danach quantisiert. Das ist der häufigste Fall im lokalen Bereich. Du nimmst ein fertiges FP16-Modell und wandelst es in eine Q4- oder Q8-Version um. Der Vorgang dauert Minuten bis Stunden, je nach Modellgröße.

2. Quantization-Aware Training (QAT): Das Modell wird bereits während des Trainings darauf vorbereitet, später quantisiert zu werden. Das liefert bessere Ergebnisse, ist aber aufwendig und wird meist von den Modellentwicklern durchgeführt, nicht von Endnutzern.

Für den lokalen Einsatz ist fast immer PTQ relevant. Du lädst Dir ein fertiges Modell herunter, das bereits quantisiert wurde, oder quantisierst es selbst mit Tools wie llama.cpp.

Ein wichtiger Unterschied ist, was genau quantisiert wird. Bei den meisten lokalen Verfahren werden nur die Gewichte quantisiert, nicht die Aktivierungen. Das vereinfacht den Prozess und reicht für die meisten Anwendungsfälle aus. Bei der Ausführung werden die quantisierten Gewichte dann für die Berechnung kurz in eine höhere Genauigkeit zurückgewandelt, was sogenannte Dequantisierung genannt wird.

Arten von Quantisierung

Es gibt mehrere Methoden und Formate, die im lokalen KI-Bereich eine Rolle spielen. Sie unterscheiden sich in Kompressionstechnik, Geschwindigkeit und Kompatibilität.

GGUF (GPT-Generated Unified Format): Das Standardformat für lokale Modelle, genutzt von llama.cpp, Ollama und LM Studio. GGUF speichert das Modell in einer einzigen Datei, inklusive Metadaten und Tokenizer. Es unterstützt viele Quantisierungsstufen von Q2 bis Q8 und die K-Quantisierungsvarianten. GGUF ist die sicherste Wahl, wenn Du ein Modell lokal betreiben willst, weil es auf CPU, GPU und Apple Silicon läuft.

AWQ (Activation-aware Weight Quantization): Eine Methode, die besonders wichtige Gewichte identifiziert und diese mit höherer Genauigkeit speichert. AWQ liefert bei 4 Bit oft bessere Qualität als einfache Verfahren, ist aber hauptsächlich für GPU-Betrieb mit vLLM oder Text-Generation-Inference gedacht. Für reine llama.cpp-Nutzer ist GGUF die bessere Wahl.

GPTQ: Ein älteres Verfahren, das Gewichte basierend auf ihrem Einfluss auf die Modellausgabe quantisiert. GPTQ liefert gute Ergebnisse bei 4 Bit, wird aber zunehmend durch AWQ und neuere Methoden verdrängt. Es funktioniert gut mit bestimmten Frameworks, ist aber weniger flexibel als GGUF.

EXL2 (ExLlamaV2): Ein Format, das flexible Bit-Raten erlaubt, zum Beispiel 4,5 Bit oder 6,25 Bit. EXL2 ist auf Geschwindigkeit mit ExLlamaV2 optimiert und eignet sich für Nutzer, die maximale Inference-Geschwindigkeit auf Nvidia-GPUs suchen. Es ist weniger verbreitet als GGUF, aber bei Geschwindigkeits-Enthusiasten beliebt.

bitsandbytes: Eine Bibliothek, die 8-Bit- und 4-Bit-Quantisierung direkt in PyTorch integriert. Sie wird oft für Training und Feintuning verwendet, zum Beispiel bei QLoRA. Für reines Ausführen ist bitsandbytes weniger typisch, aber für Entwickler, die Modelle anpassen wollen, relevant.

Welche Methode die beste ist, hängt von Deinem Setup ab. Für die meisten Anwender gilt: GGUF über Ollama oder llama.cpp ist der einfachste und kompatibelste Weg. Wer maximale GPU-Geschwindigkeit will und ExLlamaV2 nutzt, greift zu EXL2. Wer Modelle feintunt, kommt an bitsandbytes nicht vorbei.

K-Quantisierung erklärt

Wenn Du quantisierte Modelle durchstöberst, stößt Du auf Bezeichnungen wie Q4_0 und Q4_K_M. Der Unterschied ist wichtig.

Q4_0 ist die einfache Variante: Alle Gewichte des Modells werden gleichmäßig auf 4 Bit quantisiert. Das ist schnell, einfach und spart maximal Speicher, ignoriert aber, dass nicht alle Gewichte gleich wichtig sind.

Q4_K_M ist eine K-Quantisierungsvariante. Das “K” steht für eine Methode, die verschiedene Teile des Modells mit unterschiedlicher Genauigkeit speichert. Empfindliche Schichten, die starken Einfluss auf die Ausgabe haben, werden mit mehr Bits gespeichert, zum Beispiel 6 Bit. Weniger kritische Schichten bekommen 4 Bit oder weniger. Das “M” steht für “Medium” und ist ein Kompromiss zwischen Größe und Qualität.

Warum ist das besser? Ein Modell besteht aus vielen Schichten, und nicht jede Schicht ist gleich wichtig für das Endergebnis. Wenn Du alle gleich grob quantisierst, verlierst Du in den wichtigen Schichten zu viel Information. Die K-Quantisierung bewahrt die Qualität der wichtigen Teile und spart nur bei den unwichtigen konsequent. Das Ergebnis ist ein Modell, das kaum größer ist als eine Q4_0-Version, aber spürbar bessere Antworten liefert.

Es gibt mehrere K-Varianten:

  • Q4_K_S (Small): Etwas aggressivere Kompression, kleiner als Q4_K_M
  • Q4_K_M (Medium): Der beliebteste Kompromiss, empfohlen für die meisten Nutzer
  • Q5_K_M: 5-Bit-Basis mit Mischquantisierung, höhere Qualität als Q4
  • Q6_K: 6-Bit-Basis, sehr nah am Original, aber größer

Als Faustregel gilt: Wenn Du Q4 nutzt, nimm Q4_K_M, nicht Q4_0. Der Qualitätsunterschied ist spürbar, der Speicherunterschied minimal.

Gängige Quantisierungsstufen im Vergleich

StufeBitsSpeicherbedarf (13B-Modell)QualitätGeschwindigkeitEignung
FP1616ca. 26 GBOriginalBasisServer, High-End-Workstations
Q8_08ca. 13 GBNahezu identischSehr schnellGPUs mit 16+ GB VRAM
Q6_K6ca. 10 GBAusgezeichnetSchnellQualität hat Priorität
Q5_K_M5ca. 9 GBSehr gutSchnellSolider Kompromiss
Q4_K_M4ca. 8 GBGutSehr schnellStandardwahl für Consumer-GPUs
Q4_04ca. 7 GBEtwas schwächer als Q4_K_MSehr schnellWenn jeder GB zählt
Q3_K_M3ca. 6 GBSpürbar schwächerSehr schnellNotlösung bei sehr wenig VRAM
Q2_K2ca. 5 GBDeutlich eingeschränktSehr schnellNur für Experimente

Die Speicherwerte sind Richtwerte und variieren leicht je nach Modellarchitektur und Tokenizer-Größe.

Beispiel: Speichersparung bei einem 13B-Modell

Hier ist eine konkrete Rechnung, die zeigt, wie viel Du durch Quantisierung sparst. Wir nehmen ein 13B-Modell mit 13 Milliarden Parametern.

FP16 (Original): 13 Milliarden Parameter mal 2 Byte (16 Bit) ergibt 26 GB Speicherbedarf. Das passt auf keine übliche Consumer-Grafikkarte.

Q8_0: 13 Milliarden Parameter mal 1 Byte (8 Bit) ergibt 13 GB. Das passt auf eine RTX 4080 mit 16 GB VRAM, aber knapp, weil Du noch Platz für den Kontext brauchst.

Q5_K_M: 13 Milliarden Parameter mal 0,625 Byte (5 Bit, plus etwas Overhead durch Mischquantisierung) ergibt rund 9 GB. Das passt auf eine RTX 3080 mit 10 GB oder eine RTX 4070 mit 12 GB.

Q4_K_M: 13 Milliarden Parameter mal 0,5 Byte (4 Bit, plus Overhead) ergibt rund 8 GB. Das passt auf eine RTX 3060 mit 12 GB, mit ausreichend Platz für einen ordentlichen Kontext.

Die Ersparnis von FP16 zu Q4_K_M ist enorm: Du brauchst nur noch etwa ein Drittel des Speichers. Statt einer teuren Workstation-GPU reicht eine Mittelklasse-Grafikkarte.

Mehr zu den Speicheranforderungen verschiedener Modelle findest Du im Artikel RAM und VRAM Anforderungen.

Welche Quantisierungsstufe soll ich wählen?

Die Wahl hängt in erster Linie von Deinem verfügbaren VRAM ab. Hier ist ein Entscheidungsleitfaden:

Du hast 8 GB VRAM oder weniger: Wähle Q4_K_M für Modelle bis 7B Parameter. Für 13B-Modelle wird es knapp, Q3_K_M oder Q2_K sind möglich, aber mit Qualitätsverlusten zu rechnen. Besser ist es, ein kleineres Modell in höherer Qualität zu nutzen.

Du hast 12 GB VRAM: Q4_K_M für 13B-Modelle ist ideal. Du hast noch Platz für einen großzügigen Kontext. Alternativ Q5_K_M für 7B-Modelle, wenn Dir Qualität wichtiger ist als Modellgröße.

Du hast 16 GB VRAM: Q5_K_M oder Q6_K für 13B-Modelle sind eine gute Wahl. Du bekommst hohe Qualität und ausreichend Kontext. Für 7B-Modelle kannst Du Q8_0 nutzen und bist nah am Original.

Du hast 24 GB VRAM oder mehr: Q6_K oder Q8_0 für 13B-Modelle liefert nahezu Originalqualität. Du kannst auch 30B- oder 34B-Modelle in Q4_K_M betreiben.

Du nutzt Apple Silicon: Apple Silicon teilt sich Arbeitsspeicher zwischen CPU und GPU. Ein Mac mit 16 GB RAM kann ein 7B-Modell in Q4_K_M gut betreiben. Bei 32 GB RAM sind 13B-Modelle in Q4_K_M realistisch. Bei 64 GB oder mehr kannst Du auch 30B-Modelle in Q5 oder Q6 nutzen.

Als allgemeine Empfehlung: Q4_K_M ist die Standardwahl, mit der Du selten falsch liegst. Wenn Du mehr VRAM hast, steige auf Q5_K_M oder Q6_K hoch. Q8_0 nutzt Du, wenn Dir maximale Qualität wichtiger ist als Speicherersparnis. Q3 und Q2 solltest Du nur im Notfall wählen, die Qualitätseinbußen werden dort spürbar.

Wie komme ich an quantisierte Modelle?

Du musst Modelle nicht selbst quantisieren. Es gibt mehrere einfache Wege, an fertige quantisierte Versionen zu kommen.

Ollama: Die einfachste Methode. Ollama lädt automatisch eine passende quantisierte Version herunter, wenn Du ein Modell installierst. Du gibst ollama run llama3 ein und Ollama kümmert sich um den Rest. Standardmäßig nutzt Ollama Q4_K_M, was für die meisten Nutzer ideal ist.

Hugging Face: Die größte Plattform für Modelle. Du findest dort quantisierte GGUF-Dateien, die Du manuell herunterladen und mit llama.cpp, LM Studio oder anderen Tools nutzen kannst. Suche nach dem Modellnamen plus “GGUF”, zum Beispiel “Llama-3-8B-Instruct-GGUF”.

TheBloke: Einer der bekanntesten Anbieter quantisierter Modelle auf Hugging Face. TheBloke hat Hunderte Modelle in verschiedenen Quantisierungsstufen von Q2 bis Q8 bereitgestellt. Suche nach “TheBloke” plus Modellname auf Hugging Face.

bartowski: Ein weiterer aktiver Anbieter quantisierter GGUF-Modelle. Wenn TheBloke ein bestimmtes Modell nicht hat, schau bei bartowski vorbei. Die Qualität der Quantisierungen ist vergleichbar.

LM Studio: Eine Desktop-Anwendung mit grafischer Oberfläche, die Modelle direkt von Hugging Face herunterlädt. Du suchst ein Modell, wählst die Quantisierungsstufe aus einer Liste und LM Studio lädt die passende GGUF-Datei. Ideal für Nutzer, die keine Kommandozeile nutzen wollen.

Wenn Du ein Modell selbst quantisieren willst, brauchst Du das Originalmodell in FP16 und ein Tool wie llama.cpp. Der Prozess ist gut dokumentiert, aber für die meisten Nutzer einfacher, fertige GGUF-Dateien herunterzuladen.

Typische Stolpersteine bei der Quantisierung

1. Zu niedrige Quantisierung für komplexe Aufgaben: Q4 ist für Chat und allgemeine Texte fine. Bei Aufgaben, die präzises logisches Denken oder exakte Formatierung erfordern, zum Beispiel Code-Generierung oder mathematische Berechnungen, können niedrige Stufen zu Fehlern führen. Nutze hier mindestens Q5_K_M oder Q6_K.

2. Kontext nicht mitberechnet: Der Speicherbedarf eines Modells ist nicht nur das Modell selbst. Du brauchst auch Platz für den Kontext, also die laufende Unterhaltung, und für Zwischenergebnisse der Berechnung. Plane etwa 1 bis 2 GB extra für den Kontext ein, bei langen Kontexten mehr. Details dazu im Artikel Kontextlänge.

3. Falsches Format für die Software: GGUF funktioniert mit llama.cpp und Ollama. Wenn Du aber vLLM oder ExLlamaV2 nutzt, brauchst Du AWQ oder EXL2. Prüfe, welches Format Deine Software unterstützt, bevor Du ein Modell herunterlädst.

4. CPU-Quantisierung vs. GPU-Quantisierung: Einige Formate sind für CPU-Betrieb optimiert, andere für GPU. GGUF läuft auf beidem, ist aber nicht immer das Schnellste auf der GPU. EXL2 ist schnell auf Nvidia-GPUs, läuft aber nicht auf CPU. Wähle das Format passend zu Deiner Hardware.

5. Alte Quantisierungsvarianten nutzen: Q4_0 ist älter und einfacher als Q4_K_M. Wenn Du die Wahl hast, nimm immer die K-Variante. Der Qualitätsunterschied ist spürbar, der Speicherunterschied minimal.

6. VRAM knapp kalkuliert: Wenn ein Modell “gerade so” in den VRAM passt, kann es bei längeren Konversationen zu Problemen kommen, weil der Kontext wächst. Lass Dir Puffer, besonders wenn Du mit langen Texten oder großen Kontextfenstern arbeitest.

7. Apple Silicon Speicher teilen sich System und GPU: Bei Macs mit Apple Silicon nutzen CPU und GPU denselben Speicher. Ein 16-GB-Mac hat also nicht 16 GB VRAM, sondern teilt sich 16 GB zwischen Betriebssystem, Anwendungen und Modell. Plane entsprechend.

Hardware, Kosten und Sicherheit bei Quantisierung

Hardware: Quantisierte Modelle senken die Hardwareanforderungen erheblich. Statt einer teuren Workstation-GPU mit 24 GB VRAM reicht oft eine Mittelklasse-Grafikkarte mit 8 bis 12 GB. Das öffnet lokale KI für eine viel breitere Nutzergruppe. Mehr zu den Hardwaregrundlagen findest Du unter KI-Hardware Grundlagen.

Kosten: Die Kostenersparnis ist erheblich. Eine RTX 3060 mit 12 GB kostet ein Bruchteil einer A100 mit 80 GB. Mit Quantisierung kannst Du auf einer RTX 3060 ein 13B-Modell betreiben, das ohne Quantisierung eine GPU im vierstelligen Eurobereich erfordern würde.

Sicherheit: Quantisierung ändert nichts an der Sicherheit Deiner Daten. Das quantisierte Modell ist eine komprimierte Version desselben Modells, kein neues Modell. Wenn Du es lokal ausführst, bleiben alle Daten auf Deinem Rechner. Es werden keine Informationen an Cloud-Dienste gesendet. Das ist einer der großen Vorteile lokaler KI, den Quantisierung nicht beeinträchtigt.

Ein Aspekt, den Du beachten solltest: Quantisierte Modelle können sich in seltenen Fällen minimal anders verhalten als das Original, besonders bei sehr niedrigen Stufen. Wenn Du ein Modell für sicherheitskritische Anwendungen nutzt, teste die quantisierte Version gründlich, bevor Du sie im Ernstfall einsetzt.

FAQ - Typische Fragen zur Quantisierung

Verliere ich viel Qualität durch Quantisierung?

Bei Q4 ist der Unterschied für viele Aufgaben spürbar, aber oft noch akzeptabel. Bei Q5 oder Q6 nimmt der Qualitätsverlust deutlich ab. Q8 ist für die meisten Anwendungen praktisch nicht vom Original zu unterscheiden.

Was ist der Unterschied zwischen Q4_0 und Q4_K_M?

Q4_0 quantisiert alle Gewichte gleichmäßig. Q4_K_M verwendet eine Mischquantisierung, die empfindlichere Teile des Modells mit mehr Bits speichert, und liefert meist bessere Ergebnisse bei fast gleichem Speicherbedarf.

Kann ich ein Modell selbst quantisieren?

Ja, mit Tools wie llama.cpp und den entsprechenden convert-Skripten. Meist nimmt man aber bereits quantisierte GGUF-Dateien von Hugging Face oder über Ollama, weil das schneller und einfacher ist.

Wie viel Speicher spare ich mit Q4?

Ungefähr das Drei- bis Vierfache gegenüber einem FP16-Modell. Ein 13B-Modell schrumpft von etwa 26 GB auf etwa 7 bis 8 GB, je nach Variante.

Brauche ich Quantisierung auch bei Apple Silicon?

Ja. Auch Apple Silicon profitiert stark von quantisierten Modellen, weil der vereinheitlichte Speicher begrenzt ist und schnellere Ladezeiten möglich werden. Ein Mac mit 16 GB RAM kann ein 7B-Modell in Q4 gut betreiben.

Welche Quantisierungsstufe ist am besten für Anfänger?

Q4_K_M ist die Standardempfehlung. Sie bietet ein gutes Verhältnis aus Speicherersparnis und Qualität und funktioniert auf den meisten Consumer-Grafikkarten. Wenn Du Dir unsicher bist, fang mit Q4_K_M an.

Was bedeutet das “K” in Q4_K_M?

Das “K” steht für die K-Quantisierungsmethode, die verschiedene Schichten des Modells mit unterschiedlicher Genauigkeit speichert. Das “M” steht für “Medium”, einen Kompromiss zwischen Größe und Qualität. Es gibt auch “S” für Small und “L” für Large.

Ist GGUF besser als AWQ oder GPTQ?

Das hängt von Deiner Software ab. GGUF ist flexibler und läuft auf CPU, GPU und Apple Silicon. AWQ und GPTQ sind eher für GPU-Betrieb mit bestimmten Frameworks wie vLLM gedacht. Für die meisten lokalen Nutzer ist GGUF die bessere Wahl.

Kann ich ein quantisiertes Modell weiter trainieren?

Direkt nicht, aber Du kannst QLoRA nutzen, ein Verfahren, das Feintuning auf quantisierten Modellen erlaubt. Dabei bleibt das Basismodell quantisiert, und nur kleine Zusatzmodule werden in höherer Genauigkeit trainiert.

Was passiert, wenn das Modell nicht in den VRAM passt?

Die Software lagert Teile des Modells auf den System-RAM aus. Das funktioniert, ist aber deutlich langsamer, weil der System-RAM weniger Bandbreite bietet als VRAM. Bei starker Auslagerung wird die Texterzeugung spürbar zäh.

Sind quantisierte Modelle sicher?

Ja. Quantisierung ist eine reine Kompressionstechnik. Das Modell bleibt dasselbe, nur die Speicherdarstellung ändert sich. Wenn Du es lokal ausführst, bleiben Deine Daten auf Deinem Rechner.

Wirkt sich Quantisierung auf die Geschwindigkeit aus?

Ja, meist positiv. Quantisierte Modelle benötigen weniger Speicherbandbreite, was die Ausführung beschleunigen kann. Auf der GPU sind 4-Bit- und 8-Bit-Modelle oft schneller als FP16, weil weniger Daten bewegt werden müssen.

Kann ich zwischen Quantisierungsstufen wechseln, ohne das Modell neu zu laden?

Nein. Jede Quantisierungsstufe ist eine eigene Datei. Wenn Du die Stufe wechseln willst, musst Du das entsprechende Modell laden. Mit Ollama kannst Du verschiedene Stufen desselben Modells installieren und zwischen ihnen wechseln.

Was ist der Unterschied zwischen Gewichts- und Aktivierungsquantisierung?

Bei der Gewichtsquantisierung werden nur die gespeicherten Modellparameter reduziert. Bei der Aktivierungsquantisierung werden auch die Zwischenwerte während der Ausführung quantisiert. Letzteres ist aufwendiger und seltener im lokalen Bereich, kann aber zusätzliche Geschwindigkeitsvorteile bringen.

Quellen und weiterführende Literatur

  • llama.cpp Quantisierungs-Dokumentation auf GitHub
  • Hugging Face Modellkatalog und Dokumentation
  • TheBloke GGUF-Modell-Sammlung auf Hugging Face
  • bartowski GGUF-Modelle auf Hugging Face
  • Ollama Dokumentation zur Modellverwaltung
  • ExLlamaV2 Dokumentation zum EXL2-Format
Zurück zum KI Blog
Share:

Nächster Artikel in Lokale KI

Weiterlesen
RAM und VRAM Anforderungen

Ähnliche Beiträge