Skip to content
BotServBotServ
ModellgrößeParameterSpeicherbedarfQuantisierungGGUFKI-Hardware

Modellgröße und Speicherbedarf: Wie groß ist ein KI-Modell?

Wie groß sind KI-Modelle wirklich? Parameter, Gewichte, Speicherbedarf und Quantisierung verständlich erklärt. Von 1B bis 70B mit konkreten Zahlen.

S

schutzgeist

15 min read
Modellgröße und Speicherbedarf von KI-Modellen

Modellgröße und Speicherbedarf: Wie groß ist ein KI-Modell?

Was dieser Artikel über Modellgröße und Speicherbedarf behandelt

  • Was die B-Zahl bei KI-Modellen bedeutet und wie Parameter mit Speicher zusammenhängen
  • Wie Du den Speicherbedarf eines Modells selbst berechnest, mit und ohne Quantisierung
  • Eine Übersichtstabelle von 1B bis 70B mit konkreten Zahlen für FP16, Q8 und Q4
  • Was neben dem Modell noch Speicher frisst, vom KV-Cache bis zum Betriebssystem
  • Wie Du die tatsächliche Größe eines Modells auf Hugging Face und in Ollama herausfindest

Einleitung: Modellgröße und Speicherbedarf verständlich erklärt

Wenn Du Dich für lokale KI interessierst, triffst Du schnell auf Bezeichnungen wie 7B, 13B oder 70B. Diese Zahlen stehen für die Anzahl der Parameter eines Modells, also der Werte, die das Modell während des Trainings gelernt hat. Sie sind der wichtigste Faktor für die Frage, wie viel Speicher das Modell auf Deinem Rechner braucht.

Viele Einsteiger sind überrascht, wenn sie ein 7B-Modell herunterladen und die Datei nur 4 GB groß ist, nicht 7 GB. Oder sie laden ein 13B-Modell ohne Quantisierung und stellen fest, dass es 26 GB Speicher verbraucht, obwohl sie eigentlich 13 GB erwartet haben. Der Grund dafür ist, dass Parameter und Speicherplatz nicht dasselbe sind. Ein Parameter ist eine Zahl, und wie viel Speicher diese Zahl belegt, hängt von ihrer Genauigkeit ab.

Dieser Artikel erklärt Dir, wie Parameter, Gewichte und Speicherbedarf zusammenhängen. Du lernst, wie Du den Speicherbedarf selbst berechnest, was Quantisierung damit zu tun hat und welche zusätzlichen Faktoren Du beachten musst. Am Ende kannst Du für jedes Modell abschätzen, ob es auf Deiner Hardware läuft, bevor Du es herunterlädst.

Warum brauche ich dieses Wissen?

Stell Dir vor, Du hast Ollama installiert und willst ein Modell ausprobieren. Du liest irgendwo von einem tollen 7B-Modell und lädst es herunter. Die Datei ist 4,4 GB groß. Du wunderst Dich, warum es nicht 7 GB sind. Dann versuchst Du ein 13B-Modell, und plötzlich braucht es 26 GB Speicher, obwohl die Zahl doch nur 13 lautet. Was ist hier los?

Das Problem ist, dass die B-Zahl die Anzahl der Parameter angibt, nicht die Dateigröße in Gigabyte. Wie viel Speicher ein Parameter belegt, hängt vom Format ab. Im Standardformat FP16, also 16-bit Fließkommazahlen, belegt jeder Parameter 2 Byte. Ein 7B-Modell braucht in FP16 also etwa 14 GB. Mit 4-bit-Quantisierung schrumpft das auf etwa 4 GB, und genau das ist die Datei, die Du heruntergeladen hast.

Wenn Du diesen Zusammenhang nicht kennst, kaufst Du vielleicht die falsche Hardware. Du denkst, ein 13B-Modell braucht 13 GB VRAM, kaufst eine Grafikkarte mit 16 GB, und dann reicht es doch nicht, weil das Modell unquantisiert 26 GB braucht. Oder Du lädst ein Modell, das gar nicht erst startet, weil der Speicher nicht ausreicht. Mit dem Wissen aus diesem Artikel triffst Du die richtigen Entscheidungen.

Modellgröße und Speicherbedarf kurz erklärt

Ein KI-Modell besteht aus Parametern, auch Gewichte genannt. Das sind Zahlen, die das Modell während des Trainings gelernt hat. Sie bestimmen, wie das Modell auf Eingaben reagiert. Je mehr Parameter ein Modell hat, desto mehr kann es lernen und desto komplexer sind die Zusammenhänge, die es erfassen kann. Mehr Parameter bedeuten aber auch mehr Speicherbedarf.

Ein einfaches Bild: Stell Dir das Modell als Gehirn vor. Die Parameter sind die Neuronen. Ein Gehirn mit mehr Neuronen kann komplexere Aufgaben lösen, braucht aber auch mehr Platz. Ein 1B-Modell ist ein kleines Gehirn, ein 70B-Modell ist ein großes. Wie viel Platz jedes Neuron, also jeder Parameter, belegt, hängt davon ab, wie genau die Zahl gespeichert wird. Im 16-bit-Format belegt jeder Parameter 2 Byte, im 4-bit-Format nur ein halbes Byte.

Die Grundformel lautet: Parameterzahl mal Byte pro Parameter ergibt den Speicherbedarf. Ein 7B-Modell mit 16-bit-Genauigkeit braucht 7 Milliarden mal 2 Byte, also etwa 14 GB. Mit 4-bit-Quantisierung braucht es 7 Milliarden mal 0,5 Byte, also etwa 3,5 GB. Mehr dazu im Abschnitt zur Berechnung.

Für wen ist dieses Wissen gedacht?

Dieser Artikel richtet sich an Einsteiger, die lokale KI ausprobieren wollen und sich fragen, wie groß die Modelle wirklich sind. Wenn Du noch nie von Parametern gehört hast oder nicht verstehst, warum ein 7B-Modell mal 4 GB und mal 14 GB groß ist, bist Du hier richtig. Du brauchst kein Vorwissen. Wir gehen Schritt für Schritt durch, was Parameter sind, wie sie gespeichert werden und wie Du den Speicherbedarf berechnest.

Auch wenn Du schon erste Modelle mit Ollama ausgeführt hast und Dich fragst, warum manche Modelle auf Deiner Hardware laufen und andere nicht, hilft Dir dieser Artikel. Die Grundlagen hier sind die Basis für weiterführende Themen wie Quantisierung, RAM und VRAM Anforderungen und die Kaufberatung.

Wichtige Begriffe rund um Modellgröße

BegriffBedeutung
ParameterZahl, die das Modell während des Trainings gelernt hat, auch Gewicht genannt
GewichteSynonym für Parameter, bestimmt wie stark Eingaben gewichtet werden
MilliardenEinheit für die Parameterzahl, abgekürzt mit B für Billion im Englischen
BAbkürzung für Billion, also Milliarden, z. B. 7B für 7 Milliarden Parameter
FP1616-bit Fließkommazahl, Standardformat, 2 Byte pro Parameter
INT88-bit Ganzzahl, 1 Byte pro Parameter, leichter Qualitätsverlust
INT44-bit Ganzzahl, 0,5 Byte pro Parameter, stärkerer Qualitätsverlust
QuantisierungReduzierung der Genauigkeit der Parameter, um Speicher zu sparen
GGUFDateiformat für quantisierte Modelle, genutzt von Ollama und llama.cpp
KV-CacheZwischenspeicher für Kontext, wächst mit der Kontextlänge

Was bedeutet die B-Zahl?

Die B-Zahl bei einem KI-Modell gibt die Anzahl der Parameter an. B steht für das englische Wort Billion, was im Deutschen Milliarden bedeutet. Ein 7B-Modell hat also 7 Milliarden Parameter, ein 70B-Modell hat 70 Milliarden. Manchmal siehst Du auch die Schreibweise 7B oder 7B-Parameter, beides meint dasselbe.

Jeder Parameter ist eine Zahl, typischerweise eine Kommazahl zwischen minus 1 und plus 1. Diese Zahlen werden während des Trainings angepasst, damit das Modell sinnvolle Ausgaben erzeugt. Wenn Du ein Modell nutzt, werden diese Zahlen bei jeder Anfrage millionenfach multipliziert und addiert. Das ist die eigentliche Rechenarbeit, die die GPU oder CPU übernimmt.

Die B-Zahl allein sagt noch nichts über die Dateigröße aus. Ein 7B-Modell kann 14 GB groß sein, wenn es im 16-bit-Format gespeichert ist, oder 4 GB, wenn es 4-bit-quantisiert ist. Die B-Zahl sagt nur, wie viele Parameter es gibt. Wie viel Speicher jeder Parameter belegt, hängt vom Format ab. Das ist der Schlüssel zum Verständnis von Modellgröße und Speicherbedarf.

Speicherbedarf berechnen

Die Grundformel für den Speicherbedarf ist einfach:

Speicherbedarf = Parameterzahl × Byte pro Parameter

Wie viel Byte ein Parameter belegt, hängt vom Format ab:

  • FP16 (16-bit): 2 Byte pro Parameter
  • INT8 (8-bit): 1 Byte pro Parameter
  • INT4 (4-bit): 0,5 Byte pro Parameter

Hier sind konkrete Beispiele für verschiedene Modellgrößen und Formate. Die Werte sind gerundet und beziehen sich nur auf die Modellgewichte, ohne KV-Cache und Overhead.

ParameterFP16 (2 Byte)Q8 (1 Byte)Q4 (0,5 Byte)
1B2 GB1 GB0,5 GB
3B6 GB3 GB1,5 GB
7B14 GB7 GB3,5 GB
13B26 GB13 GB6,5 GB
30B60 GB30 GB15 GB
70B140 GB70 GB35 GB

Du siehst sofort, warum Quantisierung so wichtig ist. Ein 70B-Modell braucht im FP16-Format 140 GB Speicher, was auf keiner Consumer-Hardware läuft. Mit 4-bit-Quantisierung schrumpft das auf 35 GB, was auf einem Mac mit 64 GB Unified Memory oder einem Multi-GPU-Setup machbar wird. Mehr zur Quantisierung findest Du im eigenen Artikel zur Quantisierung.

Die Formel liefert den Speicherbedarf für die reinen Modellgewichte. In der Praxis brauchst Du etwas mehr, weil noch der KV-Cache, das Betriebssystem und das Framework selbst Speicher benötigen. Mehr dazu im nächsten Abschnitt.

Tabelle: Modellgrößen im Überblick

Hier ist eine Übersicht mit realistischen Werten, inklusive empfohlenem VRAM und Beispielmodellen. Die empfohlenen Werte enthalten Puffer für KV-Cache und Overhead, damit das Modell nicht nur lädt, sondern auch mit einer anständigen Kontextlänge läuft.

ModellgrößeFP16Q8Q4Empfohlener VRAM (Q4)Beispielmodelle
1B2 GB1 GB0,5 GB2 GBTinyLlama, Qwen2.5-1.5B
3B6 GB3 GB1,5 GB4 GBLlama 3.2-3B, Phi-3-mini
7B14 GB7 GB3,5 GB8 GBLlama 3.1-8B, Mistral-7B
13B26 GB13 GB6,5 GB12 GBLlama 2-13B, Qwen2.5-14B
30B60 GB30 GB15 GB24 GBMixtral 8x7B, Qwen2.5-32B
70B140 GB70 GB35 GB48 GBLlama 3.1-70B, Qwen2.5-72B

Die empfohlenen VRAM-Werte gelten für 4-bit-quantisierte Modelle. Wenn Du ein Modell ohne Quantisierung, also im FP16-Format, laden willst, brauchst Du deutlich mehr Speicher. Die Tabelle zeigt Dir, warum die meisten Anwender quantisierte Modelle nutzen. Ohne Quantisierung passt ein 13B-Modell nicht mal in eine RTX 4090 mit 24 GB VRAM.

Mehr zu den genauen Anforderungen an RAM und VRAM findest Du im Artikel zu RAM und VRAM Anforderungen. Wenn Du wissen willst, wie sich RAM und VRAM generell unterscheiden, schau Dir den Artikel zu RAM vs. VRAM an.

Was kommt zum Modell noch dazu?

Die Modellgewichte sind der größte, aber nicht der einzige Speicherverbraucher. Wenn Du ein Modell ausführst, kommen noch weitere Faktoren dazu.

KV-Cache: Der KV-Cache speichert Zwischenergebnisse während der Inferenz, damit das Modell nicht bei jedem neuen Wort alles neu berechnen muss. Er wächst mit der Kontextlänge, also der Anzahl der Tokens, die das Modell gerade verarbeitet. Ein langer Text als Eingabe braucht mehr KV-Cache als ein kurzer. Bei einer Kontextlänge von 8192 Tokens kann der KV-Cache je nach Modell mehrere Gigabyte belegen. Mehr dazu im Artikel zur Kontextlänge.

Betriebssystem-Overhead: Dein Betriebssystem selbst braucht Speicher. Windows, Linux oder macOS belegen typisch 2 bis 4 GB RAM, plus alle anderen laufenden Programme. Wenn Du 16 GB RAM hast und ein Modell 10 GB davon braucht, bleiben nur 6 GB für alles andere.

Framework-Overhead: Tools wie Ollama oder das zugrundeliegende llama.cpp brauchen selbst etwas Speicher für die Laufzeit und die Verwaltung des Modells. Das sind typisch einige hundert Megabyte, kann aber bei speziellen Konfigurationen mehr werden.

Als Faustregel gilt: Plane etwa 20 bis 30 Prozent mehr Speicher ein, als die reine Modellgröße angibt. Wenn ein 7B-Modell im Q4-Format 3,5 GB braucht, plane mit etwa 5 GB, damit Kontext, Overhead und Betriebssystem genug Platz haben.

Download-Größe vs. Speicherbedarf

Ein häufiger Punkt der Verwirrung ist der Unterschied zwischen der Dateigröße beim Download und dem Speicherbedarf im Betrieb. Wenn Du ein Modell als GGUF-Datei herunterlädst, ist die Datei bereits quantisiert und komprimiert. Die Download-Größe entspricht also in etwa dem Speicherbedarf der quantisierten Gewichte.

Wenn Du ein Modell im FP16-Format herunterlädst, ist die Datei etwa so groß wie der FP16-Speicherbedarf. Ein 7B-Modell im FP16-Format ist also etwa 14 GB groß. Lädst Du es dann aber in 4-bit-quantisiert, braucht es im Betrieb nur 3,5 GB. Die Datei auf der Festplatte bleibt aber 14 GB, weil Du die unquantisierten Gewichte gespeichert hast.

Umgekehrt gilt: Wenn Du ein 4-bit-quantisiertes Modell als GGUF-Datei herunterlädst, ist die Datei etwa 3,5 GB groß. Im Speicher braucht das Modell dann auch etwa 3,5 GB, plus KV-Cache und Overhead. Die GGUF-Datei ist also kein komprimiertes Archiv, das im Speicher entpackt wird, sondern die Gewichte liegen bereits im quantisierten Format vor.

Der wichtigste Punkt: Die Download-Größe der GGUF-Datei ist ein guter Indikator für den Speicherbedarf der Modellgewichte. Was noch dazukommt, ist der KV-Cache und der Overhead, die während des Betriebs zusätzlich belegt werden.

Wie finde ich die Größe eines Modells?

Es gibt mehrere Wege, die Größe eines Modells herauszufinden, bevor Du es herunterlädst.

Hugging Face: Auf Hugging Face siehst Du bei jedem Modell die Anzahl der Parameter in der Beschreibung. Die Dateigrößen der einzelnen Dateien findest Du im Abschnitt Files. Achte darauf, welche Datei Du herunterlädst. Eine FP16-Datei ist deutlich größer als eine quantisierte GGUF-Datei. Die Dateinamen enthalten oft Hinweise wie FP16, Q8_0 oder Q4_K_M, die Dir sagen, welches Format vorliegt.

Ollama: Wenn Du ein Modell mit Ollama lädst, zeigt Dir der Befehl ollama list alle installierten Modelle mit ihrer Größe an. Die Größe entspricht der GGUF-Datei, also den quantisierten Gewichten. Wenn Du ein Modell suchst, das auf Deine Hardware passt, hilft der Artikel zum Modell finden.

Modell-Karten: Die meisten Modellkarten auf Hugging Face geben die Parameterzahl und die verfügbaren Quantisierungen an. Manchmal findest Du auch direkt eine Tabelle mit den Dateigrößen der verschiedenen Varianten.

Die wichtigste Regel: Schau immer auf das Format. Ein 7B-Modell kann 14 GB oder 3,5 GB groß sein, je nachdem, ob es FP16 oder Q4 ist. Die B-Zahl allein reicht nicht aus, um den Speicherbedarf zu bestimmen.

Typische Stolpersteine bei Modellgröße und Speicherbedarf

  • B-Zahl mit Dateigröße verwechseln: 7B bedeutet 7 Milliarden Parameter, nicht 7 GB. Im FP16-Format braucht ein 7B-Modell 14 GB, im Q4-Format 3,5 GB.
  • Format ignorieren: Wer nicht auf das Format achtet, wundert sich, warum ein 7B-Modell mal 4 GB und mal 14 GB groß ist. Das Format entscheidet über den Speicherbedarf.
  • KV-Cache vergessen: Die Modellgewichte sind nicht alles. Bei langen Kontexten kann der KV-Cache mehrere Gigabyte belegen und das Modell zum Absturz bringen, wenn der Speicher knapp ist.
  • Betriebssystem-Overhead unterschätzen: Wenn Du 8 GB VRAM hast und ein Modell 7 GB braucht, bleibt kaum Platz für den Rest. Plane immer Puffer ein.
  • Unquantisierte Modelle laden: Wer ein 13B-Modell ohne Quantisierung lädt, braucht 26 GB VRAM. Mit Q4 sind es nur 6,5 GB. Für die meisten Anwendungen reicht Q4 völlig aus.
  • Empfohlenen VRAM gleichsetzen mit Modellgröße: Der empfohlene VRAM enthält Puffer für KV-Cache und Overhead. Er ist immer größer als die reine Modellgröße.
  • Mischmodelle falsch einschätzen: Modelle wie Mixtral 8x7B sind Mixture-of-Experts-Modelle. Die Gesamtzahl der Parameter ist hoch, aber bei jeder Anfrage wird nur ein Teil aktiv. Der Speicherbedarf richtet sich nach allen Parametern, nicht nur nach den aktiven.

Hardware, Kosten und Sicherheit bei Modellgröße

Hardware: Die Modellgröße bestimmt, welche Hardware Du brauchst. Für 1B- bis 3B-Modelle reicht ein einfacher Rechner mit 8 GB RAM. Für 7B-Modelle empfiehlt sich eine Grafikkarte mit 8 GB VRAM. Für 13B-Modelle brauchst Du 12 GB VRAM, für 30B-Modelle 24 GB VRAM. 70B-Modelle erfordern entweder mehrere Grafikkarten, Apple Silicon mit mindestens 64 GB Unified Memory oder eine APU wie den AMD Ryzen AI Max mit ausreichend RAM. Die Kaufberatung hilft Dir bei der Auswahl.

Kosten: Größere Modelle brauchen teurere Hardware. Eine Grafikkarte mit 8 GB VRAM kostet etwa 300 Euro, eine mit 24 GB VRAM etwa 2000 Euro. Apple Silicon mit 64 GB Unified Memory ist ein Mac Studio oder Mac Book Pro, der schnell mehrere tausend Euro kostet. Quantisierung hilft Dir, mit günstigerer Hardware auszukommen, weil sie den Speicherbedarf drastisch senkt.

Sicherheit: Bei lokal betriebenen Modellen bleiben Deine Daten auf Deinem Rechner. Keine Anfrage geht an einen Server, keine Daten verlassen Dein System. Die Modellgröße spielt hierfür keine Rolle, wichtig ist nur, dass das Modell lokal läuft und keine externen APIs aufruft. Mehr dazu unter Was ist lokale KI?.

FAQ: Modellgröße und Speicherbedarf - Typische Fragen

Was bedeutet 7B bei einem KI-Modell?

7B steht für 7 Milliarden Parameter. Das sind die Werte, die das Modell während des Trainings gelernt hat. Die B-Zahl sagt, wie viele Parameter das Modell hat, aber nicht, wie viel Speicher es braucht. Das hängt vom Format ab. Im FP16-Format braucht ein 7B-Modell 14 GB, im Q4-Format 3,5 GB.

Wie berechne ich den Speicherbedarf eines Modells?

Die Formel lautet: Parameterzahl mal Byte pro Parameter. Im FP16-Format sind das 2 Byte pro Parameter, im Q8-Format 1 Byte, im Q4-Format 0,5 Byte. Ein 7B-Modell braucht in FP16 also 7 Milliarden mal 2 Byte, also etwa 14 GB. Dazu kommen KV-Cache und Overhead.

Warum ist mein 7B-Modell nur 4 GB groß?

Weil es quantisiert ist. Die 4 GB entsprechen einem 4-bit-quantisierten Modell, bei dem jeder Parameter nur 0,5 Byte belegt. Die B-Zahl gibt die Anzahl der Parameter an, nicht die Dateigröße. Ohne Quantisierung wäre das Modell etwa 14 GB groß.

Was ist der Unterschied zwischen FP16 und Q4?

FP16 ist das Standardformat mit 16-bit Genauigkeit, also 2 Byte pro Parameter. Q4 ist ein 4-bit-quantisiertes Format mit 0,5 Byte pro Parameter. Q4 braucht ein Viertel des Speichers von FP16, bei einem leichten Qualitätsverlust, der für die meisten Anwendungen kaum spürbar ist.

Brauche ich den empfohlenen VRAM oder reicht die Modellgröße?

Der empfohlene VRAM ist immer größer als die reine Modellgröße, weil er Puffer für KV-Cache, Framework und Betriebssystem enthält. Wenn Du nur die Modellgröße als VRAM hast, kann das Modell laden, aber bei längeren Kontexten abstürzen. Plane immer etwa 20 bis 30 Prozent mehr ein.

Was ist der KV-Cache und warum braucht er Speicher?

Der KV-Cache speichert Zwischenergebnisse während der Inferenz, damit das Modell nicht bei jedem neuen Wort alles neu berechnen muss. Er wächst mit der Kontextlänge. Bei einer Kontextlänge von 8192 Tokens kann der KV-Cache je nach Modell mehrere Gigabyte belegen. Mehr dazu im Artikel zur Kontextlänge.

Wie viel VRAM brauche ich für ein 13B-Modell?

Ein 13B-Modell braucht im Q4-Format etwa 6,5 GB für die Gewichte. Mit Puffer für KV-Cache und Overhead empfiehlt sich 12 GB VRAM. Im FP16-Format braucht es 26 GB, was nur mit High-End-Hardware oder Apple Silicon mit ausreichend Unified Memory machbar ist.

Kann ich ein 70B-Modell auf einer Consumer-GPU laufen lassen?

Auf einer einzelnen Consumer-GPU nicht. Eine RTX 4090 hat 24 GB VRAM, ein 70B-Modell braucht im Q4-Format etwa 35 GB plus Puffer. Du brauchst entweder zwei Grafikkarten, Apple Silicon mit mindestens 64 GB Unified Memory oder eine APU wie den AMD Ryzen AI Max mit ausreichend RAM.

Was bedeutet GGUF?

GGUF ist ein Dateiformat für quantisierte Modelle, das von Ollama und llama.cpp genutzt wird. Eine GGUF-Datei enthält die Modellgewichte im quantisierten Format, oft in 4-bit oder 8-bit. Die Dateigröße der GGUF-Datei ist ein guter Indikator für den Speicherbedarf der Modellgewichte.

Ist ein größeres Modell immer besser?

Nicht unbedingt. Ein größeres Modell kann komplexere Aufgaben lösen, braucht aber mehr Speicher und ist langsamer. Für viele Aufgaben reicht ein 7B- oder 8B-Modell völlig aus. Wenn Du auf Deiner Hardware nur ein kleineres Modell flüssig betreiben kannst, ist das oft die bessere Wahl als ein großes Modell, das quälend langsam läuft.

Wie finde ich die Größe eines Modells auf Hugging Face?

Auf Hugging Face siehst Du die Parameterzahl in der Modellbeschreibung. Die Dateigrößen findest Du im Abschnitt Files. Achte auf die Dateinamen, die oft das Format angeben, z. B. FP16, Q8_0 oder Q4_K_M. Die Dateigröße entspricht dem Speicherbedarf der Modellgewichte in diesem Format.

Was bedeutet Q4_K_M?

Q4_K_M ist eine spezifische Quantisierungsmethode im GGUF-Format. Q4 steht für 4-bit, K für eine bestimmte Methode der Quantisierung und M für Medium, also ein Mittelweg zwischen Qualität und Größe. Es ist die häufigste Wahl für ein gutes Gleichgewicht aus Speicherbedarf und Modellqualität.

Warum braucht mein Modell mehr Speicher als die Datei groß ist?

Weil während des Betriebs noch der KV-Cache und der Framework-Overhead dazukommen. Die Datei enthält nur die Modellgewichte. Wenn Du das Modell ausführst, belegt der KV-Cache zusätzlichen Speicher, der mit der Kontextlänge wächst. Plane etwa 20 bis 30 Prozent mehr Speicher ein als die Datei groß ist.

Quellen und weiterführende Literatur

  • Hugging Face Dokumentation zu Modellformaten und Quantisierung
  • llama.cpp und GGUF-Spezifikation
  • Ollama Dokumentation zu Modellverwaltung
  • Erfahrungen aus der lokalen KI-Community
  • Quantisierung für Details zur Reduzierung der Modellgröße
Zurück zum KI Blog
Share:

Ähnliche Beiträge