Skip to content
BotServBotServ
VRAMRechnerKI-HardwareOllamaGPUQuantisierungTools

VRAM-Rechner für lokale KI

Wie Du den VRAM-Bedarf für KI-Modelle berechnest. Parameter, Quantisierung, Kontextlänge und praktische Beispiele.

S

schutzgeist

3 min read
VRAM-Bedarf für lokale KI-Modelle berechnen

VRAM-Rechner für lokale KI

Was dieser Artikel über den VRAM-Rechner behandelt

  • Wie viel VRAM ein Modell für das Laden und die Inferenz braucht.
  • Welche Faktoren den VRAM-Verbrauch beeinflussen.
  • Wie Quantisierung und Kontextlänge zusammenspielen.
  • Praktische Faustformeln und Beispiele.

Einleitung: VRAM für lokale KI berechnen

Wer Sprachmodelle auf der Grafikkarte laufen lassen will, muss wissen, wie viel Videospeicher nötig ist. Zu wenig VRAM verhindert das Laden des Modells oder macht es sehr langsam. Zu viel VRAM ist nicht schlimm, aber teuer. Ein VRAM-Rechner hilft, den Bedarf vor der Hardware-Anschaffung oder Konfiguration abzuschätzen.

VRAM ist meist enger als Arbeitsspeicher, wenn GPU-Offloading genutzt wird. Gerade große Modelle und lange Kontexte füllen den Grafikspeicher schnell.

Warum brauche ich einen VRAM-Rechner?

Ohne Überschlagsrechnung weißt Du nicht, ob Deine Grafikkarte ein bestimmtes Modell überhaupt laden kann. Der Rechner berücksichtigt Modellgröße, Quantisierung, Kontextlänge und Overhead. Damit vermeidest Du enttäuschende Versuche und teure Fehlkäufe.

VRAM-Bedarf kurz erklärt

Der VRAM-Verbrauch setzt sich aus mehreren Teilen zusammen:

  • Modellgewichte: Die gespeicherten Parameter, je nach Quantisierung pro Parameter 1 bis 4 Bytes.
  • KV-Cache: Zwischenspeicher für bereits verarbeitete Token.
  • Aktivierungen: Temporäre Werte während der Berechnung.
  • Overhead: Reservierter Speicher für Bibliotheken und Treiber.

Für die Faustformel gilt: Modellgröße in Milliarden Parametern multipliziert mit Bytes pro Parameter ergibt ungefähr den Speicherbedarf. Dazu kommen Cache und Overhead.

Für wen ist der VRAM-Rechner gedacht?

  • Für Käufer, die überlegen, ob eine GPU für ein bestimmtes Modell reicht.
  • Für Einsteiger, die verstehen wollen, warum ein Modell nicht lädt.
  • Für Nutzer, die Modelle mit Quantisierung laufen lassen wollen.
  • Für Entwickler, die das richtige Modell für ihre Hardware wählen.

Wichtige Begriffe rund um VRAM

  • VRAM: Videospeicher der Grafikkarte.
  • Parameter: Einzelne Werte im KI-Modell.
  • Quantisierung: Reduktion der Genauigkeit pro Parameter.
  • KV-Cache: Speicher für Schlüssel-Wert-Paare in der Textgenerierung.
  • Batch Size: Anzahl gleichzeitig verarbeiteter Anfragen.
  • Context Length: Anzahl Token, die das Modell berücksichtigen kann.

Praxisbeispiele für VRAM-Berechnung

7B-Modell im Q4-Format

  • Parameter: 7 Milliarden
  • Bytes pro Parameter: ca. 0,5 bei Q4
  • Modellgewichte: ~3,5 GB
  • KV-Cache und Overhead: ~1,5 bis 2 GB
  • Empfohlener VRAM: 6 bis 8 GB

13B-Modell im Q8-Format

  • Parameter: 13 Milliarden
  • Bytes pro Parameter: ca. 1,0
  • Modellgewichte: ~13 GB
  • KV-Cache und Overhead: ~3 bis 4 GB
  • Empfohlener VRAM: 18 bis 20 GB

70B-Modell im Q4-Format

  • Parameter: 70 Milliarden
  • Bytes pro Parameter: ca. 0,5
  • Modellgewichte: ~35 GB
  • KV-Cache und Overhead: ~8 bis 10 GB
  • Empfohlener VRAM: 48 GB oder mehr

Typische Stolpersteine bei der VRAM-Planung

  • Nur die Modellgröße betrachten: KV-Cache und Overhead können mehrere Gigabyte beanspruchen.
  • Kontextlänge vergessen: Lange Kontexte vergrößern den Cache erheblich.
  • Batch Size überschätzen: Mehr parallele Anfragen brauchen mehr Speicher.
  • Quantisierung falsch verstehen: Q4 ist klein, aber nicht jedes Modell bietet alle Qualitätsstufen.
  • Gemeinsamer VRAM: Bei mehreren Modellen oder Diensten addiert sich der Bedarf.

FAQ: VRAM-Rechner

Wie viel VRAM brauche ich für Ollama? Das hängt vom Modell ab. Ein 7B-Modell im Q4-Format läuft mit 6 bis 8 GB, ein 13B-Modell im Q8-Format braucht etwa 18 bis 20 GB.

Was passiert, wenn nicht genug VRAM vorhanden ist? Das Modell wird langsamer, flüchtet in den Arbeitsspeicher oder lässt sich gar nicht laden.

Ist VRAM wichtiger als GPU-Takt? Für große Sprachmodelle ist oft VRAM wichtiger. Für Bildgenerierung sind beides entscheidende Faktoren.

Kann ich VRAM sparen, indem ich das Modell quantisiere? Ja. Q4 reduziert den Speicherbedarf etwa um die Hälfte gegenüber F16.

Sollte ich eine GPU mit mehr VRAM kaufen, als ich derzeit brauche? Ein kleiner Puffer ist sinnvoll, da Modelle größer werden und längere Kontexte mehr Speicher brauchen.

Quellen und weiterführende Literatur

Zusammenfassung: VRAM-Rechner für lokale KI

Der VRAM-Bedarf richtet sich nach Modellgröße, Quantisierung, Kontextlänge und Overhead. Faustformeln helfen, den ungefähren Bedarf zu ermitteln. Für kleinere Modelle reichen 8 GB, für größere Modelle im Q8-Format eher 20 GB oder mehr. Wer den Bedarf vor der Anschaffung prüft, vermeidet teure Fehlkäufe und enttäuschende Performance.

Zurück zum KI Blog
Share:

Ähnliche Beiträge