Skip to content
BotServBotServ
GPUKaufberatungKI-HardwareOllamaVRAM

GPU für lokale KI kaufen

Die richtige GPU für Ollama, llama.cpp und lokale KI kaufen. VRAM, Bandbreite, Preis und Kaufkriterien.

S

schutzgeist

4 min read
GPU für lokale KI kaufen

GPU für lokale KI kaufen

Was dieser Artikel über den GPU-Kauf für lokale KI behandelt

  • Welche Rolle VRAM beim Kauf spielt.
  • Wie sich GPU-Generationen und Architekturen unterscheiden.
  • Welche GPUs für verschiedene Modellgrössen geeignet sind.
  • Was man bei gebrauchten oder Consumer-GPUs beachten muss.
  • Typische Kaufkriterien und Fehler.

Einleitung: GPU für lokale KI kaufen

Die GPU ist die wichtigste Komponente, wenn lokale KI-Modelle schnell laufen sollen. Sie beschleunigt das Laden und die Inferenz von Sprach-, Bild- und Embedding-Modellen. Die Wahl der richtigen GPU hängt vor allem von der Modellgrösse, der gewünschten Geschwindigkeit und dem Budget ab. VRAM ist dabei meist der entscheidende Faktor.

Dieser Artikel hilft, die passende GPU für lokale KI-Projekte zu finden, ohne dabei in überteuerte oder ungeeignete Hardware zu investieren.

Wichtige Begriffe

  • VRAM: Videospeicher der GPU, bestimmt, welche Modellgrössen passen.
  • CUDA: Nvidia-Programmierplattform, wird von den meisten KI-Tools unterstützt.
  • ROCm: AMDs Open-Source-Gegenstück zu CUDA.
  • Tensor-Cores: Spezielle Recheneinheiten für KI bei Nvidia RTX und Datacenter-GPUs.
  • Memory-Bandbreite: Bestimmt, wie schnell Daten in die GPU geladen werden.
  • FP16: Halbgenaue Berechnung, spart VRAM und ist bei KI meist ausreichend.
  • Quantisierung: Reduktion der Modellpräzision, um grössere Modelle in weniger VRAM zu laden.

Warum ist VRAM so wichtig?

Ein Modell muss komplett in den VRAM passen. Bei 4-Bit-Quantisierung gilt eine grobe Faustformel:

  • 7B-Modell: ca. 4 bis 6 GB VRAM.
  • 13B-Modell: ca. 8 bis 10 GB VRAM.
  • 30B-Modell: ca. 20 GB VRAM.
  • 70B-Modell: ca. 40 GB VRAM.

Wer also ein 13B-Modell in 4 Bit nutzen will, braucht mindestens 8 GB VRAM. Für 30B reichen 12 GB nicht aus.

Consumer-GPUs für lokale KI

Nvidia GeForce RTX 3060 12 GB

  • Günstiger Einstieg.
  • 12 GB VRAM ermöglichen 7B- und kleinere 13B-Modelle.
  • Langsamer als neuere Generationen.

Nvidia GeForce RTX 4060 Ti 16 GB

  • Modern, sparsam.
  • 16 GB VRAM passen für 13B- und kleinere 30B-Modelle.
  • Niedrigere Bandbreite als 4070 Ti oder 3090.

Nvidia GeForce RTX 4070 Ti Super 16 GB

  • Gute Performance bei moderaten Preisen.
  • 16 GB VRAM und hohe Bandbreite.
  • Ideal für 13B und 30B-Modelle mit Quantisierung.

Nvidia GeForce RTX 3090 / 3090 Ti 24 GB

  • Sehr viel VRAM für den Preis.
  • Beliebt bei KI-Enthusiasten.
  • Hoher Stromverbrauch, oft gebraucht erhältlich.

Nvidia GeForce RTX 4090 24 GB

  • Aktuell schnellste Consumer-GPU.
  • 24 GB VRAM passen für 30B und mehr.
  • Teuer, aber extrem schnell.

AMD Radeon RX 7900 XTX 24 GB

  • Viel VRAM für einen guten Preis.
  • ROCm-Unterstützung verbessert sich, aber nicht so ausgereift wie CUDA.
  • Bei vielen Tools experimentell.

Gebrauchte GPUs

  • RTX 2080 Ti mit 11 GB: Günstig, aber keine Tensor-Cores der neueren Generation.
  • RTX 3090 mit 24 GB: Sehr beliebt gebraucht, Achtung vor Mining-Einsatz.
  • Titan X Pascal mit 12 GB: Veraltet, aber für 7B-Modelle noch brauchbar.
  • Quadro P6000 mit 24 GB: Professionelle Karte, oft günstig gebraucht, aber langsam.

Bei Gebrauchtgeräten auf Staub, Lüfterzustand und evtl. Mining-Vergangenheit achten.

Server- und Datacenter-GPUs

  • Nvidia A100 40/80 GB: Perfekt für grosse Modelle, sehr teuer.
  • Nvidia A40 48 GB: Gute Alternative zur A100.
  • Nvidia L40S 48 GB: Moderne Inferenzkarte.
  • Nvidia RTX A6000 48 GB: Pro-Variante mit viel VRAM.
  • AMD Instinct MI100/MI210: Mit ROCm nutzbar, aber ökosystemärmer.

Wichtige Kaufkriterien

  1. VRAM-Grösse: Primärer Engpass.
  2. Memory-Bandbreite: Beeinflusst Inferenzgeschwindigkeit.
  3. CUDA-Core- oder Stream-Prozessor-Anzahl: Mehr ist schneller.
  4. Stromverbrauch: Netzteil und Kühlung beachten.
  5. Treiberunterstützung: Nvidia meist am besten, AMD variiert.
  6. Platz im Gehäuse: Lange oder dicke GPUs passen nicht überall.
  7. PCIe-Lanes: x16 ideal, x8 funktioniert oft auch.
  8. Preis pro GB VRAM: Hilft beim Vergleich.

Was bei Nvidia beachten?

  • Treiber und CUDA Toolkit installieren.
  • nvidia-smi zeigt Auslastung und VRAM an.
  • Für Container --gpus all aktivieren.
  • Ollama, llama.cpp und vLLM unterstützen Nvidia sehr gut.

Was bei AMD beachten?

  • ROCm muss passen, nicht alle GPUs unterstützt.
  • Ältere GCN-GPUs wie HD 7870 XT werden nicht von ROCm unterstützt.
  • llama.cpp mit Vulkan kann als Fallback dienen, ist aber langsamer.
  • Unter Linux meist besserer Support als unter Windows.

Apple Silicon

  • Keine dedizierte GPU nötig, Unified Memory funktioniert wie VRAM.
  • 16 GB RAM reichen für kleine 7B-Modelle.
  • 32 bis 64 GB Unified Memory ermöglichen grössere Modelle.
  • Metal-Backend von llama.cpp und Ollama ist gut optimiert.

Preis-Leistungs-Empfehlungen

BudgetEmpfohlene GPU
Bis 300 EuroRTX 3060 12 GB gebraucht
300 bis 600 EuroRTX 4060 Ti 16 GB
600 bis 1000 EuroRTX 4070 Ti Super 16 GB
1000 bis 1500 EuroRTX 3090 24 GB gebraucht oder RX 7900 XTX
Über 1500 EuroRTX 4090 24 GB oder A6000

Typische Kauffehler

  • Zu wenig VRAM: 8 GB reichen kaum für 13B-Modelle.
  • Alte GPU ohne Tensor-Cores: Rechenleistung für KI fehlt.
  • AMD ohne ROCm-Check: Läuft eventuell gar nicht.
  • Server-GPU ohne Kühlung: Passiv gekühlte Karten brauchen Gehäuselüfter.
  • Viel VRAM aber schmale Bandbreite: Grosses Modell passt, läuft aber langsam.
  • Mining-GPU kaufen: Hohe Auslastung und Abnutzung.

FAQ: GPU für lokale KI

Brauche ich eine GPU für Ollama? Nein, Ollama läuft auch auf der CPU. Mit GPU ist es aber deutlich schneller.

Welche GPU für 7B-Modelle? Mindestens 6 GB VRAM, besser 8 bis 12 GB.

Welche GPU für 70B-Modelle? Mindestens 40 GB VRAM, also RTX 3090 geht bei 4 Bit gerade noch, ideal sind A100 oder A6000.

Ist eine gebrauchte GPU sinnvoll? Ja, besonders die RTX 3090 bietet viel VRAM für vergleichsweise wenig Geld.

Sind AMD-GPUs für KI geeignet? Mit viel VRAM und passendem ROCm-Support ja, aber das Ökosystem ist nicht so ausgereift wie bei Nvidia.

Quellen und weiterführende Literatur

Zusammenfassung: GPU für lokale KI kaufen

Die richtige GPU für lokale KI wird primär nach VRAM-Grösse ausgewählt. Consumer-Karten von Nvidia bieten das beste Ökosystem, aber AMD und Apple Silicon sind je nach Budget und Anwendung ebenfalls Optionen. Gebrauchte Karten mit viel VRAM wie die RTX 3090 sind beliebt, sollten aber auf Verschleiß geprüft werden. Wer VRAM, Bandbreite, Stromverbrauch und Treiberunterstützung im Blick behält, findet die passende GPU für Ollama, llama.cpp und andere lokale KI-Tools.

Zurück zum KI Blog
Share:

Ähnliche Beiträge