Skip to content
BotServBotServ
SpeicherbandbreiteGB/sKI-HardwareVRAMRAMApple SiliconPerformance

Speicherbandbreite: Der Flaschenhals bei lokaler KI

Was ist Speicherbandbreite und warum ist sie der wichtigste Faktor für KI-Inferenz? GB/s erklärt, mit Vergleich von RAM, VRAM und Apple Silicon.

S

schutzgeist

12 min read
Speicherbandbreite als Flaschenhals bei KI-Inferenz

Speicherbandbreite: Der Flaschenhals bei lokaler KI

Was dieser Artikel über Speicherbandbreite behandelt

  • Was Speicherbandbreite eigentlich ist und warum sie in GB/s gemessen wird
  • Warum bei der KI-Inferenz nicht der Prozessor, sondern der Speicher das Tempo bestimmt
  • Wie viel Bandbreite verschiedene Speichertypen wie DDR5, GDDR6, GDDR6X und HBM bieten
  • Warum Apple Silicon für lokale KI überraschend gut abschneidet
  • Praktische Tipps, mit denen Du die Bandbreite Deiner Hardware optimal ausnutzt

Einleitung: Speicherbandbreite verständlich erklärt

Wenn Du Dich mit lokaler KI beschäftigst, stolperst Du schnell über Begriffe wie VRAM, Parameter oder Quantisierung. Ein Begriff wird dabei oft unterschätzt, obwohl er über die tatsächliche Geschwindigkeit Deiner KI entscheidet: die Speicherbandbreite. In diesem Artikel erfährst Du, was Speicherbandbreite bedeutet, warum sie bei der KI-Inferenz der wichtigste Faktor ist und wie Du die richtigen Hardware-Entscheidungen triffst.

Die meisten Anleitungen konzentrieren sich auf die Frage, wie viel VRAM Du brauchst, um ein Modell überhaupt zu laden. Das ist wichtig, reicht aber nicht aus. Ein Modell, das gerade so in den VRAM passt, kann trotzdem quälend langsam laufen, wenn die Bandbreite nicht ausreicht, um die Gewichte schnell genug zum Prozessor zu transportieren. Genau hier liegt der Schlüssel zu performanter lokaler KI.

Warum brauche ich Speicherbandbreite-Verständnis?

Stell Dir vor, Du hast zwei Grafikkarten vor Dir. Beide haben 12 GB VRAM. Beide können ein 7B-Modell laden. Auf dem Papier sehen sie identisch aus. In der Praxis erzeugt die eine Karte 40 Tokens pro Sekunde, die andere nur 13. Der Unterschied? Speicherbandbreite.

Die erste Karte liefert 360 GB/s, die zweite nur 120 GB/s. Drei Mal so viel Bandbreite bedeutet drei Mal so viele Tokens pro Sekunde. Kein anderer Faktor, weder die Anzahl der Shader-Einheiten noch der Takt, hat bei der KI-Inferenz einen so direkten Einfluss auf die Geschwindigkeit. Wer beim Hardware-Kauf nur auf die VRAM-Größe achtet, kauft blind.

Dieses Wissen hilft Dir in mehreren Situationen: beim Kauf einer neuen Grafikkarte, beim Vergleich von Mac und PC, bei der Entscheidung zwischen CPU- und GPU-Inferenz und beim Verständnis, warum ein scheinbar schwacher Chip ein großes Modell erstaunlich schnell verarbeitet.

Speicherbandbreite kurz erklärt

Speicherbandbreite beschreibt, wie viele Daten pro Sekunde zwischen dem Speicher und dem Prozessor bewegt werden können. Die Einheit ist Gigabyte pro Sekunde, abgekürzt GB/s. Eine höhere Bandbreite bedeutet, dass mehr Daten in der gleichen Zeit den Weg vom Speicher zum Prozessor schaffen.

Die einfachste Analogie ist eine Autobahn. Je mehr Spuren eine Autobahn hat, desto mehr Autos können gleichzeitig fahren. Die Geschwindigkeit der Autos entspricht dem Takt des Speichers, die Anzahl der Spuren dem Speicherinterface. Beide zusammen ergeben die Bandbreite. Eine breite Autobahn mit vielen Spuren transportiert mehr Autos pro Sekunde als eine enge Landstraße, selbst wenn beide das gleiche Tempolimit haben.

Bei der KI-Inferenz müssen für jedes einzelne Token, das das Modell erzeugt, alle Gewichte aus dem Speicher gelesen werden. Ein 7B-Modell in 16-bit hat rund 14 GB. Für jedes Token müssen also 14 GB bewegt werden. Bei 100 GB/s Bandbreite schafft der Speicher theoretisch etwa 7 Tokens pro Sekunde. Bei 400 GB/s sind es 28. Die Mathematik ist einfach, die Auswirkungen sind enorm.

Für wen ist dieses Wissen gedacht?

Dieser Artikel richtet sich an Anfänger, die lokale KI ausprobieren möchten und verstehen wollen, warum ihre Hardware schnell oder langsam ist. Wenn Du gerade überlegst, ob Du eine Grafikkarte kaufen sollst oder lieber einen Mac mit Apple Silicon nutzt, hilft Dir dieses Wissen bei der Entscheidung. Auch wenn Du bereits Modelle laufen lässt und Dich fragst, warum ein Modell auf Deinem System träge wirkt, findest Du hier die Erklärung.

Vorkenntnisse brauchst Du keine. Wenn Du die Grundlagen von KI-Hardware kennst und den Unterschied zwischen CPU und GPU grob verstanden hast, ist das hilfreich, aber nicht zwingend nötig.

Wichtige Begriffe rund um Speicherbandbreite

BegriffBedeutung
SpeicherbandbreiteDatenmenge pro Sekunde zwischen Speicher und Prozessor, gemessen in GB/s
GB/sGigabyte pro Sekunde, die Standard-Einheit für Speicherbandbreite
TB/sTerabyte pro Sekunde, 1000 GB/s, bei High-End-GPUs und HBM-Speicher
SpeicherinterfaceDie Datenpfad-Breite in Bit, z.B. 128-bit, 256-bit oder 384-bit
GDDR6Grafikspeicher-Standard, verbreitet bei Consumer-GPUs, bis ca. 768 GB/s
GDDR6XWeiterentwicklung von GDDR6, von Nvidia eingesetzt, bis ca. 1008 GB/s
HBMHigh Bandwidth Memory, gestapelter Speicher für professionelle GPUs, über 3 TB/s
LPDDRLow-Power-DDR-Speicher, in Apple Silicon und Laptops verbaut
DDR5Aktuelle Generation des Arbeitsspeichers für PCs und Server
Bandbreite pro WattEffizienz-Metrik, wichtig für mobile Geräte und Laptops

Warum ist Speicherbandbreite so wichtig für KI?

Die meisten Menschen glauben, bei der KI-Inferenz sei die Rechenleistung der Engpass. Das stimmt für das Training von Modellen, aber nicht für die Inferenz, also das Ausführen eines fertigen Modells. Bei der Inferenz ist das Problem nicht das Rechnen, sondern das Bewegen von Daten.

Der Grund ist die Architektur der Modelle. Ein Sprachmodell besteht aus Milliarden von Parametern, den Gewichten. Für jedes Token, das das Modell als nächstes Wort vorhersagt, müssen alle Gewichte aus dem Speicher gelesen werden. Bei einem 7B-Modell in 16-bit-Genauigkeit sind das rund 14 GB pro Token. Die Rechenoperationen selbst sind vergleichsweise schnell, aber der Speicher muss die Gewichte liefern, bevor gerechnet werden kann.

Das bedeutet: Die Geschwindigkeit der Inferenz wird fast ausschließlich davon bestimmt, wie schnell der Speicher die Gewichte zum Prozessor transportiert. Eine GPU mit massiver Rechenleistung aber geringer Bandbreite wartet ständig auf neue Daten. Die Shader-Einheiten stehen still, während der Speicher liefert. Deshalb ist Speicherbandbreite der Flaschenhals, nicht die TFLOPS.

Wer mehr zur Rolle von VRAM im Detail wissen möchte, findet im Artikel zu RAM vs. VRAM weitere Hintergrundinformationen.

Bandbreiten im Vergleich

Um ein Gefühl für die Größenordnungen zu bekommen, lohnt sich ein Blick auf die typischen Bandbreiten gängiger Speichertypen.

SpeichertypHardware-BeispielBandbreite (ca.)
DDR4 RAMStandard-Desktop-PC25 bis 50 GB/s
DDR5 RAMModerner PC, Server60 bis 90 GB/s
GDDR6RTX 3060, RTX 4060360 bis 448 GB/s
GDDR6XRTX 40901008 GB/s
HBM3Nvidia H100über 3000 GB/s
LPDDR5Apple M2 (unified)100 GB/s
LPDDR5Apple M2 Pro200 GB/s
LPDDR5Apple M2 Ultra800 GB/s
LPDDR5XApple M3 Max400 GB/s
LPDDR5XApple M4 Max546 GB/s

Die Tabelle zeigt, warum eine Grafikkarte selbst mit vergleichsweise wenig VRAM ein Modell oft schneller verarbeitet als ein PC mit viel normalem RAM. GDDR6 bietet die vier- bis zehnfache Bandbreite von DDR5. HBM3 sprengt dann jede Vorstellung und liefert über 3 TB/s, kostet aber auch ein Vielfaches.

Interessant ist die Position von Apple Silicon. Die M2 Ultra erreicht 800 GB/s, der M4 Max über 500 GB/s. Das ist deutlich mehr als Consumer-Grafikkarten wie die RTX 3060 bieten, und es reicht aus, um große Modelle erstaunlich flüssig laufen zu lassen. Mehr dazu im Abschnitt zu Apple Silicon.

Was bedeutet das in der Praxis?

Nehmen wir ein konkretes Beispiel. Du möchtest ein 7B-Modell in 16-bit-Genauigkeit ausführen. Das Modell belegt rund 14 GB im Speicher. Für jedes Token müssen diese 14 GB gelesen werden. Die theoretische Token-Rate ergibt sich aus der Bandbreite geteilt durch die Modellgröße.

HardwareBandbreiteTheoretische Tokens/s
DDR4-PC40 GB/sca. 2,8
DDR5-PC80 GB/sca. 5,7
RTX 3060360 GB/sca. 25,7
RTX 40901008 GB/sca. 72
Apple M2 Ultra800 GB/sca. 57
Nvidia H1003000 GB/sca. 214

In der Praxis erreichst Du diese theoretischen Werte nicht vollständig, da Overhead, KV-Cache und andere Faktoren Performance kosten. Die Größenordnungen stimmen aber. Auf einem DDR4-PC wartest Du mehrere Sekunden auf einen Satz, während eine RTX 4090 flüssig Text produziert.

Mit Quantisierung kannst Du die Modellgröße reduzieren. Ein 7B-Modell in 4-bit belegt nur noch rund 3,5 GB. Bei 360 GB/s Bandbreite steigt die theoretische Rate auf über 100 Tokens pro Sekunde. Quantisierung ist also nicht nur ein Werkzeug, um VRAM zu sparen, sondern auch, um die Bandbreite effizienter zu nutzen.

Apple Silicon und Bandbreite

Apple Silicon nimmt eine Sonderstellung ein. Macs mit M-, Pro-, Max- und Ultra-Chips nutzen einen Unified-Memory-Ansatz, bei dem CPU und GPU denselben Speicher teilen. Der Speicher ist LPDDR5 oder LPDDR5X, und die Bandbreiten sind für Consumer-Hardware bemerkenswert hoch.

Ein M2 Ultra liefert 800 GB/s, ein M3 Max 400 GB/s, ein M4 Max 546 GB/s. Das liegt an der breiten Speicheranbindung, die Apple direkt im Chip integriert hat. Während eine RTX 4060 mit 128-bit-Interface auf 272 GB/s kommt, nutzt Apple weitaus breitere Interfaces, um die LPDDR-Chips anzubinden.

Für lokale KI bedeutet das: Ein Mac Studio mit M2 Ultra und 192 GB unified Memory kann ein 70B-Modell laden und mit akzeptabler Geschwindigkeit ausführen. Keine Consumer-Grafikkarte bietet 192 GB VRAM. Die Kombination aus großem unified Memory und hoher Bandbreite macht Macs zu einer attraktiven Plattform für große Modelle, wenn Dir nicht die absolute Spitzenperformance einer RTX 4090 wichtig ist, sondern die Fähigkeit, große Modelle überhaupt laufen zu lassen.

Mehr Details zum Konzept findest Du im Artikel über Unified Memory.

Wie verbessere ich meine Bandbreite?

Du kannst die Bandbreite Deiner Hardware nicht durch Software-Tuning verdoppeln. Sie ist eine physikalische Eigenschaft des Speichers und des Speicherinterfaces. Was Du tun kannst, ist die vorhandene Bandbreite optimal zu nutzen und bei Neuanschaffungen die richtigen Entscheidungen zu treffen.

Nutze die GPU statt der CPU. CPU-Inferenz auf normalem RAM ist langsam, weil DDR5 nur 60 bis 90 GB/s bietet. Selbst eine günstige Grafikkarte mit GDDR6 ist drei- bis fünfmal schneller. Wenn Du GPU-Offloading nutzt, lädst Du die Modellgewichte in den VRAM und profitierst von der höheren Bandbreite.

Wähle schnellen Arbeitsspeicher. Wenn Du auf CPU-Inferenz angewiesen bist, nutze DDR5 statt DDR4. Dual-Channel-Betrieb ist Pflicht, da er die Bandbreite im Vergleich zu Single-Channel verdoppelt. Bei DDR5-5600 in Dual-Channel erreichst Du rund 90 GB/s.

Setze auf Apple Silicon für große Modelle. Wenn Du Modelle jenseits von 24 GB betreiben willst, ist ein Mac mit M-Pro, M-Max oder M-Ultra oft die wirtschaftlichste Lösung. Die hohe Bandbreite des unified Memory sorgt dafür, dass auch große Modelle brauchbare Geschwindigkeiten erreichen.

Vermeide Shared-Memory-APUs für große Modelle. Integrierte Grafiklösungen teilen sich den RAM mit der CPU und bieten keine eigene Bandbreite. Für kleine Modelle ist das akzeptabel, für alles ab 7B wird es unkomfortabel. Eine dedizierte Grafikkarte ist hier die bessere Wahl.

Quantisieren statt aufrüsten. Wenn Deine Bandbreite begrenzt ist, reduziere die Modellgröße durch Quantisierung. Ein 4-bit-Modell benötigt ein Viertel der Bandbreite eines 16-bit-Modells. Das ist oft der einfachste Weg zu mehr Tokens pro Sekunde.

Achte auf das Speicherinterface beim GPU-Kauf. Eine 128-bit-Karte bietet weniger Bandbreite als eine 256-bit-Karte bei gleichem Speichertyp. Die RTX 4060 mit 128-bit erreicht 272 GB/s, die RTX 4070 Ti mit 192-bit kommt auf 504 GB/s. Das Interface ist ein besserer Indikator als die reine VRAM-Größe.

Weitere Entscheidungshilfen findest Du in der Kaufberatung und im Artikel zu RAM und VRAM Anforderungen.

Typische Stolpersteine bei der Speicherbandbreite

  1. VRAM-Größe gleichgesetzt mit Geschwindigkeit. 16 GB VRAM sagen nichts über die Bandbreite aus. Eine 16-GB-Karte mit 128-bit-Interface ist deutlich langsamer als eine 12-GB-Karte mit 192-bit-Interface.

  2. TFLOPS als Kaufkriterium. Rechenleistung ist beim Training wichtig, bei der Inferenz fast irrelevant. Eine Karte mit weniger TFLOPS aber höherer Bandbreite ist für lokale KI schneller.

  3. Single-Channel-RAM unbeachtet gelassen. Viele PCs werden mit nur einem RAM-Modul ausgeliefert. Das halbiert die Bandbreite. Ein zweites Modul kostet wenig und verdoppelt die Performance bei CPU-Inferenz.

  4. Glaube, Software könne Bandbreite ersetzen. Optimierungen wie Flash-Attention helfen, aber sie können die physikalische Bandbreite nicht erhöhen. Wenn der Speicher langsam ist, bleibt die Inferenz langsam.

  5. APUs als GPU-Ersatz überschätzt. Integrierte Grafik nutzt den System-RAM mit DDR-Bandbreite. Für ernsthafte KI-Inferenz ist das nicht ausreichend.

  6. Vergleich von Apple Silicon und Nvidia-GPUs nur über VRAM. Ein Mac mit 64 GB und 400 GB/s ist nicht direkt mit einer RTX 4090 mit 24 GB und 1008 GB/s vergleichbar. Beide haben unterschiedliche Stärken: Der Mac fasst größere Modelle, die Nvidia-Karte verarbeitet kleinere schneller.

  7. Quantisierung als Qualitätsverlust abgetan. 4-bit- und 8-bit-Quantisierung reduzieren die Bandbreiten-Last massiv bei minimalem Qualitätsverlust. Wer sie ignoriert, verschenkt Performance.

  8. KV-Cache vergessen. Bei langen Kontexten wächst der KV-Cache im VRAM und konsumiert Bandbreite. Das kann die Token-Rate spürbar senken, besonders bei kleinen Grafikkarten.

Hardware, Kosten und Sicherheit bei Speicherbandbreite

Die Bandbreite korreliert direkt mit den Kosten. DDR5-Module sind günstig, bieten aber wenig Bandbreite. GDDR6-Grafikkarten kosten mehrere hundert Euro, GDDR6X-Karten wie die RTX 4090 über 1500 Euro. HBM-Speicher, wie in der H100, bewegt sich im fünfstelligen Bereich und ist für Consumer irrelevant.

Apple Silicon positioniert sich dazwischen. Ein Mac Studio mit M2 Max und 64 GB kostet deutlich weniger als ein Workstation-PC mit einer vergleichbar großen VRAM-Ausstattung, bietet aber hohe Bandbreite. Für Anwender, die große Modelle lokal betreiben wollen, ohne eine professionelle GPU anzuschaffen, ist das eine wirtschaftliche Alternative.

Sicherheitstechnisch ändert sich durch die Bandbreite nichts. Lokale KI-Inferenz ist ohnehin datenschutzfreundlich, da keine Daten an externe Server gesendet werden. Eine höhere Bandbreite bedeutet nur, dass die Inferenz schneller abläuft. Deine Daten bleiben auf Deinem Gerät, unabhängig davon, ob Du 40 GB/s oder 1000 GB/s zur Verfügung hast.

FAQ: Speicherbandbreite, typische Fragen

Was ist Speicherbandbreite einfach erklärt? Speicherbandbreite ist die Datenmenge, die pro Sekunde zwischen Speicher und Prozessor bewegt werden kann, gemessen in GB/s. Je höher, desto mehr Daten transportiert der Speicher in der gleichen Zeit.

Warum ist Speicherbandbreite bei KI so wichtig? Bei der Inferenz müssen für jedes Token alle Modellgewichte aus dem Speicher gelesen werden. Die Bandbreite bestimmt, wie schnell das passiert. Sie ist der wichtigste Faktor für die Token-Rate.

Ist mehr VRAM wichtiger als mehr Bandbreite? Nein, beide sind unterschiedlich wichtig. VRAM bestimmt, ob ein Modell überhaupt geladen werden kann. Bandbreite bestimmt, wie schnell es läuft. Beide zusammen entscheiden über die Performance.

Was ist der Unterschied zwischen GDDR6 und GDDR6X? GDDR6X ist eine Weiterentwicklung von GDDR6 mit höheren Datenraten. GDDR6 erreicht bis ca. 768 GB/s, GDDR6X bis ca. 1008 GB/s. GDDR6X wird ausschließlich von Nvidia eingesetzt.

Warum ist Apple Silicon so gut für lokale KI? Apple Silicon nutzt LPDDR5-Speicher mit breitem Interface und erreicht 100 bis 800 GB/s. Combined mit großem unified Memory können Macs große Modelle laden und mit brauchbarer Geschwindigkeit ausführen.

Kann ich die Bandbreite durch Software erhöhen? Nein, die Bandbreite ist eine hardwarebedingte Eigenschaft. Software-Optimierungen können die Nutzung der vorhandenen Bandbreite verbessern, aber nicht die Bandbreite selbst.

Was bringt Dual-Channel-RAM? Dual-Channel-Betrieb nutzt zwei Speichermodule parallel und verdoppelt die Bandbreite. Bei DDR5-5600 steigt die Bandbreite von ca. 45 GB/s auf ca. 90 GB/s.

Wie viel Bandbreite brauche ich für ein 7B-Modell? Ein 7B-Modell in 16-bit benötigt 14 GB pro Token. Für 20 Tokens pro Sekunde brauchst Du mindestens 280 GB/s. Mit 4-bit-Quantisierung reicht ein Drittel davon.

Was bedeutet das Speicherinterface in Bit? Das Speicherinterface ist die Breite des Datenpfads zwischen Speicher und GPU. 128-bit, 256-bit und 384-bit sind typisch. Ein breiteres Interface erlaubt mehr Daten pro Takt und erhöht die Bandbreite.

Sind TFLOPS bei der KI-Inferenz wichtig? Bei der Inferenz spielen TFLOPS eine untergeordnete Rolle. Die Bandbreite ist der entscheidende Faktor. TFLOPS werden beim Training von Modellen wichtiger.

Was ist HBM und warum ist es so schnell? HBM, High Bandwidth Memory, ist ein gestapelter Speicher, der direkt neben dem Prozessor sits. Die kurzen Wege und breite Anbindung ermöglichen über 3 TB/s. HBM wird in professionellen GPUs und Servern eingesetzt.

Quellen und weiterführende Literatur

  • Technische Datenblätter von Nvidia, AMD und Apple zu den jeweiligen Speichertypen und Bandbreiten
  • Spezifikationen der JEDEC-Standards für DDR5, GDDR6 und LPDDR5
  • Architektur-Dokumentationen zu Apple Silicon und Nvidia-GPUs
  • Praxis-Tests und Benchmarks zu Token-Raten auf verschiedenen Hardware-Konfigurationen
Zurück zum KI Blog
Share:

Ähnliche Beiträge