Skip to content
BotServBotServ
Unified MemoryApple SiliconM1M2M3M4Ryzen AI MaxKI-Hardware

Unified Memory: Apples Geheimwaffe für lokale KI

Was ist Unified Memory? Wie Apple Silicon und AMD Ryzen AI Max RAM und VRAM vereinen und warum das für lokale KI ein Gamechanger ist. Verständlich erklärt.

S

schutzgeist

18 min read
Unified Memory Architektur bei Apple Silicon

Unified Memory: Apples Geheimwaffe für lokale KI

Was dieser Artikel über Unified Memory behandelt

  • Was Unified Memory ist und wie es sich von klassischem RAM und VRAM unterscheidet
  • Warum Apple Silicon und AMD Ryzen AI Max große Modelle laufen lassen, die auf Consumer-GPUs keinen Platz finden
  • Wie CPU und GPU sich einen gemeinsamen Speicherpool teilen, ohne Daten hin und her kopieren zu müssen
  • Welche Vorteile und Nachteile Unified Memory für lokale KI bringt
  • Konkrete Vergleiche zwischen Mac Studio und PC mit RTX 4090, inklusive Kosten und Leistung

Einleitung: Unified Memory verständlich erklärt

Wer sich mit lokaler KI beschäftigt, trifft schnell auf ein Problem: große Modelle brauchen viel Speicherplatz auf der Grafikkarte. Eine Nvidia RTX 4090, die stärkste Consumer-GPU auf dem Markt, hat 24 GB VRAM. Ein quantisiertes 70B-Modell braucht aber rund 40 GB. Da passt das Modell nicht in eine einzelne Grafikkarte, und Du brauchst entweder zwei GPUs oder eine ganz andere Lösung.

Genau hier kommt Unified Memory ins Spiel. Apple baut seit 2020 eigene Chips für Macs, die M-Serie. Diese Chips haben keine separate Grafikkarte mit eigenem VRAM. Stattdessen teilen sich CPU und GPU einen gemeinsamen Speicherpool. Das bedeutet, die GPU kann auf den gesamten Arbeitsspeicher zugreifen, nicht nur auf einen kleinen abgetrennten Teil. Ein Mac Studio mit 128 GB Unified Memory kann der GPU fast den gesamten Speicher zur Verfügung stellen. Das reicht für Modelle, die auf keiner einzelnen Consumer-GPU laufen.

In diesem Artikel erkläre ich Dir, wie Unified Memory funktioniert, welche Chips es gibt, wo die Vorteile liegen und welche Nachteile Du kennen musst. Wenn Du noch keine Erfahrung mit Speicherthemen hast, empfiehlt sich zuerst der Artikel RAM vs. VRAM, der die Grundlagen legt.

Warum brauche ich Unified Memory?

Stell Dir vor, Du willst ein Modell mit 30 Milliarden Parametern lokal ausführen. So ein Modell, quantisiert auf 4-bit, braucht etwa 18 bis 20 GB Speicher. Auf einem klassischen PC brauchst Du dafür eine Grafikkarte mit mindestens 24 GB VRAM. Die einzige Consumer-GPU, die das bietet, ist die Nvidia RTX 4090. Eine davon kostet etwa 2000 Euro. Wenn das Modell noch größer wird, brauchst Du zwei davon, und dann sprichst Du von 4000 Euro für die GPUs allein, plus Mainboard, Netzteil, Gehäuse und Rest.

Jetzt schaust Du Dir einen Mac an. Ein Mac Studio mit M2 Max und 64 GB Unified Memory kostet ab rund 2000 Euro. Die GPU kann auf den gesamten Speicher zugreifen, abzüglich des Anteils, den das Betriebssystem braucht. Ein 30B-Modell passt dort problemlos hinein, und es bleibt noch Platz für weitere Anwendungen. Du bekommst also für den Preis einer einzelnen RTX 4090 einen kompletten Rechner, der das Modell ausführen kann.

Das ist der Kernpunkt: Unified Memory macht große Speichermengen für die GPU verfügbar, ohne dass Du mehrere teure Grafikkarten kaufen musst. Für lokale KI ist das oft der günstigste Weg, um große Modelle überhaupt zum Laufen zu bringen.

Unified Memory kurz erklärt

Unified Memory bedeutet, dass CPU und GPU sich denselben physischen Arbeitsspeicher teilen. Es gibt keinen separaten VRAM auf einer Grafikkarte und keinen separaten RAM auf dem Mainboard. Beide Prozessoren greifen auf dieselben Speicherbausteine zu, die direkt auf dem Chip oder direkt daneben verlötet sind.

Ein einfaches Bild: Stell Dir vor, Du hast zwei Lager. Im einen Lager liegen die Materialien für die Buchhaltung, im anderen die Materialien für die Produktion. Wenn die Produktion etwas aus dem Buchhaltungslager braucht, muss ein Bot es rüberbringen. Das kostet Zeit. Unified Memory ist wie ein gemeinsames großes Lager, in dem beide Abteilungen direkt greifen können. Kein Bot, kein Transport, keine Wartezeit.

Bei klassischen Rechnern mit dedizierter Grafikkarte ist das anders. Dort hat die CPU ihren RAM auf dem Mainboard, und die GPU hat ihren VRAM auf der Grafikkarte. Wenn die GPU Daten braucht, die im RAM liegen, müssen sie über den PCIe-Bus in den VRAM kopiert werden. Das kostet Zeit und Bandbreite. Bei Unified Memory entfällt dieser Schritt, weil beide Prozessoren denselben Speicher sehen.

Mehr zu den Grundlagen von Speicherarten findest Du im Artikel RAM vs. VRAM.

Für wen ist Unified Memory gedacht?

Unified Memory richtet sich an alle, die lokale KI betreiben wollen und dabei auf große Modelle angewiesen sind. Konkret sind das:

  • KI-Entwickler und Forscher, die Modelle mit 30, 70 oder mehr Milliarden Parametern lokal testen wollen, ohne Cloud-Gebühren zu zahlen
  • Privatanwender, die große Sprachmodelle privat nutzen wollen und dafür nicht mehrere Grafikkarten kaufen möchten
  • Teams und kleine Unternehmen, die eine günstige Lösung für lokale KI suchen und dabei Datenschutz groß schreiben
  • Mac-Nutzer, die ohnehin im Apple-Ökosystem sind und ihre vorhandene Hardware für KI nutzen wollen
  • Windows- und Linux-Nutzer, die mit AMD Ryzen AI Max eine ähnliche Architektur wie Apple Silicon nutzen wollen

Wenn Du nur kleine Modelle mit 7 oder 13 Milliarden Parametern nutzt, brauchst Du Unified Memory nicht zwingend. Eine Grafikkarte mit 8 oder 12 GB VRAM reicht da aus. Unified Memory wird interessant, wenn Du Modelle jenseits der 24-GB-Grenze laufen willst. Mehr zu den genauen Speicheranforderungen findest Du unter RAM und VRAM Anforderungen.

Wichtige Begriffe rund um Unified Memory

BegriffBedeutung
Unified MemoryGemeinsamer Speicherpool für CPU und GPU, kein separater VRAM
Shared MemoryGPU nutzt einen Teil des normalen RAM, typisch bei APUs
UMAUnified Memory Architecture, Oberbegriff für gemeinsame Speichernutzung
Apple SiliconApples eigene Chips der M-Serie, die Unified Memory verwenden
M-SeriesBezeichnung für Apples Chip-Generationen M1, M2, M3, M4
NPUNeural Processing Unit, spezialisierte Einheit für KI-Berechnungen
GPU TileEin GPU-Baustein im Chip, mehrere Tiles ergeben die volle GPU
Memory BandwidthDatenmenge, die pro Sekunde zwischen Speicher und Prozessor fließen kann
LPDDR5Low-Power-Speichertyp, der in Apple Silicon und Laptops verbaut wird
SoCSystem on a Chip, alle Komponenten auf einem Chip vereint

Wie funktioniert Unified Memory?

Bei einem klassischen Rechner mit dedizierter Grafikkarte gibt es zwei getrennte Speicherwelten. Die CPU arbeitet mit dem RAM auf dem Mainboard. Die GPU arbeitet mit dem VRAM auf der Grafikkarte. Wenn die GPU Daten braucht, die die CPU aus dem RAM bereitstellt, müssen diese Daten über den PCIe-Bus in den VRAM kopiert werden. Dieser Transfer kostet Zeit und begrenzt die effektive Geschwindigkeit.

Bei Unified Memory ist das anders. CPU und GPU sitzen auf demselben Chip, dem sogenannten SoC (System on a Chip). Der Speicher, typisch LPDDR5 oder LPDDR5X, ist direkt daneben verlötet. Beide Prozessoren greifen auf dieselben physischen Speicherbausteine zu. Es gibt keinen PCIe-Transfer, keinen Kopierschritt, keine Wartezeit durch Datentransport.

Die Architektur sieht vereinfacht so aus:

+--------------------------------------------------+
|                     SoC                          |
|  +----------+   +----------+   +----------+     |
|  |   CPU    |   |   GPU    |   |   NPU    |     |
|  +----------+   +----------+   +----------+     |
|       |              |              |            |
|       +--------------+--------------+           |
|                      |                           |
|              +---------------+                   |
|              | Unified Memory|                   |
|              |  (LPDDR5)     |                   |
|              +---------------+                   |
+--------------------------------------------------+

Wenn Du ein KI-Modell mit Ollama auf einem Mac startest, lädt Ollama das Modell in den gemeinsamen Speicher. Die GPU kann direkt auf die Modellparameter zugreifen, ohne dass irgendetwas kopiert werden muss. Das spart Zeit beim Laden und reduziert den Speicherbedarf, weil das Modell nur einmal im Speicher liegt und nicht sowohl im RAM als auch im VRAM.

Das Betriebssystem verwaltet, welcher Prozessor welchen Speicherbereich nutzt. Die GPU bekommt einen großen Teil des Speichers, aber das System reserviert sich einen Anteil für sich selbst und laufende Anwendungen. Auf einem Mac mit 64 GB Unified Memory stehen der GPU typisch 50 bis 55 GB zur Verfügung, der Rest geht an das Betriebssystem.

Apple Silicon im Detail

Apple hat seit 2020 vier Generationen von Chips für Macs herausgebracht: M1, M2, M3 und M4. Jede Generation gibt es in mehreren Varianten, die sich in Rechenleistung, Speicherbandbreite und maximalem Speicher unterscheiden.

M1 (2020): Die erste Generation. Der Standard-M1 hat bis zu 16 GB Unified Memory und eine Bandbreite von etwa 68 GB/s. Die M1 Pro hat bis zu 32 GB und 200 GB/s, die M1 Max bis zu 64 GB und 400 GB/s. Die M1 Ultra, die aus zwei Max-Chips besteht, hat bis zu 128 GB und 800 GB/s.

M2 (2022): Die zweite Generation. Der Standard-M2 hat bis zu 24 GB und 100 GB/s. Die M2 Pro hat bis zu 32 GB und 200 GB/s, die M2 Max bis zu 96 GB und 400 GB/s. Die M2 Ultra hat bis zu 192 GB und 800 GB/s.

M3 (2023): Die dritte Generation, gebaut im 3-nm-Prozess. Der Standard-M3 hat bis zu 24 GB und 100 GB/s. Die M3 Pro hat bis zu 36 GB und 150 GB/s, die M3 Max bis zu 128 GB und 400 GB/s. Eine Ultra-Variante wurde nicht mehr herausgebracht.

M4 (2024): Die vierte Generation. Der Standard-M4 hat bis zu 32 GB und 120 GB/s. Die M4 Pro hat bis zu 48 GB und 273 GB/s, die M4 Max bis zu 128 GB und 546 GB/s. Die M4 Ultra steht aus, wird aber voraussichtlich bis zu 256 GB Unified Memory bieten.

Für lokale KI sind die Max- und Ultra-Varianten am interessantesten, weil sie den größten Speicher und die höchste Bandbreite bieten. Der Standard-M4 mit 32 GB reicht für Modelle bis etwa 20 GB, also quantisierte 30B-Modelle. Für 70B-Modelle brauchst Du mindestens einen Max-Chip mit 64 GB oder mehr.

Die Speicherbandbreite ist wichtig, weil sie bestimmt, wie schnell die GPU die Modellparameter lesen kann. Mehr dazu im Artikel Speicherbandbreite. Eine niedrigere Bandbreite bedeutet, dass die GPU länger auf Daten wartet, was die Inferenzgeschwindigkeit direkt beeinflusst.

AMD Ryzen AI Max und APUs

Apple ist nicht das einzige Unternehmen, das auf eine vereinheitlichte Speicherarchitektur setzt. AMD hat mit dem Ryzen AI Max, Codename Strix Halo, einen Chip herausgebracht, der ähnlich funktioniert. Er kombiniert CPU-Kerne, eine integrierte GPU mit RDNA 3.5 Architektur und eine NPU auf einem Chip und unterstützt bis zu 128 GB LPDDR5X Speicher.

Der Ryzen AI Max kann der integrierten GPU einen großen Teil des RAM zuweisen, ähnlich wie Apple Silicon. Das bedeutet, Du kannst einen Windows- oder Linux-Rechner bauen, der große KI-Modelle lokal ausführt, ohne eine dedizierte Grafikkarte zu benötigen. Die Speicherbandbreite liegt bei etwa 256 GB/s, was zwischen dem M4 Pro und dem M4 Max liegt.

Im Vergleich zu Apple Silicon gibt es Unterschiede. AMD nutzt Shared Memory, bei dem die GPU einen Teil des System-RAM reserviert. Apple nutzt echtes Unified Memory, bei dem CPU und GPU denselben Speicherpool ohne explizite Aufteilung nutzen. In der Praxis ist der Unterschied für KI-Anwendungen aber gering, solange die GPU ausreichend Speicher zugewiesen bekommt.

Weitere APUs, die ähnlich funktionieren, sind Intels Core Ultra Serie mit integrierter Arc GPU. Diese unterstützen aber typisch weniger Speicher und eine niedrigere Bandbreite, was sie für große KI-Modelle weniger geeignet macht. Der Ryzen AI Max ist aktuell die beste Alternative zu Apple Silicon im Windows- und Linux-Bereich.

Vorteile von Unified Memory für KI

Großer Speicherpool: Der wichtigste Vorteil. Die GPU kann auf den gesamten Arbeitsspeicher zugreifen, nicht nur auf 24 GB VRAM. Ein Mac Studio mit 192 GB Unified Memory kann Modelle laden, die auf keiner Consumer-GPU Platz finden. Das öffnet die Tür für 70B- und sogar 100B-Modelle in lokaler Umgebung.

Kein Datenkopieren: Bei klassischen Setups muss das Modell vom RAM in den VRAM kopiert werden. Bei Unified Memory entfällt dieser Schritt. Das Modell liegt einmal im Speicher, und sowohl CPU als auch GPU können direkt darauf zugreifen. Das spart Ladezeit und reduziert den Speicherbedarf.

Hohe Bandbreite: Apple Silicon und AMD Ryzen AI Max nutzen LPDDR5X-Speicher mit Bandbreiten von 100 bis 800 GB/s. Das ist deutlich mehr als normaler DDR5-RAM mit 50 bis 100 GB/s, wenn auch weniger als dediziertes GDDR6X auf einer RTX 4090 mit über 1000 GB/s. Für die meisten KI-Anwendungen reicht die Bandbreite aber aus.

Niedriger Stromverbrauch: Weil alle Komponenten auf einem Chip sitzen und kein PCIe-Transfer nötig ist, verbraucht ein Mac mit M4 Max deutlich weniger Strom als ein PC mit RTX 4090. Ein Mac Studio braucht unter Last etwa 100 bis 200 Watt, ein PC mit RTX 4090 kommt schnell auf 500 Watt und mehr. Das senkt die Betriebskosten und reduziert die Abwärme.

Kompakte Bauweise: Ohne separate Grafikkarte fallen Gehäuse, Netzteil und Kühlung für die GPU weg. Ein Mac Mini ist klein und leise, ein Mac Studio ist kompakt. Das ist praktisch, wenn Du keinen großen Tower-Rechner unter dem Schreibtisch stehen haben willst.

Nachteile von Unified Memory

Geteilt mit dem Betriebssystem: Der Speicher ist nicht exklusiv für die GPU. Das Betriebssystem und alle laufenden Programme brauchen ihren Anteil. Auf einem Mac mit 64 GB Unified Memory stehen der GPU typisch 50 bis 55 GB zur Verfügung. Du kannst nicht den gesamten Speicher für KI nutzen.

Niedrigere Bandbreite als dediziertes GDDR6X: Die Bandbreite von LPDDR5X liegt bei maximal 800 GB/s bei den Ultra-Varianten. Eine RTX 4090 mit GDDR6X erreicht über 1000 GB/s. Das bedeutet, dass ein Mac bei reinen KI-Berechnungen langsamer sein kann als ein PC mit RTX 4090, selbst wenn das Modell in beiden Fällen in den Speicher passt. Die Token-Generierungsrate ist bei dedizierten High-End-GPUs höher.

Kein Aufrüsten möglich: Der Speicher ist fest auf dem Chip verlötet. Du kannst nachträglich keine Speicherriegel einbauen. Wenn Du heute einen Mac mit 64 GB kaufst und in zwei Jahren 128 GB brauchst, musst Du einen neuen Mac kaufen. Bei einem PC kannst Du RAM-Module austauschen, bei einer dedizierten GPU bleibt der VRAM zwar auch fest, aber Du kannst die GPU als Ganzes ersetzen.

Begrenzte GPU-Auswahl: Bei Apple Silicon bist Du an die Chips gebunden, die Apple anbietet. Du kannst keine Nvidia-GPU in einen Mac einbauen. Wenn Du spezifische Frameworks brauchst, die nur auf Nvidia optimiert sind, bist Du auf einem Mac eingeschränkt. CUDA, die Programmierplattform von Nvidia, läuft nicht auf Apple Silicon.

Preis bei großen Speichermengen: Apple verlangt erhebliche Aufpreise für mehr Unified Memory. Der Sprung von 64 GB auf 128 GB kostet mehrere hundert Euro. Im Vergleich dazu ist normaler DDR5-RAM für PCs günstig. Der Preisvorteil von Unified Memory gilt nur im Vergleich zu Multi-GPU-Setups, nicht im Vergleich zu kleinen Speichermengen.

Vergleich: Mac vs. PC mit GPU

KriteriumMac Studio M2 UltraPC mit RTX 4090
Maximaler GPU-Speicher192 GB Unified Memory24 GB VRAM
Speicherbandbreite800 GB/s1002 GB/s
Stromverbrauch unter Lastca. 150 Wattca. 500 Watt und mehr
Preis (nur GPU/Chip)ab 2000 Euro (kompletter Rechner)ab 2000 Euro (nur GPU)
AufrüstbarkeitNicht möglichGPU austauschbar
CUDA-UnterstützungNeinJa
Geeignet für 70B-ModelleJa, ab 64 GBNein, braucht zwei GPUs
Token-GenerierungsrateMittel bis hochHoch
BetriebssystemmacOSWindows, Linux
Kühlung und GeräuschLeiseLauter, aktive Kühlung

Die Tabelle zeigt: Für große Modelle ist der Mac die günstigere Lösung. Für maximale Geschwindigkeit bei kleinen bis mittleren Modellen ist der PC mit RTX 4090 schneller. Die Wahl hängt davon ab, was Du vorhast. Mehr Hilfe bei der Entscheidung findest Du in der Kaufberatung.

Typische Stolpersteine bei Unified Memory

  • Verfügbaren Speicher überschätzen: 64 GB Unified Memory bedeuten nicht 64 GB für die GPU. Das Betriebssystem braucht 8 bis 15 GB für sich. Plane mit einem Sicherheitspuffer, sonst stürzen Modelle mit “out of memory” ab.
  • Standard-Chip statt Max kaufen: Ein M4 mit 32 GB und 120 GB/s ist für große Modelle deutlich langsamer als ein M4 Max mit 128 GB und 546 GB/s. Die Bandbreite macht bei der Inferenz einen großen Unterschied.
  • Bandbreite ignorieren: Viele schauen nur auf die Speichermenge und vergessen die Bandbreite. Ein Modell, das in den Speicher passt, kann trotzdem langsam laufen, wenn die Bandbreite zu niedrig ist. Mehr dazu unter Speicherbandbreite.
  • CUDA-abhängige Tools erwarten: Nicht jedes KI-Tool läuft auf Apple Silicon. Frameworks, die CUDA zwingend benötigen, funktionieren nicht. Prüfe vor dem Kauf, ob Deine bevorzugten Tools Apple Silicon unterstützen.
  • Speicher nicht nachrüsten: Wer heute 64 GB kauft und später merkt, dass 128 GB nötig wären, muss einen neuen Mac kaufen. Überlege im Voraus, wie groß die Modelle sind, die Du laufen willst.
  • Betriebssystem-Anteil vergessen: macOS selbst braucht Speicher. Bei 16 GB Unified Memory bleibt für KI kaum etwas übrig. Für ernsthafte lokale KI solltest Du mindestens 32 GB, besser 64 GB oder mehr, einplanen.
  • Quantisierung nicht nutzen: Auch mit viel Unified Memory lohnt sich Quantisierung. Ein 4-bit-quantisiertes Modell braucht ein Viertel des Speichers der unquantisierten Version. Das bedeutet schnellere Inferenz und mehr Platz für mehrere Modelle gleichzeitig.
  • Thermisches Throttling übersehen: Macs sind kompakt gebaut. Bei langen Inferenzläufen kann der Chip heiß werden und die Leistung drosseln. Das betrifft besonders den Mac Mini und das MacBook Air, die keine aktive Kühlung für die GPU haben.

Hardware, Kosten und Sicherheit bei Unified Memory

Hardware: Für den Einstieg in lokale KI mit Unified Memory reicht ein Mac Mini mit M4 und 32 GB Unified Memory. Damit kannst Du quantisierte Modelle bis etwa 20 GB laden. Für 70B-Modelle brauchst Du mindestens einen M4 Max mit 64 GB, am besten 128 GB. Der Mac Studio mit M2 Ultra und 192 GB ist die aktuell größte Speicheroption bei Apple und reicht sogar für Modelle jenseits 100 Milliarden Parametern. Alternativ bietet der AMD Ryzen AI Max mit 128 GB RAM eine Lösung für Windows und Linux.

Kosten: Apple Silicon ist beim Speicher teuer. Der Aufpreis von 64 GB auf 128 GB Unified Memory liegt bei mehreren hundert Euro. Im Vergleich zu einem Multi-GPU-Setup mit zwei RTX 4090 für 4000 Euro ist ein Mac Studio mit 128 GB aber günstiger. Der AMD Ryzen AI Max ist preislich ähnlich zu Apple Silicon, bietet aber die Flexibilität von Windows und Linux. Wenn Du nur kleine Modelle nutzt, ist eine einzelne Grafikkarte mit 12 oder 24 GB VRAM oft die günstigere Wahl.

Sicherheit: Bei lokal betriebenen Modellen bleiben Deine Daten auf Deinem Rechner. Keine Anfrage geht an einen Server, keine Daten verlassen Dein System. Das gilt gleichermaßen für Macs mit Unified Memory und PCs mit dedizierter GPU. Wichtig ist nur, dass das Modell lokal läuft und keine externen APIs aufruft. Unified Memory bietet hier keinen besonderen Sicherheitsvorteil, aber auch keinen Nachteil. Mehr zu den Grundlagen lokaler KI findest Du im Bereich KI-Hardware Grundlagen.

FAQ: Unified Memory - Typische Fragen

Was ist der Unterschied zwischen Unified Memory und normalem RAM?

Normaler RAM steht nur der CPU zur Verfügung. Eine dedizierte Grafikkarte hat ihren eigenen VRAM, und Daten müssen zwischen RAM und VRAM kopiert werden. Unified Memory ist ein gemeinsamer Speicherpool, auf den sowohl CPU als auch GPU direkt zugreifen können, ohne einen Kopierschritt.

Kann ich Unified Memory nachrüsten?

Nein. Der Speicher ist fest auf dem Chip verlötet. Du kannst keine Speicherriegel einbauen oder austauschen. Wenn Du mehr Speicher brauchst, musst Du einen neuen Mac oder einen neuen Rechner mit Ryzen AI Max kaufen.

Wie viel Unified Memory brauche ich für ein 70B-Modell?

Ein quantisiertes 70B-Modell braucht etwa 40 bis 45 GB Speicher. Mit Betriebssystem-Anteil solltest Du mindestens 64 GB Unified Memory einplanen. Für Sicherheit und weiteren Spielraum sind 128 GB besser. Mehr dazu unter RAM und VRAM Anforderungen.

Ist Unified Memory schneller als dedizierter VRAM?

Nicht generell. Die Bandbreite von Unified Memory liegt bei maximal 800 GB/s bei Ultra-Varianten. Eine RTX 4090 mit GDDR6X erreicht über 1000 GB/s. Bei reinen KI-Berechnungen ist dedizierter VRAM also schneller. Unified Memory punktet durch die größere Speichermenge, nicht durch pure Geschwindigkeit.

Funktioniert CUDA auf Apple Silicon?

Nein. CUDA ist eine proprietäre Plattform von Nvidia und läuft nur auf Nvidia-GPUs. Auf Apple Silicon nutzt Du Alternativen wie Metal, das Apple-eigene Grafik-Framework. Viele KI-Tools wie Ollama unterstützen Metal, aber nicht alle Frameworks sind kompatibel.

Lohnt sich ein Mac für lokale KI?

Ja, wenn Du große Modelle jenseits von 24 GB Speicherbedarf laufen willst. Ein Mac mit 64 oder 128 GB Unified Memory ist oft günstiger als ein Multi-GPU-Setup. Für kleine Modelle bis 13B reicht auch eine günstige Grafikkarte mit 12 GB VRAM.

Was ist der Unterschied zwischen Unified Memory und Shared Memory?

Unified Memory bei Apple Silicon ist von Grund auf als gemeinsamer Speicher für CPU und GPU konzipiert, mit hoher Bandbreite und direktem Zugriff. Shared Memory bei APUs bedeutet, dass die integrierte GPU einen Teil des normalen System-RAM nutzt. Die Bandbreite ist dabei typisch niedriger, weil der RAM nicht speziell für GPU-Zugriff optimiert ist.

Kann ich auf einem Mac mehrere Modelle gleichzeitig laufen lassen?

Ja, solange der Speicher ausreicht. Mit 128 GB Unified Memory kannst Du mehrere kleinere Modelle oder ein großes und ein kleines Modell gleichzeitig im Speicher halten. Jedes Modell belegt seinen Anteil, und Du musst den Gesamtbedarf im Blick behalten.

Ist der AMD Ryzen AI Max eine Alternative zu Apple Silicon?

Ja, der Ryzen AI Max ist die aktuell beste Alternative im Windows- und Linux-Bereich. Er unterstützt bis zu 128 GB RAM und kann der integrierten GPU einen großen Teil davon zuweisen. Die Bandbreite liegt bei etwa 256 GB/s, was zwischen M4 Pro und M4 Max liegt. Der Vorteil ist, dass Du Windows und Linux nutzen kannst.

Wie viel Speicher braucht das Betriebssystem auf einem Mac?

macOS braucht typisch 8 bis 15 GB Unified Memory für sich selbst und laufende Systemprozesse. Bei 32 GB Unified Memory bleiben etwa 20 bis 24 GB für KI übrig. Bei 128 GB sind es etwa 110 bis 120 GB. Plane immer mit einem Puffer, damit das System nicht in Speichernot gerät.

Warum ist Unified Memory so wichtig für lokale KI?

Weil die Speichermenge der limitierende Faktor für große Modelle ist. Dedizierte Consumer-GPUs haben maximal 24 GB VRAM. Unified Memory ermöglicht der GPU den Zugriff auf 64, 128 oder sogar 192 GB. Das macht den Unterschied zwischen “Modell läuft” und “Modell passt nicht in den Speicher”.

Quellen und weiterführende Literatur

  • Apple Developer Documentation: Apple Silicon Architecture und Unified Memory
  • AMD: Ryzen AI Max 300 Series Technical Brief
  • Ollama Documentation: GPU Support und Metal Framework
  • llama.cpp GitHub Repository: Apple Silicon Support und Performance Benchmarks
  • MLPerf Benchmark Results: Apple Silicon vs. Nvidia GPU Vergleiche
  • Weitere Artikel auf BotServ.de: Apple Silicon, Speicherbandbreite, Kaufberatung
Zurück zum KI Blog
Share:

Ähnliche Beiträge