GPU-Offloading: Modelle zwischen RAM und VRAM
Was dieser Artikel über GPU-Offloading behandelt
- Was GPU-Offloading ist und warum es gebraucht wird, wenn der VRAM nicht ausreicht
- Wie ein Modell schichtweise zwischen GPU und CPU aufgeteilt wird
- Konkrete Geschwindigkeitsunterschiede zwischen voller GPU, teilweisem Offloading und CPU-only
- Wie Du GPU-Offloading in Ollama und llama.cpp konfigurierst
- Welche Alternativen es gibt und welche Stolpersteine typisch sind
Einleitung: GPU-Offloading verständlich erklärt
Wer lokale KI betreibt, trifft früher oder später auf ein Problem: Das Modell ist größer als der VRAM der Grafikkarte. In diesem Moment gibt es mehrere Möglichkeiten. Du kannst ein kleineres Modell wählen, Du kannst stärker quantisieren, oder Du nutzt GPU-Offloading. Letzteres bedeutet, dass das Modell teils auf der GPU und teils im RAM auf der CPU läuft. Das ist kein perfekter Zustand, aber oft der beste Kompromiss aus Geschwindigkeit und Modellgröße.
In diesem Artikel geht es um die Grundlagen von GPU-Offloading. Du lernst, wie es funktioniert, wann es Sinn macht, wie Du es konfigurierst und welche Fallstricke es gibt. Wenn Du die Grundlagen von RAM vs. VRAM und CPU vs. GPU kennst, ist das hilfreich, aber nicht zwingend nötig. Wir fangen von vorne an.
Warum brauche ich GPU-Offloading?
Stell Dir vor, Du hast eine Grafikkarte mit 6 GB VRAM, etwa eine ältere Nvidia RTX 2060. Du möchtest ein 13B-Modell laufen lassen, also ein Modell mit 13 Milliarden Parametern. Quantisiert mit 4-bit braucht dieses Modell etwa 8 GB Speicher. Dein VRAM hat nur 6 GB. Das Modell passt nicht vollständig in die Grafikkarte.
Ohne GPU-Offloading gibt es zwei Möglichkeiten. Entweder das Programm bricht ab mit der Meldung, dass nicht genug VRAM vorhanden ist, oder es lädt das Modell komplett in den RAM und führt es auf der CPU aus. Auf der CPU ist das Modell aber langsam, weil die CPU weniger parallele Kerne hat als die GPU und der RAM eine niedrigere Speicherbandbreite bietet als der VRAM. In der Praxis kommst Du auf vielleicht 5 bis 10 Tokens pro Sekunde, wenn überhaupt.
Mit GPU-Offloading passiert etwas anderes. Das Programm lädt so viel vom Modell in den VRAM, wie Platz ist, und belässt den Rest im RAM. In unserem Beispiel passen etwa 75 Prozent des Modells in die 6 GB VRAM, die restlichen 25 Prozent bleiben im RAM. Die GPU bearbeitet ihren Teil schnell, die CPU ihren Teil langsamer. Das Ergebnis ist deutlich schneller als CPU-only, weil der Großteil der Berechnungen auf der GPU stattfindet. Statt 5 Tokens pro Sekunde erreichst Du vielleicht 15 bis 20 Tokens pro Sekunde. Kein Sprint, aber brauchbar.
Genau hier liegt der Wert von GPU-Offloading. Es erlaubt Dir, Modelle zu nutzen, die eigentlich zu groß für Deine Grafikkarte sind, ohne dass Du sofort neue Hardware kaufen musst.
GPU-Offloading kurz erklärt
GPU-Offloading bedeutet, dass ein KI-Modell nicht vollständig in den VRAM geladen wird, sondern nur ein Teil davon. Der Rest bleibt im RAM und wird von der CPU berechnet. Die GPU übernimmt die Schichten, die in den VRAM passen, die CPU übernimmt den Rest. Zwischen beiden Speichern fließen während der Inferenz Daten hin und her.
Ein einfaches Bild: Stell Dir einen Arbeiter vor, der Kisten auf ein Fließband stellen muss. Das schnelle Fließband ist die GPU, das langsame Fließband ist die CPU. Auf das schnelle Fließband passen nur 6 Kisten, aber es gibt 8 Kisten insgesamt. Der Arbeiter stellt 6 Kisten auf das schnelle Band und die restlichen 2 auf das langsame. Die meisten Kisten kommen schnell an, nur 2 brauchen länger. Insgesamt ist das deutlich schneller, als wenn alle 8 Kisten auf das langsame Band müssten.
So ähnlich funktioniert GPU-Offloading. Je mehr vom Modell auf das schnelle Band, also in den VRAM, passt, desto schneller läuft die Inferenz. Je mehr im RAM bleiben muss, desto mehr bremst das die Gesamtgeschwindigkeit.
Für wen ist GPU-Offloading gedacht?
GPU-Offloading richtet sich an alle, die ein Modell nutzen wollen, das nicht vollständig in den VRAM ihrer Grafikkarte passt. Das betrifft besonders Nutzer mit Grafikkarten, die 6 bis 8 GB VRAM haben, und die Modelle ab 13 Milliarden Parametern laufen lassen möchten. Auch wer eine größere Karte mit 12 oder 16 GB hat, stößt bei 30B- oder 70B-Modellen an die Grenze und braucht GPU-Offloading.
Wenn Du gerade erst mit lokaler KI beginnst und nur 7B-Modelle nutzt, brauchst Du GPU-Offloading wahrscheinlich nicht. Diese Modelle passen in 8 GB VRAM. Sobald Du aber größere Modelle ausprobierst, wird das Thema aktuell. Es lohnt sich, das Konzept zu verstehen, bevor Du in die Situation kommst, in der Dein Modell plötzlich langsam wird und Du nicht weißt, warum.
Wichtige Begriffe rund um GPU-Offloading
| Begriff | Bedeutung |
|---|---|
| GPU-Offloading | Teile des Modells werden auf die GPU ausgelagert, der Rest bleibt im RAM auf der CPU |
| Partial Offloading | Nur ein Teil des Modells liegt im VRAM, der Rest im RAM, das Modell wird geteilt berechnet |
| Full Offloading | Das gesamte Modell liegt im VRAM, die CPU ist an der Inferenz nicht beteiligt |
| Layer | Eine Schicht des neuronalen Netzes, Modelle bestehen aus vielen Layern nacheinander |
| VRAM | Speicher auf der Grafikkarte, exklusiv für die GPU |
| RAM | Arbeitsspeicher des Systems, genutzt von der CPU |
| Speicherbandbreite | Datenmenge, die pro Sekunde zwischen Speicher und Prozessor fließen kann |
| Inferenzgeschwindigkeit | Geschwindigkeit, mit der das Modell Antworten erzeugt, meist in Tokens pro Sekunde |
| KV-Cache | Zwischenspeicher für bereits berechnete Aufmerksamkeitswerte, wächst mit der Textlänge |
| Quantisierung | Kompression des Modells durch reduzierte Zahlengenauigkeit, spart VRAM und RAM |
Wie funktioniert GPU-Offloading?
Um GPU-Offloading zu verstehen, musst Du wissen, dass ein KI-Modell nicht ein einziger Block ist, sondern aus vielen Schichten besteht, den sogenannten Layern. Ein 13B-Modell hat typischerweise etwa 40 Layer. Jeder Layer enthält einen Teil der Gewichte des Modells und wird nacheinander durchlaufen, wenn das Modell eine Antwort berechnet. Die Ausgabe eines Layers ist die Eingabe des nächsten.
Beim GPU-Offloading wird das Modell an einer bestimmten Stelle geteilt. Die ersten Layer, die in den VRAM passen, werden auf die GPU geladen. Die restlichen Layer bleiben im RAM und werden von der CPU berechnet. Wenn Du zum Beispiel 30 von 40 Layern auf die GPU lädst, laufen 30 Layer schnell auf der GPU und 10 Layer langsamer auf der CPU.
Während der Inferenz passiert Folgendes: Die Eingabe, also der Text, den Du dem Modell gibst, durchläuft zuerst die Layer auf der GPU. Danach wird das Zwischenergebnis vom VRAM in den RAM kopiert, damit die CPU die nächsten Layer berechnen kann. Das Ergebnis der CPU wird danach wieder zurück in den VRAM kopiert, falls weitere Layer auf der GPU folgen, oder direkt als Ausgabe verwendet.
Dieser Datentransfer zwischen VRAM und RAM kostet Zeit. Je öfter hin und her kopiert werden muss, desto größer ist der Geschwindigkeitsverlust. Deshalb ist es besser, möglichst viele Layer am Stück auf der GPU zu haben, statt sie zu mischen. In der Praxis werden die Layer aber ohnehin in Reihenfolge geladen, sodass die Aufteilung automatisch zusammenhängend ist.
Der KV-Cache, also der Zwischenspeicher für die Aufmerksamkeitswerte, muss ebenfalls berücksichtigt werden. Er wächst mit der Länge des Textes und braucht zusätzlichen VRAM. Wenn Du berechnest, wie viele Layer in den VRAM passen, musst Du Platz für den KV-Cache einplanen. Sonst läuft das Modell anfangs schnell und wird mit zunehmender Textlänge langsamer, weil der Cache den VRAM füllt.
Geschwindigkeit: Voll, Teilweise, Gar nicht
Die Geschwindigkeit eines Modells hängt stark davon ab, wo es berechnet wird. Hier ist ein Vergleich mit konkreten Zahlen, bezogen auf ein 13B-Modell mit 4-bit-Quantisierung auf einer typischen Consumer-Hardware.
| Setup | Wo das Modell läuft | Tokens pro Sekunde | Bewertung |
|---|---|---|---|
| Full Offloading | Komplett im VRAM (12 GB oder mehr) | 40 bis 60 | Sehr schnell, ideal |
| Partial Offloading, 75 Prozent GPU | 30 von 40 Layern im VRAM (6 GB) | 15 bis 25 | Brauchbar, gut für Gespräche |
| Partial Offloading, 50 Prozent GPU | 20 von 40 Layern im VRAM (4 GB) | 8 bis 15 | Langsam, Geduld erforderlich |
| CPU-only | Komplett im RAM | 3 bis 8 | Sehr langsam, nur für kurze Texte |
Die Zahlen sind Richtwerte und variieren je nach Hardware, Modell und Quantisierung. Der Trend ist aber klar: Je mehr vom Modell im VRAM liegt, desto schneller läuft es. Der Sprung von CPU-only zu 50 Prozent GPU ist deutlicher als der Sprung von 75 Prozent zu Full Offloading. Schon ein teilweises Offloading bringt also eine spürbare Verbesserung.
Ein wichtiger Punkt: Die Geschwindigkeit beim Partial Offloading ist nicht linear. Wenn Du 75 Prozent des Modells auf die GPU lädst, heißt das nicht, dass Du 75 Prozent der Full-Offloading-Geschwindigkeit erreichst. Der Flaschenhals ist der Datentransfer zwischen RAM und VRAM und die CPU-Berechnung der verbleibenden Layer. Deshalb fällt die Geschwindigkeit überproportional, je mehr Layer auf der CPU bleiben.
Konfiguration in Ollama und llama.cpp
Wenn Du Ollama nutzt, passiert GPU-Offloading automatisch. Ollama erkennt beim Start, wie viel VRAM verfügbar ist, und lädt so viele Layer wie möglich auf die GPU. Du musst dafür nichts konfigurieren. Trotzdem ist es gut zu wissen, wie Du eingreifen kannst.
In Ollama kannst Du die Anzahl der GPU-Layer mit dem Parameter num_gpu steuern. Beim Starten eines Modells übergibst Du den Parameter direkt:
ollama run llama3:13b --num-gpu 30
Dieser Befehl lädt 30 Layer auf die GPU und den Rest in den RAM. Wenn Du weglässt, entscheidet Ollama selbst. Mit dem Parameter kannst Du experimentieren und herausfinden, was auf Deiner Hardware am besten läuft.
In llama.cpp, der Engine unter Ollama, gibt es den Parameter -ngl, was für number of GPU layers steht. Ein typischer Aufruf sieht so aus:
./llama-cli -m modell.gguf -ngl 30 -p "Dein Prompt"
Auch hier lädst Du mit -ngl 30 30 Layer auf die GPU. Mit -ngl 0 läuft das Modell komplett auf der CPU, mit -ngl 99 oder einer Zahl größer als die Layer-Anzahl lädst Du alles auf die GPU, sofern Platz ist.
Wenn Du herausfinden willst, wie viele Layer Dein Modell hat, hilft ein Blick in die Modellausgabe beim Start. Ollama und llama.cpp zeigen beim Laden an, wie viele Layer auf die GPU geschoben werden und wie viele im RAM bleiben. Daran erkennst Du, ob das Offloading wie gewünscht funktioniert.
Beispiel: 13B-Modell mit 8GB VRAM
Gehen wir ein konkretes Beispiel durch. Du hast eine Grafikkarte mit 8 GB VRAM und möchtest ein 13B-Modell mit 4-bit-Quantisierung laufen lassen. Das Modell braucht etwa 8 GB Speicher für die Gewichte allein. Dazu kommt der KV-Cache, der je nach Kontextlänge weitere 0,5 bis 2 GB braucht.
Schritt 1: Du startest das Modell mit Ollama ohne Parameter. Ollama erkennt 8 GB VRAM und versucht, das Modell vollständig zu laden. Die Gewichte brauchen 8 GB, der KV-Cache braucht zusätzlichen Platz. Der VRAM ist nicht ausreichend für beides.
Schritt 2: Ollama reduziert automatisch die Anzahl der GPU-Layer. Statt aller 40 Layer lädt es vielleicht 32 Layer in den VRAM. Das entspricht etwa 6,4 GB für die Gewichte. Der restliche VRAM, etwa 1,6 GB, bleibt für den KV-Cache und Overhead.
Schritt 3: Die verbleibenden 8 Layer bleiben im RAM und werden von der CPU berechnet. Das sind 20 Prozent des Modells auf der CPU, 80 Prozent auf der GPU.
Schritt 4: Die erwartete Geschwindigkeit liegt bei etwa 20 bis 30 Tokens pro Sekunde, je nach CPU und RAM-Geschwindigkeit. Das ist deutlich schneller als CPU-only, aber langsamer als Full Offloading mit 12 GB VRAM.
Schritt 5: Wenn Du die Geschwindigkeit verbessern willst, kannst Du den Kontext verkleinern, um den KV-Cache zu reduzieren, oder Du quantisierst stärker, etwa auf 3-bit, um mehr Layer in den VRAM zu pressen. Mehr dazu unter Quantisierung.
Dieses Beispiel zeigt, dass GPU-Offloading kein Ja-oder-Nein-Entscheidung ist, sondern ein Spektrum. Jede Schicht, die Du zusätzlich in den VRAM bekommst, verbessert die Geschwindigkeit. Die RAM und VRAM Anforderungen helfen Dir, die Zahlen für Dein konkretes Modell nachzuvollziehen.
Alternativen zum GPU-Offloading
GPU-Offloading ist nicht die einzige Möglichkeit, wenn der VRAM zu klein ist. Hier sind die wichtigsten Alternativen.
Stärkere Quantisierung: Wenn Du ein Modell von 4-bit auf 3-bit oder 2-bit quantisierst, schrumpft der Speicherbedarf deutlich. Ein 13B-Modell, das mit 4-bit 8 GB braucht, kommt mit 3-bit vielleicht auf 6 GB und passt dann vollständig in Deinen VRAM. Der Nachteil ist ein Qualitätverlust, der bei 3-bit spürbar, bei 2-bit deutlich werden kann. Mehr dazu unter Quantisierung.
Kleineres Modell: Manchmal ist die einfachste Lösung, ein kleineres Modell zu wählen. Ein 7B-Modell braucht etwa 4 bis 5 GB und passt in 8 GB VRAM mühelos. Die Qualität ist bei guten 7B-Modellen oft erstaunlich nah an 13B-Modellen. Wenn Dein Anwendungsfall nicht zwingend das größere Modell verlangt, spart Dir das viel Frust.
Mehr VRAM: Die offensichtlichste Lösung ist eine Grafikkarte mit mehr VRAM. Eine RTX 3060 mit 12 GB ist preiswert und kann 13B-Modelle vollständig laden. Eine RTX 4090 mit 24 GB schafft sogar 30B-Modelle. Die Kaufberatung hilft Dir bei der Auswahl.
Apple Silicon: Macs mit Apple Silicon nutzen Unified Memory, bei dem CPU und GPU sich einen gemeinsamen Speicher teilen. Ein Mac mit 32 GB Unified Memory kann der GPU fast den gesamten Speicher zur Verfügung stellen. Das Problem des zu kleinen VRAMs existiert hier nicht im gleichen Maß. Dafür ist die Speicherbandbreite niedriger als bei dedizierten High-End-Grafikkarten.
Typische Stolpersteine beim GPU-Offloading
- KV-Cache vergessen: Der KV-Cache braucht zusätzlichen VRAM und wächst mit der Textlänge. Wenn Du nur die Modellgewichte berechnest, denkst Du, es passt alles, aber bei längeren Gesprächen wird der VRAM knapp und das Modell wird langsamer.
- Zu viele Layer auf die GPU gezwungen: Wenn Du manuell mehr Layer auf die GPU lädst, als Platz ist, stürzt das Programm ab oder es kommt zu Fehlern. Lass Ollama im Zweifel selbst entscheiden oder verringere die Anzahl schrittweise.
- Geschwindigkeit linear erwartet: 50 Prozent GPU-Offloading bedeutet nicht 50 Prozent der Geschwindigkeit. Der Datentransfer und die CPU-Berechnung bremsen überproportional. Setze Deine Erwartungen entsprechend.
- RAM-Geschwindigkeit unterschätzt: Die CPU-Berechnung der verbleibenden Layer hängt stark von der RAM-Geschwindigkeit ab. Langsamer DDR4-RAM macht das Partial Offloading deutlich langsamer als schneller DDR5-RAM.
- PCIe-Flaschenhals ignoriert: Der Datentransfer zwischen RAM und VRAM läuft über die PCIe-Schnittstelle. Eine alte PCIe-Version oder eine Karte im falschen Slot begrenzt die Übertragungsrate und bremst das Offloading.
- CPU als Flaschenhals übersehen: Wenn die CPU schwach ist, werden die Layer auf der CPU zum Flaschenhals. Eine starke GPU nützt wenig, wenn die CPU die restlichen Layer nicht schnell genug berechnet.
- Vollständiges Offloading angestrebt, wenn Partial reicht: Manchmal reicht Partial Offloading völlig aus, besonders für 13B-Modelle mit 75 Prozent auf der GPU. Du musst nicht zwingend eine größere Grafikkarte kaufen, nur damit 100 Prozent in den VRAM passen.
- Quantisierung nicht in Betracht gezogen: Bevor Du Dich mit langsamem Offloading abfindest, probiere eine stärkere Quantisierung. Oft passt das Modell dann vollständig in den VRAM und läuft deutlich schneller.
Hardware, Kosten und Sicherheit bei GPU-Offloading
Hardware: Für GPU-Offloading brauchst Du eine dedizierte Grafikkarte mit zumindest etwas VRAM, eine einigermaßen moderne CPU und ausreichend RAM. Wenn Du ein 13B-Modell mit 8 GB VRAM per Offloading betreiben willst, sollte Dein Rechner mindestens 16 GB RAM haben, besser 32 GB, damit das Modell im RAM Platz hat und das System nicht unter Druck gerät. Die CPU sollte mindestens ein aktueller 6-Kern-Prozessor sein, damit die CPU-Layer nicht zum Flaschenhals werden.
Kosten: GPU-Offloading selbst kostet nichts, es ist eine Funktion der Software. Die Kosten entstehen bei der Hardware. Eine gebrauchte RTX 3060 mit 12 GB VRAM bekommst Du ab etwa 200 Euro und kannst damit 13B-Modelle vollständig laden, ohne Offloading zu brauchen. Wenn Du bei einer kleineren Karte bleibst und Offloading nutzt, sparst Du Geld, zahlst aber mit Geschwindigkeit. Rechne selbst aus, ob Dir die Ersparnis die langsamere Inferenz wert ist.
Sicherheit: GPU-Offloading ändert nichts an der Sicherheit lokaler KI. Das Modell läuft vollständig auf Deinem Rechner, egal ob im VRAM, im RAM oder geteilt. Keine Anfrage geht an einen Server, keine Daten verlassen Dein System. Der Datentransfer zwischen RAM und VRAM findet intern statt und berührt keine Netzwerkverbindung. Wer lokale KI aus Datenschutzgründen nutzt, kann GPU-Offloading bedenkenlos einsetzen.
Weiterführende Links und Infos zu GPU-Offloading
- KI-Hardware Grundlagen für mehr Basiswissen über Hardware für lokale KI
- CPU vs. GPU wenn Du verstehen willst, warum die GPU schneller ist
- RAM vs. VRAM für die Grundlagen der beiden Speicherarten
- Speicherbandbreite für den wichtigsten Geschwindigkeitsfaktor
- Quantisierung wenn Du Modelle verkleinern willst, statt Offloading zu nutzen
- RAM und VRAM Anforderungen für genaue Zahlen zu Modellgrößen
- Ollama für das Tool, das Offloading automatisch beherrscht
- Kaufberatung wenn Du über eine neue Grafikkarte nachdenkst
FAQ: GPU-Offloading - Typische Fragen
Was ist GPU-Offloading einfach erklärt?
GPU-Offloading bedeutet, dass ein KI-Modell teils auf der GPU im VRAM und teils auf der CPU im RAM läuft. Das passiert, wenn das Modell nicht vollständig in den VRAM passt. Die GPU übernimmt den Großteil, die CPU den Rest.
Wann brauche ich GPU-Offloading?
Wenn Dein Modell mehr Speicher braucht, als Dein VRAM bietet. Typischer Fall: Du hast 8 GB VRAM und willst ein 13B-Modell laufen lassen, das 8 GB oder mehr braucht. Ohne Offloading läuft das Modell komplett auf der CPU und ist langsam.
Wie viel schneller ist GPU-Offloading gegenüber CPU-only?
Das hängt davon ab, wie viel vom Modell auf die GPU passt. Bei 75 Prozent auf der GPU erreichst Du oft das Drei- bis Fünffache der CPU-only-Geschwindigkeit. Bei 50 Prozent ist es deutlich weniger. Der Gewinn ist nicht linear.
Macht GPU-Offloading bei jedem Modell Sinn?
Nein. Bei kleinen Modellen, die vollständig in den VRAM passen, brauchst Du kein Offloading. Bei sehr großen Modellen, bei denen nur 10 Prozent auf die GPU passen, ist Offloading oft zu langsam, um praktikabel zu sein. Der Sweet Spot liegt bei 50 bis 80 Prozent des Modells auf der GPU.
Kann ich selbst einstellen, wie viele Layer auf die GPU kommen?
Ja. In Ollama nutzt Du den Parameter num_gpu, in llama.cpp den Parameter -ngl. Damit legst Du die Anzahl der GPU-Layer fest. Wenn Du den Parameter weglässt, entscheidet das Programm automatisch.
Was passiert, wenn ich mehr Layer auf die GPU lade, als Platz ist?
Das Programm bricht ab oder meldet einen Fehler, weil der VRAM nicht ausreicht. Reduziere die Anzahl der Layer, bis das Modell startet. Ollama macht das automatisch, wenn Du den Parameter nicht manuell setzt.
Was ist der Unterschied zwischen Partial und Full Offloading?
Full Offloading bedeutet, das gesamte Modell liegt im VRAM und die CPU ist nicht an der Inferenz beteiligt. Partial Offloading bedeutet, nur ein Teil liegt im VRAM, der Rest im RAM. Full Offloading ist schneller, braucht aber mehr VRAM.
Hilft mehr RAM beim GPU-Offloading?
Ja, aber nur indirekt. Mehr RAM bedeutet, dass die CPU-Layer schneller berechnet werden können, weil genug Speicher für das Modell und das System vorhanden ist. Die Geschwindigkeit hängt aber stärker von der RAM-Geschwindigkeit und der CPU-Leistung ab als von der reinen Menge.
Brauche ich GPU-Offloading bei Apple Silicon?
Nein, im klassischen Sinn nicht. Apple Silicon nutzt Unified Memory, bei dem CPU und GPU sich einen gemeinsamen Speicher teilen. Es gibt keine Trennung zwischen VRAM und RAM. Das Modell liegt im Shared Memory und die GPU greift direkt darauf zu. Das Konzept des Offloadings existiert hier nicht in der gleichen Form.
Wird GPU-Offloading bei mehreren Grafikkarten unterstützt?
Ja. Ollama und llama.cpp können Modelle auf mehrere GPUs verteilen. Jede GPU übernimmt einen Teil der Layer. Das ist eine Möglichkeit, große Modelle vollständig im VRAM zu halten, ohne Offloading auf die CPU zu brauchen.
Verliert das Modell an Qualität durch GPU-Offloading?
Nein. GPU-Offloading ändert nichts an den Berechnungen, es verteilt sie nur auf zwei Prozessoren. Das Ergebnis ist identisch, egal ob das Modell auf der GPU, auf der CPU oder geteilt läuft. Der einzige Unterschied ist die Geschwindigkeit.
Quellen und weiterführende Literatur
- llama.cpp Dokumentation zu GPU-Offloading und Layer-Verteilung
- Ollama Dokumentation zu GPU-Parametern
- RAM vs. VRAM als Grundlage für das Verständnis der Speicherarten
- Speicherbandbreite als entscheidender Faktor für die Geschwindigkeit
- Erfahrungen und Benchmarks aus der lokalen KI-Community


