Llama Modelle: Metas Open-Source-Serie
Was dieser Artikel behandelt
- Welche Llama-Modelle es gibt und wie sich die Generationen 3.1, 3.2 und 3.3 unterscheiden
- Wie groß die einzelnen Varianten sind und wie viel VRAM Du für jede brauchst
- Welche Stärken und Schwächen die Llama-Serie hat
- Wie Du Llama-Modelle mit Ollama lokal startest
- Welche Stolpersteine bei der Nutzung auftreten können
Einleitung
Llama ist wahrscheinlich die bekannteste Open-Source-Modellserie der Welt. Entwickelt von Meta, hat sie den Markt für lokale KI maßgeblich geprägt. Seit der ersten Generation im Jahr 2023 hat Meta kontinuierlich verbesserte Versionen veröffentlicht, die immer leistungsfähiger und gleichzeitig zugänglicher geworden sind. Wenn Du Dich für lokale KI interessierst, kommst Du an Llama fast nicht vorbei.
Die aktuellen Generationen Llama 3.1, Llama 3.2 und Llama 3.3 decken ein breites Spektrum ab: von winzigen Modellen für Smartphones bis hin zu riesigen Modellen, die mit kommerziellen Cloud-Diensten konkurrieren. In diesem Artikel bekommst Du einen vollständigen Überblick über die Serie, ihre Varianten und wie Du sie lokal einsetzt.
Warum brauche ich Llama?
Llama-Modelle sind aus mehreren Gründen interessant. Erstens sind sie frei verfügbar, zumindest für die meisten Anwendungsfälle. Du kannst sie herunterladen, lokal ausführen und sogar für kommerzielle Projekte nutzen, solange Du die Lizenzbedingungen von Meta einhältst. Zweitens decken sie ein ungewöhnlich breites Spektrum an Größen ab. Von 1 Milliarde Parametern bis zu 405 Milliarden ist für jede Hardware etwas dabei.
Drittens ist die Leistung der Llama-Modelle auf hohem Niveau. Llama 3.1 70B und Llama 3.3 70B erreichen in vielen Benchmarks Ergebnisse, die mit kommerziellen Modellen wie GPT-4 mithalten können. Gleichzeitig ist Llama 3.2 3B klein genug, um auf einem Laptop zu laufen. Das macht die Serie zu einer der vielseitigsten Optionen für lokale KI.
Viertens spielt die Community eine große Rolle. Weil Llama so populär ist, gibt es unzählige quantisierte Versionen, Fine-Tunes und Integrationswerkzeuge. Wenn Du ein Problem hast, hat wahrscheinlich schon jemand anderes dasselbe Problem gehabt und eine Lösung gepostet.
Llama kurz erklärt
Llama ist eine Serie von Large Language Models, die von Meta entwickelt und als Open-Weight-Modell veröffentlicht wird. “Open Weight” bedeutet, dass die Modellgewichte frei herunterladbar sind, auch wenn das Training selbst nicht vollständig offen ist. Die Modelle basieren auf der Transformer-Architektur und sind als Decoder-only-Modelle aufgebaut.
Die Modellnamen folgen einem einfachen Schema: Die Versionsnummer gibt die Generation an, die Zahl nach dem Buchstaben B steht für die Anzahl der Parameter in Milliarden. Llama 3.1 8B hat also 8 Milliarden Parameter, Llama 3.1 70B hat 70 Milliarden. Mehr Parameter bedeuten in der Regel bessere Leistung, aber auch höheren Hardware-Bedarf.
Die Modelle sind als Instruct-Versionen optimiert auf Dialog und Anweisungen. Es gibt auch Base-Versionen, die nur Text fortsetzen, aber für die meisten Nutzer sind die Instruct-Versionen relevant.
Für wen ist dieser Artikel gedacht?
Dieser Artikel richtet sich an:
- Einsteiger, die verstehen wollen, welche Llama-Modelle es gibt und welches für sie passt
- Heimanwender, die ein Llama-Modell auf ihrem eigenen Rechner ausführen möchten
- Entwickler, die Llama in eigene Anwendungen einbinden wollen
- Entscheider, die Llama als Alternative zu Cloud-KI evaluieren
- Alle, die sich einen Überblick über die Llama-Serie verschaffen wollen, ohne sich durch technische Papers zu kämpfen
Wichtige Begriffe
| Begriff | Bedeutung |
|---|---|
| Parameter | Die gelernten Werte des Modells, Anzahl in Milliarden (B) angegeben |
| Instruct | Auf Anweisungen optimierte Version eines Modells |
| Base | Ursprüngliche Version ohne Instruct-Optimierung |
| Tokenizer | Zerlegt Text in Tokens, die das Modell verarbeitet |
| Context Length | Maximale Anzahl Tokens, die das Modell gleichzeitig verarbeiten kann |
| Quantisierung | Reduktion der Speichergenauigkeit, um VRAM zu sparen |
| GGUF | Dateiformat für quantisierte Modelle, genutzt von Ollama |
| VRAM | Videospeicher der Grafikkarte, entscheidend für lokale KI |
| Fine-Tune | Weitertraining eines Modells auf spezialisierte Daten |
| Multimodal | Modell kann mehrere Eingabetypen verarbeiten, z.B. Text und Bilder |
Die Llama-Generationen im Überblick
Meta hat die Llama-Serie in mehreren Schritten weiterentwickelt. Die aktuellen Generationen sind Llama 3.1, Llama 3.2 und Llama 3.3. Jede Generation hat eigene Schwerpunkte und Varianten.
Llama 3.1
Llama 3.1 ist die Basisgeneration der aktuellen Serie und wurde im Juli 2024 veröffentlicht. Sie umfasst drei Größen:
- Llama 3.1 8B: Das kleinste Modell der Generation. Es ist schnell, braucht wenig VRAM und eignet sich hervorragend für den Einstieg. Mit einem Context Length von 128.000 Tokens kann es sehr lange Texte verarbeiten.
- Llama 3.1 70B: Das mittlere Modell. Es bietet deutlich bessere Leistung als 8B, braucht aber auch deutlich mehr Hardware. In quantisierter Form läuft es auf High-End-Consumer-GPUs oder Macs mit viel Arbeitsspeicher.
- Llama 3.1 405B: Das größte Modell der Serie und eines der größten frei verfügbaren Modelle überhaupt. Es konkurriert mit kommerziellen Top-Modellen, ist aber für den lokalen Betrieb auf Consumer-Hardware unrealistisch.
Llama 3.2
Llama 3.2 wurde im September 2024 veröffentlicht und bringt zwei wichtige Neuerungen. Erstens gibt es sehr kleine Modelle für Edge-Geräte, zweitens kommen Vision-Modelle hinzu.
- Llama 3.2 1B: Ein winziges Modell mit 1 Milliarde Parametern. Es läuft auf Smartphones und Tablets und ist für einfache Aufgaben gedacht.
- Llama 3.2 3B: Etwas größer und leistungsfähiger als 1B, aber immer noch sehr kompakt. Ideal für Laptops ohne starke Grafikkarte.
- Llama 3.2 11B Vision: Ein multimodales Modell, das Text und Bilder verarbeiten kann. Es hat 11 Milliarden Parameter und ist das kleinste Vision-Modell der Serie.
- Llama 3.2 90B Vision: Das große Vision-Modell. Es bietet starke Bildverständnis-Fähigkeiten, braucht aber entsprechende Hardware.
Llama 3.3
Llama 3.3 wurde im Dezember 2024 veröffentlicht und besteht bisher aus einer einzigen Variante:
- Llama 3.3 70B: Ein verbessertes 70B-Modell, das die Leistung von Llama 3.1 405B bei deutlich geringerem Hardware-Bedarf erreicht. Es ist eines der besten Modelle in dieser Größenklasse.
Technische Spezifikationen
| Modell | Parameter | Context Length | Typ | Erscheinungsdatum |
|---|---|---|---|---|
| Llama 3.1 8B | 8B | 128K | Text | Juli 2024 |
| Llama 3.1 70B | 70B | 128K | Text | Juli 2024 |
| Llama 3.1 405B | 405B | 128K | Text | Juli 2024 |
| Llama 3.2 1B | 1B | 128K | Text | September 2024 |
| Llama 3.2 3B | 3B | 128K | Text | September 2024 |
| Llama 3.2 11B Vision | 11B | 128K | Multimodal | September 2024 |
| Llama 3.2 90B Vision | 90B | 128K | Multimodal | September 2024 |
| Llama 3.3 70B | 70B | 128K | Text | Dezember 2024 |
Alle Modelle haben einen Context Length von 128.000 Tokens, was für die meisten Anwendungsfälle mehr als ausreichend ist. Mehr zur Bedeutung der Kontextlänge findest Du im Artikel Kontextlänge.
VRAM-Bedarf der Llama-Modelle
Der VRAM-Bedarf hängt von der Modellgröße und der Quantisierung ab. Die folgende Tabelle zeigt Richtwerte für die gängigste Quantisierungsstufe Q4_K_M.
| Modell | VRAM bei Q4_K_M | VRAM bei Q8 | VRAM bei FP16 |
|---|---|---|---|
| Llama 3.2 1B | ca. 1 GB | ca. 1,5 GB | ca. 2 GB |
| Llama 3.2 3B | ca. 2,5 GB | ca. 4 GB | ca. 6 GB |
| Llama 3.1 8B | ca. 5 GB | ca. 9 GB | ca. 16 GB |
| Llama 3.2 11B Vision | ca. 7 GB | ca. 12 GB | ca. 22 GB |
| Llama 3.1 70B / 3.3 70B | ca. 40 GB | ca. 75 GB | ca. 140 GB |
| Llama 3.2 90B Vision | ca. 52 GB | ca. 95 GB | ca. 180 GB |
| Llama 3.1 405B | ca. 230 GB | ca. 430 GB | ca. 810 GB |
Die Werte sind Richtwerte und variieren leicht je nach Implementierung. Zusätzlich zum Modell selbst brauchst Du etwa 1 bis 2 GB für den Kontext. Mehr Details findest Du im Artikel RAM und VRAM Anforderungen und unter Modellgröße und Speicherbedarf.
Leistung und Performance
Die Leistung der Llama-Modelle variiert stark zwischen den Größen. Hier ist eine grobe Einordnung:
Llama 3.2 1B und 3B sind für einfache Aufgaben geeignet: Zusammenfassungen, einfache Fragen, grundlegende Textverarbeitung. Sie sind nicht für komplexe Reasoning-Aufgaben oder anspruchsvolles Coding gedacht, aber sie laufen überall.
Llama 3.1 8B ist ein solider Allrounder. Es beherrscht Chat, einfaches Coding, Textzusammenfassungen und Übersetzungen. Für die meisten Heimanwender ist dies das beste Einstiegsmodell. Die Deutsch-Qualität ist gut, wenn auch nicht auf dem Niveau der englischen.
Llama 3.2 11B Vision erweitert 8B um Bildverständnis. Du kannst ihm ein Bild geben und Fragen dazu stellen. Das funktioniert gut für Beschreibungen und einfache Analysen, stößt aber bei komplexen visuellen Reasoning-Aufgaben an Grenzen.
Llama 3.1 70B und Llama 3.3 70B sind deutlich leistungsfähiger. Sie beherrschen komplexe Reasoning-Aufgaben, anspruchsvolles Coding und mehrsprachige Kommunikation. Llama 3.3 70B ist dabei die bessere Wahl, da es die Leistung von 405B bei geringerem Bedarf erreicht.
Llama 3.2 90B Vision ist das stärkste Vision-Modell der Serie. Es kann komplexe Bilder analysieren, Diagramme lesen und visuelle Zusammenhänge verstehen.
Llama 3.1 405B ist das leistungsfähigste Modell der Serie, aber für den lokalen Betrieb auf Consumer-Hardware nicht praktikabel. Es wird meist über API oder auf Server-Infrastruktur genutzt.
Anwendungsfälle für Llama-Modelle
| Anwendungsfall | Empfohlenes Modell | Warum |
|---|---|---|
| Chat auf einem Laptop | Llama 3.2 3B | Klein, schnell, läuft überall |
| Allrounder für Text und Code | Llama 3.1 8B | Beste Balance aus Größe und Leistung |
| Bildanalyse und Beschreibung | Llama 3.2 11B Vision | Multimodal, moderate Hardware |
| Komplexes Coding und Reasoning | Llama 3.3 70B | Sehr starke Leistung, wenn Hardware reicht |
| Mehrsprachige Anwendungen | Llama 3.1 8B oder 70B | Gute Mehrsprachigkeit durch Training |
| Edge-Deployment auf Mobilgeräten | Llama 3.2 1B | Minimaler Footprint |
Wenn Du unsicher bist, welches Modell für Dich passt, hilft der Artikel Modell finden bei der Entscheidung.
Llama-Modelle mit Ollama ausführen
Ollama ist die einfachste Methode, um Llama-Modelle lokal zu starten. Du brauchst nur einen Befehl im Terminal.
Llama 3.1 8B starten:
ollama run llama3.1
Llama 3.2 3B starten:
ollama run llama3.2:3b
Llama 3.2 11B Vision starten:
ollama run llama3.2-vision
Llama 3.3 70B starten:
ollama run llama3.3
Ollama lädt automatisch eine passende quantisierte Version herunter, standardmäßig Q4_K_M. Wenn Du eine andere Quantisierungsstufe nutzen willst, kannst Du diese angeben:
ollama run llama3.1:8b-q5_K_M
Modelle, die Du nicht mehr brauchst, kannst Du mit dem folgenden Befehl entfernen. Mehr dazu im Artikel Modelle verwalten:
ollama rm llama3.1
Typische Stolpersteine
1. Zu großes Modell für die Hardware: Llama 70B braucht auch quantisiert rund 40 GB VRAM. Das haben nur wenige Consumer-GPUs. Wenn Du 70B ausführen willst, brauchst Du entweder eine RTX 4090 mit 24 GB plus System-RAM-Auslagerung oder einen Mac mit 64 GB oder mehr.
2. Verwechslung von Base und Instruct: Base-Modelle setzen Text fort, befolgen aber keine Anweisungen. Für Chat und Aufgaben brauchst Du die Instruct-Version. Ollama verwendet standardmäßig Instruct, aber bei manuellen Downloads musst Du selbst aufpassen.
3. Context Length überlastet den VRAM: 128.000 Tokens Context Length klingen toll, aber ein voll ausgenutzter Kontext verbraucht erheblich zusätzlichen VRAM. Bei 8B-Modellen auf 8-GB-GPUs solltest Du den Kontext auf 4.000 bis 8.000 Tokens begrenzen.
4. Deutsch-Qualität überschätzen: Llama-Modelle sind primär auf Englisch trainiert. Deutsch funktioniert gut, aber bei komplexen Texten können unnatürliche Formulierungen oder englische Lehnwörter auftreten. Für reine Deutsch-Anwendungen kann Mistral oder Qwen die bessere Wahl sein.
5. Vision-Modelle ohne Bilder testen: Llama 3.2 Vision-Modelle sind für Text und Bilder optimiert. Wenn Du sie nur für Text nutzt, sind sie nicht besser als reine Text-Modelle und brauchen mehr VRAM. Nutze Vision nur, wenn Du wirklich Bilder verarbeitest.
6. Lizenzbedingungen ignorieren: Llama ist nicht vollständig frei. Metas Lizenz schränkt die kommerzielle Nutzung ein, besonders für sehr große Nutzerzahlen. Lies die Lizenz, bevor Du Llama in einem kommerziellen Produkt einsetzt.
7. Alte Generationen nutzen: Llama 2 und Llama 3 (ohne .1) sind älter und deutlich schwächer. Wenn Du ein Llama-Modell startest, nutze immer die aktuelle Generation, also 3.1, 3.2 oder 3.3.
Hardware, Kosten und Sicherheit
Hardware: Der Hardware-Bedarf reicht extrem. Llama 3.2 1B läuft auf fast jedem Gerät, Llama 3.1 8B braucht eine Grafikkarte mit 8 GB VRAM oder einen Mac mit 16 GB RAM, und Llama 70B erfordert High-End-Hardware. Die gute Nachricht: Für den Einstieg reicht eine Consumer-GPU wie die RTX 3060 mit 12 GB völlig aus.
Kosten: Die Modelle selbst sind kostenlos. Die Kosten liegen in der Hardware. Eine RTX 3060 für 8B-Modelle kostet etwa 300 Euro. Wer 70B-Modelle ausführen will, braucht Hardware im vierstelligen Bereich oder einen Mac Studio mit 128 GB RAM. Cloud-Hosting ist eine Alternative, widerspricht aber dem Gedanken der lokalen KI.
Sicherheit: Llama-Modelle laufen lokal, Deine Daten bleiben auf Deinem Rechner. Das ist ein großer Vorteil gegenüber Cloud-KI. Beachte jedoch, dass Llama-Modelle keine eingebauten Safety-Filter haben. Sie können unangemessene Inhalte produzieren, wenn sie dazu aufgefordert werden. Für produktive Anwendungen solltest Du zusätzliche Safety-Maßnahmen ergreifen.
Weiterführende Links
- Lokale KI Modelle - Überblick aller Modell-Artikel
- Modell finden - Hilfe bei der Modellwahl
- Ollama - Die einfachste Methode für lokale Modelle
- Modelle verwalten - Modelle in Ollama verwalten
- Quantisierung - Wie Modelle kleiner gemacht werden
- RAM und VRAM Anforderungen - Speicherbedarf verstehen
- Modellgröße und Speicherbedarf - Hardware-Grundlagen
- Was ist lokale KI? - Grundlagenartikel
FAQ
Welches Llama-Modell soll ich als Erstes ausprobieren?
Llama 3.1 8B ist die beste Wahl für den Einstieg. Es läuft auf den meisten Consumer-Grafikkarten und bietet eine gute Balance aus Leistung und Hardware-Bedarf. Starte mit ollama run llama3.1.
Kann ich Llama 70B auf meiner Grafikkarte ausführen?
Das hängt von Deiner GPU ab. Quantisiert (Q4_K_M) braucht 70B etwa 40 GB VRAM. Eine einzelne RTX 4090 mit 24 GB reicht nicht aus. Du brauchst entweder zwei GPUs, eine GPU mit Auslagerung auf den System-RAM oder einen Mac mit 64 GB RAM oder mehr.
Was ist der Unterschied zwischen Llama 3.1 und Llama 3.3?
Llama 3.3 70B ist eine verbesserte Version von Llama 3.1 70B. Es erreicht eine ähnliche Leistung wie das viel größere Llama 3.1 405B, benötigt aber deutlich weniger Hardware. Wenn Du 70B nutzen kannst, wähle immer 3.3 über 3.1.
Sind Llama-Modelle kostenlos?
Die Modellgewichte sind kostenlos herunterladbar. Die Lizenz von Meta erlaubt die kommerzielle Nutzung mit Einschränkungen, insbesondere für Unternehmen mit mehr als 700 Millionen monatlichen Nutzern. Für die meisten Nutzer und kleine Unternehmen ist die Nutzung kostenlos.
Kann Llama Bilder verstehen?
Ja, die Llama 3.2 Vision-Modelle (11B und 90B) können Bilder verarbeiten. Du kannst ihnen ein Bild geben und Fragen dazu stellen. Die reinen Text-Modelle wie Llama 3.1 8B können keine Bilder verarbeiten.
Wie gut ist Llama auf Deutsch?
Llama-Modelle beherrschen Deutsch gut, sind aber primär auf Englisch trainiert. Für einfache bis mittlere Aufgaben ist die Deutsch-Qualität ausreichend. Bei komplexen Texten können unnatürliche Formulierungen auftreten. Qwen und Mistral sind oft besser auf Deutsch optimiert.
Was bedeutet der Context Length von 128.000 Tokens?
Das Modell kann bis zu 128.000 Tokens gleichzeitig verarbeiten, was etwa 100.000 Wörtern entspricht. Das reicht für lange Dokumente oder ausgedehnte Konversationen. Beachte, dass ein voll ausgenutzter Kontext zusätzlichen VRAM verbraucht.
Kann ich Llama auf einem Mac ausführen?
Ja. Apple Silicon teilt sich Arbeitsspeicher zwischen CPU und GPU, was große Modelle ermöglicht. Ein Mac mit 16 GB RAM kann Llama 3.1 8B gut ausführen. Für 70B-Modelle brauchst Du mindestens 64 GB RAM, besser 128 GB.
Was ist der Unterschied zwischen Base und Instruct?
Base-Modelle setzen Text fort, befolgen aber keine Anweisungen. Instruct-Modelle sind auf Dialog und das Befolgen von Anweisungen optimiert. Für Chat und die meisten Aufgaben brauchst Du die Instruct-Version. Ollama verwendet standardmäßig Instruct.
Kann ich Llama für mein kommerzielles Projekt nutzen?
Ja, unter bestimmten Bedingungen. Metas Llama-Lizenz erlaubt kommerzielle Nutzung, hat aber Einschränkungen, besonders für sehr große Nutzerzahlen. Lies die Lizenzbedingungen auf der Meta-Website, bevor Du Llama kommerziell einsetzt.
Sind Llama-Modelle besser als Cloud-KI wie ChatGPT?
Das größte Modell, Llama 3.1 405B, kann mit kommerziellen Top-Modellen mithalten. Die kleineren Modelle sind schwächer, bieten aber den Vorteil der lokalen Ausführung, des Datenschutzes und der Kostenfreiheit. Für die meisten lokalen Anwendungsfälle sind 8B oder 70B völlig ausreichend.
Quellen
- Meta AI - Llama Modellübersicht und Dokumentation
- Ollama Modellbibliothek - Llama-Modelle
- Hugging Face - Meta Llama Modellseite
- Meta Llama 3.1, 3.2 und 3.3 Technische Berichte


