Skip to content
BotServBotServ
LlamaLlama 3.1Llama 3.2MetaOllamalokale KI

Llama Modelle: Metas Open-Source-Serie

Llama Modelle: Llama 3.1, 3.2, 3.3 im Überblick. Größen, Fähigkeiten, Hardware-Bedarf und lokale Nutzung mit Ollama. Verständlich erklärt.

S

schutzgeist

11 min read
Llama Modelle von Meta

Llama Modelle: Metas Open-Source-Serie

Was dieser Artikel behandelt

  • Welche Llama-Modelle es gibt und wie sich die Generationen 3.1, 3.2 und 3.3 unterscheiden
  • Wie groß die einzelnen Varianten sind und wie viel VRAM Du für jede brauchst
  • Welche Stärken und Schwächen die Llama-Serie hat
  • Wie Du Llama-Modelle mit Ollama lokal startest
  • Welche Stolpersteine bei der Nutzung auftreten können

Einleitung

Llama ist wahrscheinlich die bekannteste Open-Source-Modellserie der Welt. Entwickelt von Meta, hat sie den Markt für lokale KI maßgeblich geprägt. Seit der ersten Generation im Jahr 2023 hat Meta kontinuierlich verbesserte Versionen veröffentlicht, die immer leistungsfähiger und gleichzeitig zugänglicher geworden sind. Wenn Du Dich für lokale KI interessierst, kommst Du an Llama fast nicht vorbei.

Die aktuellen Generationen Llama 3.1, Llama 3.2 und Llama 3.3 decken ein breites Spektrum ab: von winzigen Modellen für Smartphones bis hin zu riesigen Modellen, die mit kommerziellen Cloud-Diensten konkurrieren. In diesem Artikel bekommst Du einen vollständigen Überblick über die Serie, ihre Varianten und wie Du sie lokal einsetzt.

Warum brauche ich Llama?

Llama-Modelle sind aus mehreren Gründen interessant. Erstens sind sie frei verfügbar, zumindest für die meisten Anwendungsfälle. Du kannst sie herunterladen, lokal ausführen und sogar für kommerzielle Projekte nutzen, solange Du die Lizenzbedingungen von Meta einhältst. Zweitens decken sie ein ungewöhnlich breites Spektrum an Größen ab. Von 1 Milliarde Parametern bis zu 405 Milliarden ist für jede Hardware etwas dabei.

Drittens ist die Leistung der Llama-Modelle auf hohem Niveau. Llama 3.1 70B und Llama 3.3 70B erreichen in vielen Benchmarks Ergebnisse, die mit kommerziellen Modellen wie GPT-4 mithalten können. Gleichzeitig ist Llama 3.2 3B klein genug, um auf einem Laptop zu laufen. Das macht die Serie zu einer der vielseitigsten Optionen für lokale KI.

Viertens spielt die Community eine große Rolle. Weil Llama so populär ist, gibt es unzählige quantisierte Versionen, Fine-Tunes und Integrationswerkzeuge. Wenn Du ein Problem hast, hat wahrscheinlich schon jemand anderes dasselbe Problem gehabt und eine Lösung gepostet.

Llama kurz erklärt

Llama ist eine Serie von Large Language Models, die von Meta entwickelt und als Open-Weight-Modell veröffentlicht wird. “Open Weight” bedeutet, dass die Modellgewichte frei herunterladbar sind, auch wenn das Training selbst nicht vollständig offen ist. Die Modelle basieren auf der Transformer-Architektur und sind als Decoder-only-Modelle aufgebaut.

Die Modellnamen folgen einem einfachen Schema: Die Versionsnummer gibt die Generation an, die Zahl nach dem Buchstaben B steht für die Anzahl der Parameter in Milliarden. Llama 3.1 8B hat also 8 Milliarden Parameter, Llama 3.1 70B hat 70 Milliarden. Mehr Parameter bedeuten in der Regel bessere Leistung, aber auch höheren Hardware-Bedarf.

Die Modelle sind als Instruct-Versionen optimiert auf Dialog und Anweisungen. Es gibt auch Base-Versionen, die nur Text fortsetzen, aber für die meisten Nutzer sind die Instruct-Versionen relevant.

Für wen ist dieser Artikel gedacht?

Dieser Artikel richtet sich an:

  • Einsteiger, die verstehen wollen, welche Llama-Modelle es gibt und welches für sie passt
  • Heimanwender, die ein Llama-Modell auf ihrem eigenen Rechner ausführen möchten
  • Entwickler, die Llama in eigene Anwendungen einbinden wollen
  • Entscheider, die Llama als Alternative zu Cloud-KI evaluieren
  • Alle, die sich einen Überblick über die Llama-Serie verschaffen wollen, ohne sich durch technische Papers zu kämpfen

Wichtige Begriffe

BegriffBedeutung
ParameterDie gelernten Werte des Modells, Anzahl in Milliarden (B) angegeben
InstructAuf Anweisungen optimierte Version eines Modells
BaseUrsprüngliche Version ohne Instruct-Optimierung
TokenizerZerlegt Text in Tokens, die das Modell verarbeitet
Context LengthMaximale Anzahl Tokens, die das Modell gleichzeitig verarbeiten kann
QuantisierungReduktion der Speichergenauigkeit, um VRAM zu sparen
GGUFDateiformat für quantisierte Modelle, genutzt von Ollama
VRAMVideospeicher der Grafikkarte, entscheidend für lokale KI
Fine-TuneWeitertraining eines Modells auf spezialisierte Daten
MultimodalModell kann mehrere Eingabetypen verarbeiten, z.B. Text und Bilder

Die Llama-Generationen im Überblick

Meta hat die Llama-Serie in mehreren Schritten weiterentwickelt. Die aktuellen Generationen sind Llama 3.1, Llama 3.2 und Llama 3.3. Jede Generation hat eigene Schwerpunkte und Varianten.

Llama 3.1

Llama 3.1 ist die Basisgeneration der aktuellen Serie und wurde im Juli 2024 veröffentlicht. Sie umfasst drei Größen:

  • Llama 3.1 8B: Das kleinste Modell der Generation. Es ist schnell, braucht wenig VRAM und eignet sich hervorragend für den Einstieg. Mit einem Context Length von 128.000 Tokens kann es sehr lange Texte verarbeiten.
  • Llama 3.1 70B: Das mittlere Modell. Es bietet deutlich bessere Leistung als 8B, braucht aber auch deutlich mehr Hardware. In quantisierter Form läuft es auf High-End-Consumer-GPUs oder Macs mit viel Arbeitsspeicher.
  • Llama 3.1 405B: Das größte Modell der Serie und eines der größten frei verfügbaren Modelle überhaupt. Es konkurriert mit kommerziellen Top-Modellen, ist aber für den lokalen Betrieb auf Consumer-Hardware unrealistisch.

Llama 3.2

Llama 3.2 wurde im September 2024 veröffentlicht und bringt zwei wichtige Neuerungen. Erstens gibt es sehr kleine Modelle für Edge-Geräte, zweitens kommen Vision-Modelle hinzu.

  • Llama 3.2 1B: Ein winziges Modell mit 1 Milliarde Parametern. Es läuft auf Smartphones und Tablets und ist für einfache Aufgaben gedacht.
  • Llama 3.2 3B: Etwas größer und leistungsfähiger als 1B, aber immer noch sehr kompakt. Ideal für Laptops ohne starke Grafikkarte.
  • Llama 3.2 11B Vision: Ein multimodales Modell, das Text und Bilder verarbeiten kann. Es hat 11 Milliarden Parameter und ist das kleinste Vision-Modell der Serie.
  • Llama 3.2 90B Vision: Das große Vision-Modell. Es bietet starke Bildverständnis-Fähigkeiten, braucht aber entsprechende Hardware.

Llama 3.3

Llama 3.3 wurde im Dezember 2024 veröffentlicht und besteht bisher aus einer einzigen Variante:

  • Llama 3.3 70B: Ein verbessertes 70B-Modell, das die Leistung von Llama 3.1 405B bei deutlich geringerem Hardware-Bedarf erreicht. Es ist eines der besten Modelle in dieser Größenklasse.

Technische Spezifikationen

ModellParameterContext LengthTypErscheinungsdatum
Llama 3.1 8B8B128KTextJuli 2024
Llama 3.1 70B70B128KTextJuli 2024
Llama 3.1 405B405B128KTextJuli 2024
Llama 3.2 1B1B128KTextSeptember 2024
Llama 3.2 3B3B128KTextSeptember 2024
Llama 3.2 11B Vision11B128KMultimodalSeptember 2024
Llama 3.2 90B Vision90B128KMultimodalSeptember 2024
Llama 3.3 70B70B128KTextDezember 2024

Alle Modelle haben einen Context Length von 128.000 Tokens, was für die meisten Anwendungsfälle mehr als ausreichend ist. Mehr zur Bedeutung der Kontextlänge findest Du im Artikel Kontextlänge.

VRAM-Bedarf der Llama-Modelle

Der VRAM-Bedarf hängt von der Modellgröße und der Quantisierung ab. Die folgende Tabelle zeigt Richtwerte für die gängigste Quantisierungsstufe Q4_K_M.

ModellVRAM bei Q4_K_MVRAM bei Q8VRAM bei FP16
Llama 3.2 1Bca. 1 GBca. 1,5 GBca. 2 GB
Llama 3.2 3Bca. 2,5 GBca. 4 GBca. 6 GB
Llama 3.1 8Bca. 5 GBca. 9 GBca. 16 GB
Llama 3.2 11B Visionca. 7 GBca. 12 GBca. 22 GB
Llama 3.1 70B / 3.3 70Bca. 40 GBca. 75 GBca. 140 GB
Llama 3.2 90B Visionca. 52 GBca. 95 GBca. 180 GB
Llama 3.1 405Bca. 230 GBca. 430 GBca. 810 GB

Die Werte sind Richtwerte und variieren leicht je nach Implementierung. Zusätzlich zum Modell selbst brauchst Du etwa 1 bis 2 GB für den Kontext. Mehr Details findest Du im Artikel RAM und VRAM Anforderungen und unter Modellgröße und Speicherbedarf.

Leistung und Performance

Die Leistung der Llama-Modelle variiert stark zwischen den Größen. Hier ist eine grobe Einordnung:

Llama 3.2 1B und 3B sind für einfache Aufgaben geeignet: Zusammenfassungen, einfache Fragen, grundlegende Textverarbeitung. Sie sind nicht für komplexe Reasoning-Aufgaben oder anspruchsvolles Coding gedacht, aber sie laufen überall.

Llama 3.1 8B ist ein solider Allrounder. Es beherrscht Chat, einfaches Coding, Textzusammenfassungen und Übersetzungen. Für die meisten Heimanwender ist dies das beste Einstiegsmodell. Die Deutsch-Qualität ist gut, wenn auch nicht auf dem Niveau der englischen.

Llama 3.2 11B Vision erweitert 8B um Bildverständnis. Du kannst ihm ein Bild geben und Fragen dazu stellen. Das funktioniert gut für Beschreibungen und einfache Analysen, stößt aber bei komplexen visuellen Reasoning-Aufgaben an Grenzen.

Llama 3.1 70B und Llama 3.3 70B sind deutlich leistungsfähiger. Sie beherrschen komplexe Reasoning-Aufgaben, anspruchsvolles Coding und mehrsprachige Kommunikation. Llama 3.3 70B ist dabei die bessere Wahl, da es die Leistung von 405B bei geringerem Bedarf erreicht.

Llama 3.2 90B Vision ist das stärkste Vision-Modell der Serie. Es kann komplexe Bilder analysieren, Diagramme lesen und visuelle Zusammenhänge verstehen.

Llama 3.1 405B ist das leistungsfähigste Modell der Serie, aber für den lokalen Betrieb auf Consumer-Hardware nicht praktikabel. Es wird meist über API oder auf Server-Infrastruktur genutzt.

Anwendungsfälle für Llama-Modelle

AnwendungsfallEmpfohlenes ModellWarum
Chat auf einem LaptopLlama 3.2 3BKlein, schnell, läuft überall
Allrounder für Text und CodeLlama 3.1 8BBeste Balance aus Größe und Leistung
Bildanalyse und BeschreibungLlama 3.2 11B VisionMultimodal, moderate Hardware
Komplexes Coding und ReasoningLlama 3.3 70BSehr starke Leistung, wenn Hardware reicht
Mehrsprachige AnwendungenLlama 3.1 8B oder 70BGute Mehrsprachigkeit durch Training
Edge-Deployment auf MobilgerätenLlama 3.2 1BMinimaler Footprint

Wenn Du unsicher bist, welches Modell für Dich passt, hilft der Artikel Modell finden bei der Entscheidung.

Llama-Modelle mit Ollama ausführen

Ollama ist die einfachste Methode, um Llama-Modelle lokal zu starten. Du brauchst nur einen Befehl im Terminal.

Llama 3.1 8B starten:

ollama run llama3.1

Llama 3.2 3B starten:

ollama run llama3.2:3b

Llama 3.2 11B Vision starten:

ollama run llama3.2-vision

Llama 3.3 70B starten:

ollama run llama3.3

Ollama lädt automatisch eine passende quantisierte Version herunter, standardmäßig Q4_K_M. Wenn Du eine andere Quantisierungsstufe nutzen willst, kannst Du diese angeben:

ollama run llama3.1:8b-q5_K_M

Modelle, die Du nicht mehr brauchst, kannst Du mit dem folgenden Befehl entfernen. Mehr dazu im Artikel Modelle verwalten:

ollama rm llama3.1

Typische Stolpersteine

1. Zu großes Modell für die Hardware: Llama 70B braucht auch quantisiert rund 40 GB VRAM. Das haben nur wenige Consumer-GPUs. Wenn Du 70B ausführen willst, brauchst Du entweder eine RTX 4090 mit 24 GB plus System-RAM-Auslagerung oder einen Mac mit 64 GB oder mehr.

2. Verwechslung von Base und Instruct: Base-Modelle setzen Text fort, befolgen aber keine Anweisungen. Für Chat und Aufgaben brauchst Du die Instruct-Version. Ollama verwendet standardmäßig Instruct, aber bei manuellen Downloads musst Du selbst aufpassen.

3. Context Length überlastet den VRAM: 128.000 Tokens Context Length klingen toll, aber ein voll ausgenutzter Kontext verbraucht erheblich zusätzlichen VRAM. Bei 8B-Modellen auf 8-GB-GPUs solltest Du den Kontext auf 4.000 bis 8.000 Tokens begrenzen.

4. Deutsch-Qualität überschätzen: Llama-Modelle sind primär auf Englisch trainiert. Deutsch funktioniert gut, aber bei komplexen Texten können unnatürliche Formulierungen oder englische Lehnwörter auftreten. Für reine Deutsch-Anwendungen kann Mistral oder Qwen die bessere Wahl sein.

5. Vision-Modelle ohne Bilder testen: Llama 3.2 Vision-Modelle sind für Text und Bilder optimiert. Wenn Du sie nur für Text nutzt, sind sie nicht besser als reine Text-Modelle und brauchen mehr VRAM. Nutze Vision nur, wenn Du wirklich Bilder verarbeitest.

6. Lizenzbedingungen ignorieren: Llama ist nicht vollständig frei. Metas Lizenz schränkt die kommerzielle Nutzung ein, besonders für sehr große Nutzerzahlen. Lies die Lizenz, bevor Du Llama in einem kommerziellen Produkt einsetzt.

7. Alte Generationen nutzen: Llama 2 und Llama 3 (ohne .1) sind älter und deutlich schwächer. Wenn Du ein Llama-Modell startest, nutze immer die aktuelle Generation, also 3.1, 3.2 oder 3.3.

Hardware, Kosten und Sicherheit

Hardware: Der Hardware-Bedarf reicht extrem. Llama 3.2 1B läuft auf fast jedem Gerät, Llama 3.1 8B braucht eine Grafikkarte mit 8 GB VRAM oder einen Mac mit 16 GB RAM, und Llama 70B erfordert High-End-Hardware. Die gute Nachricht: Für den Einstieg reicht eine Consumer-GPU wie die RTX 3060 mit 12 GB völlig aus.

Kosten: Die Modelle selbst sind kostenlos. Die Kosten liegen in der Hardware. Eine RTX 3060 für 8B-Modelle kostet etwa 300 Euro. Wer 70B-Modelle ausführen will, braucht Hardware im vierstelligen Bereich oder einen Mac Studio mit 128 GB RAM. Cloud-Hosting ist eine Alternative, widerspricht aber dem Gedanken der lokalen KI.

Sicherheit: Llama-Modelle laufen lokal, Deine Daten bleiben auf Deinem Rechner. Das ist ein großer Vorteil gegenüber Cloud-KI. Beachte jedoch, dass Llama-Modelle keine eingebauten Safety-Filter haben. Sie können unangemessene Inhalte produzieren, wenn sie dazu aufgefordert werden. Für produktive Anwendungen solltest Du zusätzliche Safety-Maßnahmen ergreifen.

FAQ

Welches Llama-Modell soll ich als Erstes ausprobieren?

Llama 3.1 8B ist die beste Wahl für den Einstieg. Es läuft auf den meisten Consumer-Grafikkarten und bietet eine gute Balance aus Leistung und Hardware-Bedarf. Starte mit ollama run llama3.1.

Kann ich Llama 70B auf meiner Grafikkarte ausführen?

Das hängt von Deiner GPU ab. Quantisiert (Q4_K_M) braucht 70B etwa 40 GB VRAM. Eine einzelne RTX 4090 mit 24 GB reicht nicht aus. Du brauchst entweder zwei GPUs, eine GPU mit Auslagerung auf den System-RAM oder einen Mac mit 64 GB RAM oder mehr.

Was ist der Unterschied zwischen Llama 3.1 und Llama 3.3?

Llama 3.3 70B ist eine verbesserte Version von Llama 3.1 70B. Es erreicht eine ähnliche Leistung wie das viel größere Llama 3.1 405B, benötigt aber deutlich weniger Hardware. Wenn Du 70B nutzen kannst, wähle immer 3.3 über 3.1.

Sind Llama-Modelle kostenlos?

Die Modellgewichte sind kostenlos herunterladbar. Die Lizenz von Meta erlaubt die kommerzielle Nutzung mit Einschränkungen, insbesondere für Unternehmen mit mehr als 700 Millionen monatlichen Nutzern. Für die meisten Nutzer und kleine Unternehmen ist die Nutzung kostenlos.

Kann Llama Bilder verstehen?

Ja, die Llama 3.2 Vision-Modelle (11B und 90B) können Bilder verarbeiten. Du kannst ihnen ein Bild geben und Fragen dazu stellen. Die reinen Text-Modelle wie Llama 3.1 8B können keine Bilder verarbeiten.

Wie gut ist Llama auf Deutsch?

Llama-Modelle beherrschen Deutsch gut, sind aber primär auf Englisch trainiert. Für einfache bis mittlere Aufgaben ist die Deutsch-Qualität ausreichend. Bei komplexen Texten können unnatürliche Formulierungen auftreten. Qwen und Mistral sind oft besser auf Deutsch optimiert.

Was bedeutet der Context Length von 128.000 Tokens?

Das Modell kann bis zu 128.000 Tokens gleichzeitig verarbeiten, was etwa 100.000 Wörtern entspricht. Das reicht für lange Dokumente oder ausgedehnte Konversationen. Beachte, dass ein voll ausgenutzter Kontext zusätzlichen VRAM verbraucht.

Kann ich Llama auf einem Mac ausführen?

Ja. Apple Silicon teilt sich Arbeitsspeicher zwischen CPU und GPU, was große Modelle ermöglicht. Ein Mac mit 16 GB RAM kann Llama 3.1 8B gut ausführen. Für 70B-Modelle brauchst Du mindestens 64 GB RAM, besser 128 GB.

Was ist der Unterschied zwischen Base und Instruct?

Base-Modelle setzen Text fort, befolgen aber keine Anweisungen. Instruct-Modelle sind auf Dialog und das Befolgen von Anweisungen optimiert. Für Chat und die meisten Aufgaben brauchst Du die Instruct-Version. Ollama verwendet standardmäßig Instruct.

Kann ich Llama für mein kommerzielles Projekt nutzen?

Ja, unter bestimmten Bedingungen. Metas Llama-Lizenz erlaubt kommerzielle Nutzung, hat aber Einschränkungen, besonders für sehr große Nutzerzahlen. Lies die Lizenzbedingungen auf der Meta-Website, bevor Du Llama kommerziell einsetzt.

Sind Llama-Modelle besser als Cloud-KI wie ChatGPT?

Das größte Modell, Llama 3.1 405B, kann mit kommerziellen Top-Modellen mithalten. Die kleineren Modelle sind schwächer, bieten aber den Vorteil der lokalen Ausführung, des Datenschutzes und der Kostenfreiheit. Für die meisten lokalen Anwendungsfälle sind 8B oder 70B völlig ausreichend.

Quellen

  • Meta AI - Llama Modellübersicht und Dokumentation
  • Ollama Modellbibliothek - Llama-Modelle
  • Hugging Face - Meta Llama Modellseite
  • Meta Llama 3.1, 3.2 und 3.3 Technische Berichte
Zurück zum KI Blog
Share:

Ähnliche Beiträge