Qwen Modelle: Alibabas Multilingual-Serie
Was dieser Artikel behandelt
- Welche Qwen-Modelle es gibt und wie sich die Varianten unterscheiden
- Warum Qwen besonders für Mehrsprachigkeit und Coding bekannt ist
- Wie viel VRAM Du für die einzelnen Qwen-Modelle brauchst
- Wie Du Qwen-Modelle mit Ollama lokal startest
- Welche Besonderheiten Qwen VL und QwQ aufweisen
Einleitung
Qwen ist die KI-Modellserie von Alibaba Cloud und eine der wichtigsten Open-Source-Familien neben Llama und Mistral. Seit der ersten Version hat sich Qwen von einem chinesischen Projekt zu einem weltweit genutzten Modell entwickelt. Die Serie zeichnet sich durch drei Besonderheiten aus: außergewöhnliche Mehrsprachigkeit, starke Coding-Fähigkeiten und ein breites Größenspektrum.
Wenn Du ein Modell suchst, das mehrere Sprachen gut beherrscht oder besonders im Programmieren überzeugt, ist Qwen eine der ersten Adressen. In diesem Artikel bekommst Du einen vollständigen Überblick über die Modellserie, ihre Stärken und wie Du sie lokal einsetzt.
Warum brauche ich Qwen?
Qwen-Modelle haben mehrere Eigenschaften, die sie von der Konkurrenz abheben. Erstens sind sie außergewöhnlich mehrsprachig. Qwen wurde von Anfang an auf eine große Zahl von Sprachen trainiert, darunter Chinesisch, Englisch, Deutsch, Französisch, Spanisch und viele mehr. Die Mehrsprachigkeit ist nicht nur ein Nebenprodukt, sondern ein Kernziel des Trainings.
Zweitens sind Qwen-Modelle besonders stark im Coding. In verschiedenen Coding-Benchmarks erreichen Qwen-Modelle regelmäßig Spitzenplätze, oft noch vor Llama und Mistral. Wenn Du ein Modell für Code-Generierung, Code-Analyse oder Debugging suchst, ist Qwen eine der besten Optionen.
Drittens deckt Qwen ein extrem breites Größenspektrum ab. Von 0,5 Milliarden Parametern bis zu 72 Milliarden ist für jede Hardware etwas dabei. Das kleinste Modell läuft auf einem Smartphone, das größte konkurriert mit kommerziellen Top-Modellen.
Viertens bietet Qwen mit Qwen VL ein Vision-Modell und mit QwQ ein Reasoning-Modell an. Diese spezialisierten Varianten erweitern die Möglichkeiten über reinen Text hinaus.
Qwen kurz erklärt
Qwen ist eine Serie von Large Language Models, die von Alibaba Cloud entwickelt werden. Der Name “Qwen” steht für “Tongyi Qianwen”, was frei übersetzt “Wahrheit durch tausend Fragen” bedeutet. Die Modelle basieren auf der Transformer-Architektur und sind als Decoder-only-Modelle aufgebaut.
Die aktuelle Generation ist Qwen 2.5, die in mehreren Größen verfügbar ist: 0,5B, 1,5B, 3B, 7B, 14B, 32B und 72B. Neben den Text-Modellen gibt es Qwen VL für Bildverarbeitung und QwQ für erweitertes Reasoning. Die Modelle sind als Open-Weight-Modelle verfügbar, meist unter der Qwen-Lizenz, die kommerzielle Nutzung unter bestimmten Bedingungen erlaubt.
Die Instruct-Versionen sind auf Dialog und Anweisungen optimiert. Es gibt auch Base-Versionen, die nur Text fortsetzen, aber für die meisten Nutzer sind die Instruct-Versionen relevant.
Für wen ist dieser Artikel gedacht?
Dieser Artikel richtet sich an:
- Einsteiger, die verstehen wollen, welche Qwen-Modelle es gibt und welches für sie passt
- Entwickler, die ein starkes Coding-Modell für lokale Nutzung suchen
- Nutzer, die mehrsprachige Modelle brauchen, besonders für Deutsch und Chinesisch
- Heimanwender, die ein Qwen-Modell auf ihrem Rechner ausführen möchten
- Alle, die sich einen Überblick über die Qwen-Serie verschaffen wollen
Wichtige Begriffe
| Begriff | Bedeutung |
|---|---|
| Parameter | Die gelernten Werte des Modells, Anzahl in Milliarden (B) angegeben |
| Instruct | Auf Anweisungen optimierte Version eines Modells |
| Base | Ursprüngliche Version ohne Instruct-Optimierung |
| Tokenizer | Zerlegt Text in Tokens, die das Modell verarbeitet |
| Context Length | Maximale Anzahl Tokens, die das Modell gleichzeitig verarbeiten kann |
| Multilingual | Modell beherrscht mehrere Sprachen auf hohem Niveau |
| Vision | Modell kann Bilder als Eingabe verarbeiten |
| Reasoning | Logisches Denken und schrittweise Problemlösung |
| Quantisierung | Reduktion der Speichergenauigkeit, um VRAM zu sparen |
| GGUF | Dateiformat für quantisierte Modelle, genutzt von Ollama |
Die Qwen-Modelle im Überblick
Qwen 2.5
Qwen 2.5 ist die aktuelle Hauptgeneration und wurde im September 2024 veröffentlicht. Sie umfasst sieben Größen, die ein extrem breites Spektrum abdecken:
- Qwen 2.5 0.5B: Das kleinste Modell mit 0,5 Milliarden Parametern. Es läuft auf fast jedem Gerät, sogar auf Smartphones, und ist für einfachste Aufgaben gedacht.
- Qwen 2.5 1.5B: Etwas größer, immer noch sehr kompakt. Geeignet für grundlegende Textverarbeitung auf schwacher Hardware.
- Qwen 2.5 3B: Ein gutes Kompaktmodell für Laptops ohne starke Grafikkarte. Bietet eine brauchbare Leistung für Chat und einfache Aufgaben.
- Qwen 2.5 7B: Der Sweet Spot für viele Nutzer. Bietet eine gute Balance aus Leistung und Hardware-Bedarf, ähnlich wie Llama 3.1 8B.
- Qwen 2.5 14B: Ein mittelgroßes Modell mit deutlich besserer Leistung als 7B. Es braucht mehr VRAM, ist aber auf starken Consumer-GPUs lauffähig.
- Qwen 2.5 32B: Ein großes Modell, das in Benchmarks oft mit 70B-Modellen konkurriert. Es braucht eine starke GPU, bietet aber hervorragende Leistung.
- Qwen 2.5 72B: Das größte Modell der Generation. Es konkurriert mit Llama 3.1 70B und Mistral Large, braucht aber entsprechend viel Hardware.
Alle Qwen 2.5 Modelle haben einen Context Length von 128.000 Tokens und sind stark im Coding, in Mathematik und in Mehrsprachigkeit.
Qwen VL
Qwen VL (Vision-Language) ist die multimodale Variante von Qwen. Sie kann Bilder als Eingabe verarbeiten und Fragen zu diesen Bildern beantworten. Qwen VL basiert auf dem Text-Modell und ist um einen Vision-Encoder erweitert.
Die Anwendungsfälle reichen von Bildbeschreibungen über das Lesen von Diagrammen bis hin zur Analyse von Screenshots. Qwen VL ist in mehreren Größen verfügbar, wobei Qwen 2.5 VL 7B und 72B die gängigsten sind.
QwQ
QwQ ist ein spezialisiertes Reasoning-Modell von Alibaba. Es ist darauf trainiert, Probleme schrittweise zu durchdenken, bevor es eine Antwort gibt. Ähnlich wie OpenAIs o1-Modell nimmt QwQ mehr Zeit für das Reasoning und liefert dadurch bessere Ergebnisse bei komplexen Aufgaben.
QwQ ist besonders stark in Mathematik, Logik und mehrstufigem Reasoning. Es ist weniger geeignet für einfache Chat-Aufgaben, wo Geschwindigkeit wichtiger ist als tiefes Nachdenken. QwQ basiert auf Qwen 2.5 32B und braucht entsprechend viel VRAM.
Technische Spezifikationen
| Modell | Parameter | Context Length | Typ | Besonderheit |
|---|---|---|---|---|
| Qwen 2.5 0.5B | 0,5B | 128K | Text | Minimaler Footprint |
| Qwen 2.5 1.5B | 1,5B | 128K | Text | Kompakt für Edge |
| Qwen 2.5 3B | 3B | 128K | Text | Kompakt für Laptops |
| Qwen 2.5 7B | 7B | 128K | Text | Allrounder |
| Qwen 2.5 14B | 14B | 128K | Text | Mittelgroß |
| Qwen 2.5 32B | 32B | 128K | Text | Konkurrenz zu 70B |
| Qwen 2.5 72B | 72B | 128K | Text | Flaggschiff |
| Qwen 2.5 VL 7B | 7B | 128K | Multimodal | Vision |
| Qwen 2.5 VL 72B | 72B | 128K | Multimodal | Vision |
| QwQ 32B | 32B | 128K | Reasoning | Schrittweises Denken |
VRAM-Bedarf der Qwen-Modelle
Der VRAM-Bedarf hängt von der Modellgröße und der Quantisierung ab. Die folgende Tabelle zeigt Richtwerte für Q4_K_M.
| Modell | VRAM bei Q4_K_M | VRAM bei Q8 | VRAM bei FP16 |
|---|---|---|---|
| Qwen 2.5 0.5B | ca. 0,5 GB | ca. 1 GB | ca. 1 GB |
| Qwen 2.5 1.5B | ca. 1,5 GB | ca. 2 GB | ca. 3 GB |
| Qwen 2.5 3B | ca. 2,5 GB | ca. 4 GB | ca. 6 GB |
| Qwen 2.5 7B | ca. 5 GB | ca. 8 GB | ca. 14 GB |
| Qwen 2.5 14B | ca. 9 GB | ca. 15 GB | ca. 28 GB |
| Qwen 2.5 32B | ca. 20 GB | ca. 35 GB | ca. 64 GB |
| Qwen 2.5 72B | ca. 42 GB | ca. 76 GB | ca. 144 GB |
Die Werte sind Richtwerte und variieren leicht. Zusätzlich brauchst Du etwa 1 bis 2 GB für den Kontext. Mehr Details im Artikel RAM und VRAM Anforderungen und unter Modellgröße und Speicherbedarf.
Leistung und Performance
Qwen 2.5 0.5B bis 3B sind für einfache Aufgaben geeignet: Zusammenfassungen, einfache Fragen, grundlegende Textverarbeitung. Sie sind nicht für komplexe Aufgaben gedacht, aber sie laufen überall, sogar auf Mobilgeräten.
Qwen 2.5 7B ist ein starker Allrounder, der in vielen Benchmarks mit Llama 3.1 8B mithält oder diesen übertrifft. Besonders im Coding und in der Mehrsprachigkeit hat Qwen oft die Nase vorn. Die Deutsch-Qualität ist sehr gut.
Qwen 2.5 14B und 32B bieten deutlich mehr Leistung. Das 32B-Modell ist besonders interessant, weil es in vielen Benchmarks mit 70B-Modellen konkurriert, aber deutlich weniger VRAM braucht. Für Nutzer mit einer RTX 3090 oder 4090 ist Qwen 2.5 32B eine hervorragende Wahl.
Qwen 2.5 72B ist das Flaggschiff und konkurriert direkt mit Llama 3.1 70B und Llama 3.3 70B. In Coding-Benchmarks liegt es oft vor den Llama-Modellen. Die Mehrsprachigkeit ist auf sehr hohem Niveau.
Qwen VL ist für Bildverarbeitungsaufgaben gut geeignet. Es kann Bilder beschreiben, Fragen zu Inhalten beantworten und Text in Bildern lesen. Die Leistung ist mit Llama 3.2 Vision vergleichbar.
QwQ ist spezialisiert auf tiefes Reasoning. Bei Mathematik, Logik und mehrstufigen Problemen liefert es oft bessere Ergebnisse als Standardmodelle. Der Preis ist eine längere Antwortzeit, da das Modell seine Gedanken schrittweise entwickelt.
Anwendungsfälle für Qwen-Modelle
| Anwendungsfall | Empfohlenes Modell | Warum |
|---|---|---|
| Coding und Programmierung | Qwen 2.5 7B oder 32B | Sehr starke Coding-Fähigkeiten |
| Mehrsprachiger Chat | Qwen 2.5 7B | Hervorragende Mehrsprachigkeit |
| Bildanalyse | Qwen 2.5 VL 7B | Vision-Modell mit guter Leistung |
| Mathematik und Logik | QwQ 32B | Spezialisiert auf Reasoning |
| Edge-Deployment | Qwen 2.5 0.5B oder 1.5B | Minimaler Footprint |
| Maximale Leistung | Qwen 2.5 72B | Konkurrenz zu kommerziellen Modellen |
Wenn Du unsicher bist, welches Modell für Dich passt, hilft der Artikel Modell finden bei der Entscheidung.
Qwen-Modelle mit Ollama ausführen
Ollama ist die einfachste Methode, um Qwen-Modelle lokal zu starten. Du brauchst nur einen Befehl im Terminal.
Qwen 2.5 7B starten:
ollama run qwen2.5
Qwen 2.5 32B starten:
ollama run qwen2.5:32b
Qwen 2.5 VL 7B starten:
ollama run qwen2.5vl
QwQ 32B starten:
ollama run qwq
Ollama lädt automatisch eine passende quantisierte Version herunter, standardmäßig Q4_K_M. Wenn Du eine andere Quantisierungsstufe nutzen willst, kannst Du diese angeben:
ollama run qwen2.5:7b-q5_K_M
Modelle, die Du nicht mehr brauchst, kannst Du mit dem folgenden Befehl entfernen. Mehr dazu im Artikel Modelle verwalten:
ollama rm qwen2.5
Typische Stolpersteine
1. Falsche Größe gewählt: Qwen 2.5 gibt es in sieben Größen. Stelle sicher, dass Du die richtige Größe für Deine Hardware wählst. ollama run qwen2.5 lädt standardmäßig die 7B-Version. Wenn Du eine andere Größe willst, musst Du sie explizit angeben.
2. QwQ ist langsam: QwQ ist ein Reasoning-Modell, das viel Zeit für das Durchdenken von Problemen braucht. Es gibt ausführliche Zwischenschritte aus, bevor es zur Antwort kommt. Für schnelle Chat-Aufgaben ist es ungeeignet.
3. Vision-Modell ohne Bilder nutzen: Qwen VL ist für Text und Bilder optimiert. Wenn Du es nur für Text nutzt, verschwendest Du VRAM für den Vision-Encoder. Nutze für reine Text-Aufgaben das Standard-Modell Qwen 2.5.
4. Chinesisch-zentrierte Tokenisierung: Qwen verwendet einen Tokenizer, der auf Chinesisch optimiert ist. Das bedeutet, dass chinesische Texte weniger Tokens benötigen als bei Llama. Für deutsche Texte ist der Token-Verbrauch ähnlich wie bei anderen Modellen, aber nicht immer identisch.
5. Lizenzbedingungen prüfen: Qwen-Modelle stehen unter der Qwen-Lizenz, die kommerzielle Nutzung erlaubt, aber Einschränkungen hat. Für sehr große Nutzerzahlen oder spezielle Anwendungsfälle solltest Du die Lizenz genau lesen. Sie ist weniger restriktiv als die Llama-Lizenz, aber nicht so frei wie Apache 2.0.
6. Alte Qwen-Versionen nutzen: Qwen 1.0 und Qwen 1.5 sind älter und deutlich schwächer als Qwen 2.5. Wenn Du ein Qwen-Modell startest, nutze immer die aktuelle Version 2.5.
7. 32B und 72B brauchen viel VRAM: Qwen 2.5 32B braucht quantisiert etwa 20 GB VRAM, 72B etwa 42 GB. Stelle sicher, dass Deine Hardware ausreicht, bevor Du diese Modelle herunterlädst.
Hardware, Kosten und Sicherheit
Hardware: Qwen 2.5 7B läuft auf einer Grafikkarte mit 8 GB VRAM in Q4_K_M. Das 14B-Modell braucht etwa 9 GB, was auf einer RTX 3060 mit 12 GB gut passt. Das 32B-Modell erfordert etwa 20 GB VRAM, also eine RTX 3090 oder 4090. Das 72B-Modell braucht High-End-Hardware mit 48 GB VRAM oder mehr. Auf einem Mac mit Apple Silicon läuft Qwen 2.5 7B mit 16 GB RAM gut, 32B braucht mindestens 32 GB.
Kosten: Die Modelle sind kostenlos herunterladbar. Die Kosten liegen in der Hardware. Für Qwen 2.5 7B reicht eine günstige Grafikkarte. Für 32B und 72B brauchst Du teure Hardware. Im Vergleich zu Cloud-APIs, die nach Token-Nutzung abrechnen, ist der lokale Betrieb langfristig günstiger.
Sicherheit: Qwen-Modelle laufen lokal, Deine Daten bleiben auf Deinem Rechner. Das ist besonders wichtig für sensible Daten. Beachte, dass Qwen-Modelle keine eingebauten Safety-Filter haben. Für produktive Anwendungen solltest Du zusätzliche Maßnahmen ergreifen. Ein Aspekt bei Qwen ist der chinesische Ursprung: Manche Nutzer haben Bedenken wegen möglicher Zensur-Einflüsse im Training. Bei lokaler Ausführung hat das Modell jedoch keine Verbindung zu Servern in China.
Weiterführende Links
- Lokale KI Modelle - Überblick aller Modell-Artikel
- Modell finden - Hilfe bei der Modellwahl
- Llama Modelle - Metas Open-Source-Serie im Vergleich
- Mistral Modelle - Europas Alternative im Vergleich
- Ollama - Die einfachste Methode für lokale Modelle
- Modelle verwalten - Modelle in Ollama verwalten
- Quantisierung - Wie Modelle kleiner gemacht werden
- RAM und VRAM Anforderungen - Speicherbedarf verstehen
- Modellgröße und Speicherbedarf - Hardware-Grundlagen
- Was ist lokale KI? - Grundlagenartikel
FAQ
Welches Qwen-Modell soll ich als Erstes ausprobieren?
Qwen 2.5 7B ist die beste Wahl für den Einstieg. Es läuft auf den meisten Consumer-Grafikkarten mit 8 GB VRAM und bietet eine gute Balance aus Leistung und Hardware-Bedarf. Starte mit ollama run qwen2.5.
Ist Qwen besser als Llama?
Das hängt vom Anwendungsfall ab. Qwen ist oft besser im Coding und in der Mehrsprachigkeit. Llama 3.3 70B ist bei allgemeinem Reasoning oft überlegen. Für Deutsch und Programmieren ist Qwen eine sehr starke Wahl.
Kann ich Qwen 2.5 72B lokal ausführen?
Das ist schwierig. Quantisiert (Q4_K_M) braucht 72B etwa 42 GB VRAM. Das erfordert eine RTX 4090 mit 24 GB plus Auslagerung oder einen Mac mit 64 GB RAM. Für die meisten Nutzer ist Qwen 2.5 32B die bessere Wahl.
Was ist QwQ?
QwQ ist ein spezialisiertes Reasoning-Modell. Es durchdenkt Probleme schrittweise und gibt ausführliche Zwischenschritte aus. Es ist besonders stark in Mathematik und Logik, aber langsamer als Standardmodelle. Für einfache Chat-Aufgaben ist es ungeeignet.
Kann Qwen Bilder verstehen?
Ja, Qwen VL kann Bilder verarbeiten. Du kannst ihm ein Bild geben und Fragen dazu stellen. Die Standard-Modelle Qwen 2.5 ohne VL-Suffix können keine Bilder verarbeiten.
Wie gut ist Qwen auf Deutsch?
Qwen ist sehr gut auf Deutsch. Die Mehrsprachigkeit ist ein Kernziel des Trainings, und Deutsch funktioniert deutlich natürlicher als bei vielen anderen Modellen. Für deutschsprachige Anwendungen ist Qwen eine der besten Optionen.
Sind Qwen-Modelle kostenlos?
Die Modellgewichte sind kostenlos herunterladbar. Die Qwen-Lizenz erlaubt kommerzielle Nutzung mit Einschränkungen, ähnlich wie die Llama-Lizenz. Für die meisten Nutzer und kleine Unternehmen ist die Nutzung kostenlos.
Was ist der Unterschied zwischen Qwen 2.5 und älteren Versionen?
Qwen 2.5 ist die aktuelle Generation mit deutlich verbesserten Fähigkeiten in Coding, Mathematik und Mehrsprachigkeit. Ältere Versionen wie Qwen 1.5 sind schwächer und sollten nicht mehr genutzt werden.
Ist Qwen wegen seines chinesischen Ursprungs zensiert?
Bei lokaler Ausführung hat Qwen keine Verbindung zu Servern in China. Das Modell kann jedoch bei bestimmten Themen, besonders zur chinesischen Politik, eingeschränkte Antworten geben, weil dies im Training so vorgesehen war. Für die meisten Anwendungsfälle im westlichen Kontext ist das nicht relevant.
Kann ich Qwen auf einem Mac ausführen?
Ja. Apple Silicon teilt sich Arbeitsspeicher zwischen CPU und GPU. Ein Mac mit 16 GB RAM kann Qwen 2.5 7B gut ausführen. Für 32B brauchst Du mindestens 32 GB RAM, für 72B mindestens 64 GB.
Welches Qwen-Modell ist am besten für Coding?
Qwen 2.5 32B ist eine der besten Optionen für Coding im lokalen Bereich. Es erreicht in Coding-Benchmarks hervorragende Ergebnisse und braucht mit 20 GB VRAM weniger Hardware als 72B. Wenn Du weniger VRAM hast, ist Qwen 2.5 7B ein guter Kompromiss.
Quellen
- Alibaba Cloud - Qwen Modellübersicht und Dokumentation
- Ollama Modellbibliothek - Qwen-Modelle
- Hugging Face - Qwen Modellseite
- Qwen 2.5 Technischer Bericht von Alibaba Cloud


