Qwen3.8-27B ehrlich eingeordnet: Coding-Monster, kein Lexikon
Was dieser Artikel behandelt
- Zuerst der kritische Punkt: Wo liegt der Fokus des Modells und wo hat es in Community-Tests versagt.
- Was die 27 Milliarden Parameter wirklich können (Coding, Agentic Workflows, Vision).
- Vergleich mit Claude Opus, Sonnet, Haiku und den GPT-Modellen: Benchmarks und Kosten.
- Für wen das Modell lokal Sinn ergibt und wo man besser zu Cloud-Flaggschiffen greift.
Der kritische Punkt zuerst: Wo liegt der Fokus?
In Community-Tests wurde Qwen3.8-27B (und sein Vorgänger Qwen3.6-27B) nach den Bundeskanzlern der Bundesrepublik gefragt. Das Ergebnis: vertauschte Reihenfolge, erfundene Fakten, falsche Daten. Kein „Weiß ich nicht”, sondern selbstbewusst fabulierte Antworten.
Das klingt schlimm, ist aber nur dann ein Problem, wenn man das Modell falsch versteht. Die 27 Milliarden Parameter sind nicht auf Weltwissen konzentriert. Qwen hat die Kapazität des Modells fast komplett auf Coding, agentisches Arbeiten und multimodale Aufgaben gelegt. Ein dichtes 27B-Modell hat schlicht nicht genug Gewichte, um gleichzeitig ein Wikipedia-Ersatz und ein Coding-Agent zu sein. Alibaba hat sich entschieden: lieber der beste kleine Programmierer als ein mittelmäßiges Lexikon.
Wer also historisches Faktenwissen, deutsche Politik-Chronologie oder Trivia abfragt, testet die Schwachstelle. Wer Repository-Analysen, Tool-Calls und mehrstufige Code-Aufgaben gibt, testet die Stärke. Das sollte man vor dem Download wissen, weil die Community-Berichte sonst irreführen.
Was die Community sonst gefunden hat
Die ehrliche Liste der dokumentierten Schwächen:
- Fakten-Halluzination: Erfundene historische/politische Fakten, siehe oben. Weltwissen ist nicht der Fokus.
- Kontext-Confabulation: Im Hermes-Agent-Test hat das Modell zu Beginn einer neuen Session eine komplett erfundene Gesprächshistorie fabuliert (GitHub-Issue dokumentiert).
- Tool-Calling-Loops: Berichte über wiederholte Fake-Tool-Calls in agentischen Setups, teils bei offiziellen Quants, teils bei Community-Quantisierungen.
- Quantisierung empfindlich: Q4-Quants verschlechtern spürbar; die Qwen-Modelle profitieren ungewöhnlich stark von Q8.
Trotzdem wird es in der Community stark genutzt, weil die Coding-Leistung pro Parameter aktuell kaum zu schlagen ist.
Was Qwen3.8-27B wirklich ist
Die Fakten aus dem GitHub-Repo und Hugging Face:
- Dense 27B, nativ multimodal (Text + Bilder + Videos, auch lange Videos)
- 262K Token Kontext nativ, bis 1M via YaRN
- Apache 2.0: komplett offene Gewichte, kommerziell nutzbar
- Thinking-Mode standardmäßig an,
reasoning_effortundpreserve_thinkingsteuerbar - Schlägt laut Hersteller das größere Qwen3.7-Plus in Coding- und Office-Workflows
- Der Vorgänger Qwen3.6-27B schlug bereits den eigenen 397B-MoE-Flaggschiff (Qwen3.5-397B-A17B) auf allen Coding-Benchmarks, ein 27B-Dense, der ein 15-mal größeres MoE übertrifft
Der Vergleich: Benchmarks gegen Claude & Co.
Die offiziellen Zahlen von Qwen3.6-27B gegen Claude 4.5 Opus (die 3.8-Version liegt laut Hersteller noch drüber):
| Benchmark | Qwen3.6-27B | Claude 4.5 Opus | Gemma4-31B |
|---|---|---|---|
| SWE-bench Verified | 77.2 | 80.9 | 52.0 |
| SWE-bench Pro | 53.5 | 57.1 | 35.7 |
| SWE-bench Multilingual | 71.3 | 77.5 | 51.7 |
| Terminal-Bench 2.0 | 59.3 | 59.3 | 42.9 |
| SkillsBench Avg5 | 48.2 | 45.3 | 23.6 |
| LiveCodeBench v6 | 83.9 | 84.8 | 80.0 |
| GPQA Diamond | 87.8 | 87.0 | 84.3 |
| AIME26 (Mathe) | 94.1 | 95.1 | 89.2 |
Einordnung: Opus bleibt bei reinem Coding vorn (SWE-bench +3.7), aber das 27B-Modell liegt bei Terminal-Bench gleichauf, schlägt Opus bei SkillsBench (Agent-Aufgaben) und GPQA (Wissenschafts-Reasoning). Bei den GPT-Modellen (GPT-5.2, GPT-4.1) fehlen vergleichbare offene Zahlen im selben Harness, aber Community-Reports ordnen Qwen3.8-27B im Coding-Bereich etwa auf GPT-5-mini- bis GPT-5-Niveau ein, je nach Task.
Kosten: Der eigentliche Vorteil
| Modell | Preis (API) | Lokal lauffähig |
|---|---|---|
| Claude Opus 4.5 | ~$15/$75 pro Mtok | Nein |
| Claude Sonnet 4.5 | ~$3/$15 | Nein |
| Claude Haiku 4.5 | ~$1/$5 | Nein |
| GPT-5.2 | ~$1.75/$14 | Nein |
| GPT-5-mini | ~$0.30/$2.40 | Nein |
| Qwen3.8-27B | ~$0.15-0.60 API, $0 lokal | Ja, ab ~20 GB VRAM/RAM |
Auf einem Ryzen AI Max+ 395 mit 128 GB läuft es in Q4/Q5 komfortabel, auf einem Mini-PC mit 64+ GB ebenfalls. Das ist die eigentliche Rechnung: Opus-Niveau bei Agent-Aufgaben, aber $0 pro Token und keine Daten raus.
Wann das Modell richtig ist
Nimm Qwen3.8-27B, wenn:
- Du einen lokalen Coding-Agenten willst (Repo-Level-Edits, Tool-Calls, Terminal-Arbeit).
- Datenschutz zählt: Code bleibt auf Deiner Hardware.
- Du viele Tokens brauchst: 262K Kontext, lokal kostenlos.
- Multimodal: Screenshots, Diagramme, sogar Videos verstehen.
Nimm Claude/GPT, wenn:
- Du breites Weltwissen brauchst (Fakten, Geschichte, Politik).
- Absoluter Coding-Spitzenwert zählt (Opus führt SWE-bench weiter).
- Du keine eigene Hardware betreiben willst.
Praxis-Tipp: Kombinieren ist die Antwort der meisten Power-User. Qwen3.8-27B lokal für Code-Arbeit und Volume, ein Cloud-Modell für Faktenfragen und die letzten 5 % Qualität. In OpenCode/Aider/OpenChamber lassen sich beide parallel konfigurieren, siehe Coding-Modelle und OpenChamber.
Weiterführende Links
- IRC-Coding.de: Programmier-Tutorials.
- Coding-Modelle im Vergleich: Die ganze Liga.
- Ollama: Qwen lokal starten.
- MS-S1 Max: Für wen lohnt er sich: Die Hardware für 27B-Modelle.
- KI für Coding-Projekte: Agent im Dauerbetrieb.
- ChatGPT-Prompts: Prompting-Praxis.
Key Takeaways:
- Qwen3.8-27B erfindet Fakten (Bundeskanzler-Test), weil die 27B gezielt auf Coding/Agentic statt Weltwissen konzentriert sind. Das ist Design, kein Bug.
- Coding-Benchmarks: schlägt den eigenen 397B-Vorgänger, liegt bei Terminal-Bench gleichauf mit Claude Opus, gewinnt SkillsBench.
- Apache 2.0, 262K Kontext (1M via YaRN), nativ multimodal, ab ~20 GB VRAM lokal.
- Community-Manko: Confabulation und Tool-Loops, höhere Quantisierung (Q8) empfohlen.
- Praxis: lokal für Coding-Volume + Datenschutz, Cloud (Opus/GPT) für Weltwissen und Spitzenqualität.
FAQ
Warum kennt Qwen3.8-27B die Bundeskanzler nicht?
Ist Qwen3.8-27B besser als Claude?
Welche Hardware braucht Qwen3.8-27B lokal?
Wie schlimm ist die Halluzination?
Wie starte ich es lokal?
Quellen und weiterführende Literatur
- Qwen3.8-27B auf Hugging Face, GitHub
- Qwen3.6-27B Benchmarks (Alibaba Cloud Blog)
- Community: Halluzinationen in Qwen3.6-27B (HF Discussion), Hermes-Agent-Issue
- IRC-Coding.de: Programmier-Tutorials.


