Skip to content
BotServBotServ
Qwen3.8-27BQwen27B ModellCoding LLMlokale KIHalluzinationSWE-benchApache 2.0OllamaClaude Vergleich

Qwen3.8-27B ehrlich eingeordnet: Coding-Monster, kein Lexikon

Qwen3.8-27B im Test: Warum das 27B-Modell Bundeskanzler vertauscht, aber im Coding Claude Opus und GPT-Flaggschiffe schlägt. Fokus, Benchmarks, lokale Nutzung.

S

schutzgeist

4 min read
Qwen3.8-27B: Coding-fokussiertes 27B-Modell im Vergleich mit Claude und GPT

Qwen3.8-27B ehrlich eingeordnet: Coding-Monster, kein Lexikon

Was dieser Artikel behandelt

  • Zuerst der kritische Punkt: Wo liegt der Fokus des Modells und wo hat es in Community-Tests versagt.
  • Was die 27 Milliarden Parameter wirklich können (Coding, Agentic Workflows, Vision).
  • Vergleich mit Claude Opus, Sonnet, Haiku und den GPT-Modellen: Benchmarks und Kosten.
  • Für wen das Modell lokal Sinn ergibt und wo man besser zu Cloud-Flaggschiffen greift.

Der kritische Punkt zuerst: Wo liegt der Fokus?

In Community-Tests wurde Qwen3.8-27B (und sein Vorgänger Qwen3.6-27B) nach den Bundeskanzlern der Bundesrepublik gefragt. Das Ergebnis: vertauschte Reihenfolge, erfundene Fakten, falsche Daten. Kein „Weiß ich nicht”, sondern selbstbewusst fabulierte Antworten.

Das klingt schlimm, ist aber nur dann ein Problem, wenn man das Modell falsch versteht. Die 27 Milliarden Parameter sind nicht auf Weltwissen konzentriert. Qwen hat die Kapazität des Modells fast komplett auf Coding, agentisches Arbeiten und multimodale Aufgaben gelegt. Ein dichtes 27B-Modell hat schlicht nicht genug Gewichte, um gleichzeitig ein Wikipedia-Ersatz und ein Coding-Agent zu sein. Alibaba hat sich entschieden: lieber der beste kleine Programmierer als ein mittelmäßiges Lexikon.

Wer also historisches Faktenwissen, deutsche Politik-Chronologie oder Trivia abfragt, testet die Schwachstelle. Wer Repository-Analysen, Tool-Calls und mehrstufige Code-Aufgaben gibt, testet die Stärke. Das sollte man vor dem Download wissen, weil die Community-Berichte sonst irreführen.

Was die Community sonst gefunden hat

Die ehrliche Liste der dokumentierten Schwächen:

  • Fakten-Halluzination: Erfundene historische/politische Fakten, siehe oben. Weltwissen ist nicht der Fokus.
  • Kontext-Confabulation: Im Hermes-Agent-Test hat das Modell zu Beginn einer neuen Session eine komplett erfundene Gesprächshistorie fabuliert (GitHub-Issue dokumentiert).
  • Tool-Calling-Loops: Berichte über wiederholte Fake-Tool-Calls in agentischen Setups, teils bei offiziellen Quants, teils bei Community-Quantisierungen.
  • Quantisierung empfindlich: Q4-Quants verschlechtern spürbar; die Qwen-Modelle profitieren ungewöhnlich stark von Q8.

Trotzdem wird es in der Community stark genutzt, weil die Coding-Leistung pro Parameter aktuell kaum zu schlagen ist.

Was Qwen3.8-27B wirklich ist

Die Fakten aus dem GitHub-Repo und Hugging Face:

  • Dense 27B, nativ multimodal (Text + Bilder + Videos, auch lange Videos)
  • 262K Token Kontext nativ, bis 1M via YaRN
  • Apache 2.0: komplett offene Gewichte, kommerziell nutzbar
  • Thinking-Mode standardmäßig an, reasoning_effort und preserve_thinking steuerbar
  • Schlägt laut Hersteller das größere Qwen3.7-Plus in Coding- und Office-Workflows
  • Der Vorgänger Qwen3.6-27B schlug bereits den eigenen 397B-MoE-Flaggschiff (Qwen3.5-397B-A17B) auf allen Coding-Benchmarks, ein 27B-Dense, der ein 15-mal größeres MoE übertrifft

Der Vergleich: Benchmarks gegen Claude & Co.

Die offiziellen Zahlen von Qwen3.6-27B gegen Claude 4.5 Opus (die 3.8-Version liegt laut Hersteller noch drüber):

BenchmarkQwen3.6-27BClaude 4.5 OpusGemma4-31B
SWE-bench Verified77.280.952.0
SWE-bench Pro53.557.135.7
SWE-bench Multilingual71.377.551.7
Terminal-Bench 2.059.359.342.9
SkillsBench Avg548.245.323.6
LiveCodeBench v683.984.880.0
GPQA Diamond87.887.084.3
AIME26 (Mathe)94.195.189.2

Einordnung: Opus bleibt bei reinem Coding vorn (SWE-bench +3.7), aber das 27B-Modell liegt bei Terminal-Bench gleichauf, schlägt Opus bei SkillsBench (Agent-Aufgaben) und GPQA (Wissenschafts-Reasoning). Bei den GPT-Modellen (GPT-5.2, GPT-4.1) fehlen vergleichbare offene Zahlen im selben Harness, aber Community-Reports ordnen Qwen3.8-27B im Coding-Bereich etwa auf GPT-5-mini- bis GPT-5-Niveau ein, je nach Task.

Kosten: Der eigentliche Vorteil

ModellPreis (API)Lokal lauffähig
Claude Opus 4.5~$15/$75 pro MtokNein
Claude Sonnet 4.5~$3/$15Nein
Claude Haiku 4.5~$1/$5Nein
GPT-5.2~$1.75/$14Nein
GPT-5-mini~$0.30/$2.40Nein
Qwen3.8-27B~$0.15-0.60 API, $0 lokalJa, ab ~20 GB VRAM/RAM

Auf einem Ryzen AI Max+ 395 mit 128 GB läuft es in Q4/Q5 komfortabel, auf einem Mini-PC mit 64+ GB ebenfalls. Das ist die eigentliche Rechnung: Opus-Niveau bei Agent-Aufgaben, aber $0 pro Token und keine Daten raus.

Wann das Modell richtig ist

Nimm Qwen3.8-27B, wenn:

  • Du einen lokalen Coding-Agenten willst (Repo-Level-Edits, Tool-Calls, Terminal-Arbeit).
  • Datenschutz zählt: Code bleibt auf Deiner Hardware.
  • Du viele Tokens brauchst: 262K Kontext, lokal kostenlos.
  • Multimodal: Screenshots, Diagramme, sogar Videos verstehen.

Nimm Claude/GPT, wenn:

  • Du breites Weltwissen brauchst (Fakten, Geschichte, Politik).
  • Absoluter Coding-Spitzenwert zählt (Opus führt SWE-bench weiter).
  • Du keine eigene Hardware betreiben willst.

Praxis-Tipp: Kombinieren ist die Antwort der meisten Power-User. Qwen3.8-27B lokal für Code-Arbeit und Volume, ein Cloud-Modell für Faktenfragen und die letzten 5 % Qualität. In OpenCode/Aider/OpenChamber lassen sich beide parallel konfigurieren, siehe Coding-Modelle und OpenChamber.

Key Takeaways:

  • Qwen3.8-27B erfindet Fakten (Bundeskanzler-Test), weil die 27B gezielt auf Coding/Agentic statt Weltwissen konzentriert sind. Das ist Design, kein Bug.
  • Coding-Benchmarks: schlägt den eigenen 397B-Vorgänger, liegt bei Terminal-Bench gleichauf mit Claude Opus, gewinnt SkillsBench.
  • Apache 2.0, 262K Kontext (1M via YaRN), nativ multimodal, ab ~20 GB VRAM lokal.
  • Community-Manko: Confabulation und Tool-Loops, höhere Quantisierung (Q8) empfohlen.
  • Praxis: lokal für Coding-Volume + Datenschutz, Cloud (Opus/GPT) für Weltwissen und Spitzenqualität.

FAQ

Warum kennt Qwen3.8-27B die Bundeskanzler nicht?

Ein dichtes 27B-Modell hat begrenzte Parameter. Qwen hat sie auf Coding, Agentic Workflows und multimodale Aufgaben konzentriert statt auf enzyklopädisches Weltwissen. In Community-Tests vertauschte das Modell Kanzler-Reihenfolgen und erfand Daten. Für Faktenfragen ist ein Cloud-Modell oder RAG mit echten Quellen der richtige Weg.

Ist Qwen3.8-27B besser als Claude?

Beim Coding nah dran: Terminal-Bench 2.0 gleichauf mit Opus (59.3), SkillsBench sogar vorn (48.2 vs 45.3), SWE-bench Verified knapp dahinter (77.2 vs 80.9). Claude bleibt bei Weltwissen, Nuance und Gesamtqualität vorn. Der eigentliche Vorteil: Apache 2.0 und lokal lauffähig für 0 Euro pro Token.

Welche Hardware braucht Qwen3.8-27B lokal?

Q4-Quant: ~20 GB VRAM/RAM (RTX 3090/4090 oder Unified Memory). Q8 für bessere Qualität: ~32-40 GB, ideal ein Ryzen AI Max+ 395 mit 128 GB oder ein Mini-PC mit 64+ GB. Quantisierung merkbar: Community berichtet, dass Q4 deutlich schlechter ist als Q8, bei den Qwen-Modellen lohnt der höhere Quant.

Wie schlimm ist die Halluzination?

Dokumentiert bei Fakten (erfundene Politik-Daten), Session-Kontext (Hermes-Agent: fabulierte Gesprächshistorie) und Tool-Calls (Fake-Loops). Im Coding-Kernbereich deutlich stabiler. Regel: nie Fakten ohne Quelle trauen, höhere Quantisierung nutzen, im Agenten-Setup auf klare Tool-Schemas achten.

Wie starte ich es lokal?

Ollama, LM Studio oder vLLM: ollama run qwen3.8:27b (wenn im Registry), oder GGUF von Hugging Face in LM Studio laden. Für Agentic-Workflows OpenCode/Aider an den lokalen Endpoint hängen. Siehe den Ollama-Artikel für Installation.

Quellen und weiterführende Literatur

Zurück zum KI Blog
Share:

Ähnliche Beiträge