Skip to content
BotServBotServ
Qwen3.8-27BQwenmodelo 27BCoding LLMIA localalucinaciónSWE-benchApache 2.0Ollamacomparativa Claude

Qwen3.8-27B: Monstruo de coding, no enciclopedia

Qwen3.8-27B probado: Por qué el modelo 27B confunde líderes pero supera Claude Opus en coding. Benchmarks, uso local.

S

schutzgeist

6 min read
Qwen3.8-27B: Monstruo de coding, no enciclopedia

Qwen3.8-27B en perspectiva: Bestia para código, no enciclopedia

Qué cubre este artículo

  • Primero lo crítico: dónde está el enfoque del modelo y dónde falló en pruebas de comunidad.
  • Qué pueden hacer realmente los 27 mil millones de parámetros (código, flujos agentes, visión).
  • Comparación con Claude Opus, Sonnet, Haiku y los modelos GPT: benchmarks y costos.
  • Para quién tiene sentido ejecutar el modelo localmente y cuándo conviene usar los buques insignia en la nube.

Lo crítico primero: dónde está el enfoque

En pruebas de comunidad, Qwen3.8-27B (y su predecesor Qwen3.6-27B) fue consultado sobre los cancilleres federales de la República Federal Alemana. El resultado: orden invertido, hechos inventados, datos incorrectos. No un “no sé”, sino respuestas inventadas con total confianza.

Suena grave, pero solo es un problema si entiendes mal el modelo. Los 27 mil millones de parámetros no están concentrados en conocimiento mundial. Qwen destinó casi toda la capacidad del modelo a código, trabajo agente y tareas multimodales. Un modelo denso de 27B simplemente no tiene suficientes pesos para ser simultáneamente un reemplazo de Wikipedia y un agente de codificación. Alibaba decidió: mejor el mejor pequeño programador que una enciclopedia mediocre.

Quien consulta sobre hechos históricos, cronología de política alemana o trivialidades prueba la debilidad. Quien proporciona análisis de repositorios, llamadas a herramientas y tareas de código multietapa prueba la fortaleza. Es importante saber esto antes de descargar el modelo, porque los reportes de comunidad pueden ser engañosos de otro modo.

Qué más encontró la comunidad

La lista honesta de debilidades documentadas:

  • Alucinación de hechos: hechos históricos/políticos inventados, ver arriba. El conocimiento mundial no es el enfoque.
  • Confabulación de contexto: en la prueba de agente Hermes, el modelo fabricó una historial de conversación completamente inventado al inicio de una nueva sesión (documentado en GitHub).
  • Bucles de llamada a herramientas: reportes de llamadas falsas a herramientas repetidas en configuraciones agentes, algunas en cuantificaciones oficiales, otras en cuantificaciones de comunidad.
  • Sensible a cuantificación: las cuantificaciones Q4 se degradan notablemente; los modelos Qwen se benefician de manera inusual con Q8.

A pesar de esto, se usa ampliamente en la comunidad porque el rendimiento de codificación por parámetro actualmente es prácticamente imbatible.

Qué es realmente Qwen3.8-27B

Los hechos del repositorio de GitHub y Hugging Face:

  • Denso 27B, multimodal nativo (texto, imágenes, vídeos, incluso vídeos largos)
  • 262K tokens de contexto nativamente, hasta 1M vía YaRN
  • Apache 2.0: pesos completamente abiertos, comercialmente utilizables
  • Modo thinking activado por defecto, reasoning_effort y preserve_thinking configurables
  • Según el fabricante supera al más grande Qwen3.7-Plus en flujos de código y oficina
  • Su predecesor Qwen3.6-27B ya superaba al propio buque insignia de 397B-MoE (Qwen3.5-397B-A17B) en todos los benchmarks de código, un modelo denso de 27B que supera un MoE 15 veces más grande

La comparación: benchmarks contra Claude y otros

Los números oficiales de Qwen3.6-27B contra Claude 4.5 Opus (la versión 3.8 supera esto según el fabricante):

BenchmarkQwen3.6-27BClaude 4.5 OpusGemma4-31B
SWE-bench Verified77.280.952.0
SWE-bench Pro53.557.135.7
SWE-bench Multilingual71.377.551.7
Terminal-Bench 2.059.359.342.9
SkillsBench Avg548.245.323.6
LiveCodeBench v683.984.880.0
GPQA Diamond87.887.084.3
AIME26 (matemáticas)94.195.189.2

Perspectiva: Opus se mantiene adelante en código puro (SWE-bench +3.7), pero el modelo de 27B iguala a Terminal-Bench, supera a Opus en SkillsBench (tareas agentes) y GPQA (razonamiento científico). Con los modelos GPT (GPT-5.2, GPT-5-mini) faltan números abiertos comparables en el mismo harness, pero los reportes de comunidad sitúan a Qwen3.8-27B en codificación aproximadamente en el nivel de GPT-5-mini a GPT-5, dependiendo de la tarea.

Costos: La verdadera ventaja

ModeloPrecio (API)Ejecutable localmente
Claude Opus 4.5~$15/$75 por MtokNo
Claude Sonnet 4.5~$3/$15No
Claude Haiku 4.5~$1/$5No
GPT-5.2~$1.75/$14No
GPT-5-mini~$0.30/$2.40No
Qwen3.8-27B~$0.15-0.60 API, $0 localmenteSí, desde ~20 GB VRAM/RAM

En un Ryzen AI Max+ 395 con 128 GB funciona cómodamente en Q4/Q5, en un mini-PC con 64+ GB también. Esa es la verdadera ecuación: nivel Opus en tareas agentes, pero $0 por token y sin datos saliendo.

Cuándo es correcto usar este modelo

Usa Qwen3.8-27B si:

  • Quieres un agente de codificación local (ediciones a nivel de repositorio, llamadas a herramientas, trabajo en terminal).
  • La privacidad importa: el código permanece en tu hardware.
  • Necesitas muchos tokens: 262K de contexto, localmente gratuito.
  • Multimodal: entiende capturas de pantalla, diagramas, incluso vídeos.

Usa Claude/GPT si:

  • Necesitas conocimiento mundial amplio (hechos, historia, política).
  • El rendimiento máximo en código es crucial (Opus lidera SWE-bench).
  • No quieres operar tu propio hardware.

Consejo práctico: la combinación es la respuesta de la mayoría de usuarios avanzados. Qwen3.8-27B localmente para trabajo de código y volumen, un modelo en la nube para preguntas sobre hechos y ese último 5% de calidad. En OpenCode/Aider/OpenChamber ambos pueden configurarse en paralelo, ver modelos de codificación y OpenChamber.

Enlaces relacionados

Puntos clave:

  • Qwen3.8-27B inventa hechos (prueba de cancilleres) porque los 27B se concentran deliberadamente en código/agentes en lugar de conocimiento mundial. Es un diseño, no un error.
  • Benchmarks de codificación: supera su predecesor de 397B, iguala a Claude Opus en Terminal-Bench, gana en SkillsBench.
  • Apache 2.0, 262K de contexto (1M vía YaRN), multimodal nativo, desde ~20 GB VRAM localmente.
  • Limitación de comunidad: confabulación y bucles de herramientas, se recomienda cuantificación más alta (Q8).
  • Práctica: localmente para volumen de código + privacidad, nube (Opus/GPT) para conocimiento mundial y máxima calidad.

FAQ

¿Por qué Qwen3.8-27B no conoce a los cancilleres?

Un modelo denso de 27B tiene parámetros limitados. Qwen los concentró en código, flujos agentes y tareas multimodales en lugar de conocimiento enciclopédico. En pruebas de comunidad, el modelo invirtió órdenes de cancilleres e inventó datos. Para preguntas sobre hechos, un modelo en la nube o RAG con fuentes reales es el camino correcto.

¿Es Qwen3.8-27B mejor que Claude?

En codificación muy cerca: Terminal-Bench 2.0 igual a Opus (59.3), SkillsBench incluso adelante (48.2 vs 45.3), SWE-bench Verified apenas atrás (77.2 vs 80.9). Claude se mantiene adelante en conocimiento mundial, matiz y calidad general. La verdadera ventaja: Apache 2.0 y ejecutable localmente por $0 por token.

¿Qué hardware necesita Qwen3.8-27B localmente?

Cuantificación Q4: ~20 GB VRAM/RAM (RTX 3090/4090 o memoria unificada). Q8 para mejor calidad: ~32-40 GB, idealmente un Ryzen AI Max+ 395 con 128 GB o un mini-PC con 64+ GB. La cuantificación es notable: la comunidad reporta que Q4 es considerablemente peor que Q8, con estos modelos Qwen vale la pena el cuantificador más alto.

¿Qué tan grave es la alucinación?

Documentada en hechos (datos políticos inventados), contexto de sesión (agente Hermes: historial de conversación fabricado) y llamadas a herramientas (bucles falsos). En el área central de codificación mucho más estable. Regla: nunca confíes en hechos sin fuente, usa cuantificación más alta, en configuraciones de agentes presta atención a esquemas de herramientas claros.

¿Cómo lo inicio localmente?

Ollama, LM Studio o vLLM: ollama run qwen3.8:27b (si está en el registro), o carga GGUF de Hugging Face en LM Studio. Para flujos agentes conecta OpenCode/Aider al endpoint local. Ver el artículo de Ollama para instalación.

Fuentes y lecturas adicionales

Volver al blog
Share:

Entradas relacionadas