Qwen3.8-27B en perspectiva: Bestia para código, no enciclopedia
Qué cubre este artículo
- Primero lo crítico: dónde está el enfoque del modelo y dónde falló en pruebas de comunidad.
- Qué pueden hacer realmente los 27 mil millones de parámetros (código, flujos agentes, visión).
- Comparación con Claude Opus, Sonnet, Haiku y los modelos GPT: benchmarks y costos.
- Para quién tiene sentido ejecutar el modelo localmente y cuándo conviene usar los buques insignia en la nube.
Lo crítico primero: dónde está el enfoque
En pruebas de comunidad, Qwen3.8-27B (y su predecesor Qwen3.6-27B) fue consultado sobre los cancilleres federales de la República Federal Alemana. El resultado: orden invertido, hechos inventados, datos incorrectos. No un “no sé”, sino respuestas inventadas con total confianza.
Suena grave, pero solo es un problema si entiendes mal el modelo. Los 27 mil millones de parámetros no están concentrados en conocimiento mundial. Qwen destinó casi toda la capacidad del modelo a código, trabajo agente y tareas multimodales. Un modelo denso de 27B simplemente no tiene suficientes pesos para ser simultáneamente un reemplazo de Wikipedia y un agente de codificación. Alibaba decidió: mejor el mejor pequeño programador que una enciclopedia mediocre.
Quien consulta sobre hechos históricos, cronología de política alemana o trivialidades prueba la debilidad. Quien proporciona análisis de repositorios, llamadas a herramientas y tareas de código multietapa prueba la fortaleza. Es importante saber esto antes de descargar el modelo, porque los reportes de comunidad pueden ser engañosos de otro modo.
Qué más encontró la comunidad
La lista honesta de debilidades documentadas:
- Alucinación de hechos: hechos históricos/políticos inventados, ver arriba. El conocimiento mundial no es el enfoque.
- Confabulación de contexto: en la prueba de agente Hermes, el modelo fabricó una historial de conversación completamente inventado al inicio de una nueva sesión (documentado en GitHub).
- Bucles de llamada a herramientas: reportes de llamadas falsas a herramientas repetidas en configuraciones agentes, algunas en cuantificaciones oficiales, otras en cuantificaciones de comunidad.
- Sensible a cuantificación: las cuantificaciones Q4 se degradan notablemente; los modelos Qwen se benefician de manera inusual con Q8.
A pesar de esto, se usa ampliamente en la comunidad porque el rendimiento de codificación por parámetro actualmente es prácticamente imbatible.
Qué es realmente Qwen3.8-27B
Los hechos del repositorio de GitHub y Hugging Face:
- Denso 27B, multimodal nativo (texto, imágenes, vídeos, incluso vídeos largos)
- 262K tokens de contexto nativamente, hasta 1M vía YaRN
- Apache 2.0: pesos completamente abiertos, comercialmente utilizables
- Modo thinking activado por defecto,
reasoning_effortypreserve_thinkingconfigurables - Según el fabricante supera al más grande Qwen3.7-Plus en flujos de código y oficina
- Su predecesor Qwen3.6-27B ya superaba al propio buque insignia de 397B-MoE (Qwen3.5-397B-A17B) en todos los benchmarks de código, un modelo denso de 27B que supera un MoE 15 veces más grande
La comparación: benchmarks contra Claude y otros
Los números oficiales de Qwen3.6-27B contra Claude 4.5 Opus (la versión 3.8 supera esto según el fabricante):
| Benchmark | Qwen3.6-27B | Claude 4.5 Opus | Gemma4-31B |
|---|---|---|---|
| SWE-bench Verified | 77.2 | 80.9 | 52.0 |
| SWE-bench Pro | 53.5 | 57.1 | 35.7 |
| SWE-bench Multilingual | 71.3 | 77.5 | 51.7 |
| Terminal-Bench 2.0 | 59.3 | 59.3 | 42.9 |
| SkillsBench Avg5 | 48.2 | 45.3 | 23.6 |
| LiveCodeBench v6 | 83.9 | 84.8 | 80.0 |
| GPQA Diamond | 87.8 | 87.0 | 84.3 |
| AIME26 (matemáticas) | 94.1 | 95.1 | 89.2 |
Perspectiva: Opus se mantiene adelante en código puro (SWE-bench +3.7), pero el modelo de 27B iguala a Terminal-Bench, supera a Opus en SkillsBench (tareas agentes) y GPQA (razonamiento científico). Con los modelos GPT (GPT-5.2, GPT-5-mini) faltan números abiertos comparables en el mismo harness, pero los reportes de comunidad sitúan a Qwen3.8-27B en codificación aproximadamente en el nivel de GPT-5-mini a GPT-5, dependiendo de la tarea.
Costos: La verdadera ventaja
| Modelo | Precio (API) | Ejecutable localmente |
|---|---|---|
| Claude Opus 4.5 | ~$15/$75 por Mtok | No |
| Claude Sonnet 4.5 | ~$3/$15 | No |
| Claude Haiku 4.5 | ~$1/$5 | No |
| GPT-5.2 | ~$1.75/$14 | No |
| GPT-5-mini | ~$0.30/$2.40 | No |
| Qwen3.8-27B | ~$0.15-0.60 API, $0 localmente | Sí, desde ~20 GB VRAM/RAM |
En un Ryzen AI Max+ 395 con 128 GB funciona cómodamente en Q4/Q5, en un mini-PC con 64+ GB también. Esa es la verdadera ecuación: nivel Opus en tareas agentes, pero $0 por token y sin datos saliendo.
Cuándo es correcto usar este modelo
Usa Qwen3.8-27B si:
- Quieres un agente de codificación local (ediciones a nivel de repositorio, llamadas a herramientas, trabajo en terminal).
- La privacidad importa: el código permanece en tu hardware.
- Necesitas muchos tokens: 262K de contexto, localmente gratuito.
- Multimodal: entiende capturas de pantalla, diagramas, incluso vídeos.
Usa Claude/GPT si:
- Necesitas conocimiento mundial amplio (hechos, historia, política).
- El rendimiento máximo en código es crucial (Opus lidera SWE-bench).
- No quieres operar tu propio hardware.
Consejo práctico: la combinación es la respuesta de la mayoría de usuarios avanzados. Qwen3.8-27B localmente para trabajo de código y volumen, un modelo en la nube para preguntas sobre hechos y ese último 5% de calidad. En OpenCode/Aider/OpenChamber ambos pueden configurarse en paralelo, ver modelos de codificación y OpenChamber.
Enlaces relacionados
- IRC-Coding.de: tutoriales de programación.
- Modelos de codificación en comparación: toda la liga.
- Ollama: inicia Qwen localmente.
- MS-S1 Max: para quién vale la pena: el hardware para modelos de 27B.
- IA para proyectos de codificación: agente en operación continua.
- Prompts ChatGPT: práctica de prompting.
Puntos clave:
- Qwen3.8-27B inventa hechos (prueba de cancilleres) porque los 27B se concentran deliberadamente en código/agentes en lugar de conocimiento mundial. Es un diseño, no un error.
- Benchmarks de codificación: supera su predecesor de 397B, iguala a Claude Opus en Terminal-Bench, gana en SkillsBench.
- Apache 2.0, 262K de contexto (1M vía YaRN), multimodal nativo, desde ~20 GB VRAM localmente.
- Limitación de comunidad: confabulación y bucles de herramientas, se recomienda cuantificación más alta (Q8).
- Práctica: localmente para volumen de código + privacidad, nube (Opus/GPT) para conocimiento mundial y máxima calidad.
FAQ
¿Por qué Qwen3.8-27B no conoce a los cancilleres?
¿Es Qwen3.8-27B mejor que Claude?
¿Qué hardware necesita Qwen3.8-27B localmente?
¿Qué tan grave es la alucinación?
¿Cómo lo inicio localmente?
Fuentes y lecturas adicionales
- Qwen3.8-27B en Hugging Face, GitHub
- Benchmarks Qwen3.6-27B (Blog Alibaba Cloud)
- Comunidad: alucinaciones en Qwen3.6-27B (discusión HF), problema agente Hermes
- IRC-Coding.de: tutoriales de programación.


