Skip to content
BotServBotServ
QwenQwen 2.5AlibabaCodingOllamaIA local

Modelos Qwen: Serie Multilingüe de Alibaba

Qwen 2.5, Qwen VL, QwQ. Tamaños, multilingüismo, capacidades de programación y uso local con Ollama.

S

schutzgeist

13 min read
Modelos Qwen: Serie Multilingüe de Alibaba

Modelos Qwen: La serie multilingüe de Alibaba

Contenido del artículo

  • Qué modelos Qwen existen y en qué se diferencian las variantes
  • Por qué Qwen destaca en multilingüismo y capacidades de programación
  • Cuánta VRAM necesitas para cada modelo Qwen
  • Cómo ejecutar modelos Qwen localmente con Ollama
  • Las características especiales de Qwen VL y QwQ

Introducción

Qwen es la serie de modelos de IA de Alibaba Cloud y una de las familias de código abierto más importantes junto con Llama y Mistral. Desde su primera versión, Qwen ha evolucionado de un proyecto chino a un modelo utilizado en todo el mundo. La serie se caracteriza por tres aspectos sobresalientes: multilingüismo excepcional, sólidas capacidades de programación y un amplio espectro de tamaños.

Si buscas un modelo que domine varios idiomas o que brille especialmente en programación, Qwen es uno de los primeros lugares a considerar. En este artículo obtendrás un panorama completo de la serie de modelos, sus fortalezas y cómo utilizarlos localmente.

¿Por qué necesito Qwen?

Los modelos Qwen tienen varias propiedades que los destacan de la competencia. Primero, son excepcionalmente multilingües. Qwen fue entrenado desde el principio en un gran número de idiomas, incluyendo chino, inglés, alemán, francés, español y muchos más. El multilingüismo no es solo un subproducto, sino un objetivo central del entrenamiento.

Segundo, los modelos Qwen son particularmente fuertes en programación. En varios benchmarks de codificación, los modelos Qwen alcanzan regularmente los primeros puestos, a menudo incluso por delante de Llama y Mistral. Si buscas un modelo para generación de código, análisis de código o depuración, Qwen es una de las mejores opciones.

Tercero, Qwen cubre un espectro de tamaños extremadamente amplio. Desde 0,5 mil millones de parámetros hasta 72 mil millones, hay algo para cada configuración de hardware. El modelo más pequeño funciona en un smartphone, el más grande compite con modelos comerciales de primer nivel.

Cuarto, Qwen ofrece Qwen VL como modelo de visión y QwQ como modelo de razonamiento. Estas variantes especializadas expanden las capacidades más allá del texto plano.

Qwen explicado brevemente

Qwen es una serie de Modelos de Lenguaje Grande desarrollados por Alibaba Cloud. El nombre “Qwen” proviene de “Tongyi Qianwen”, que se traduce libremente como “verdad a través de mil preguntas”. Los modelos se basan en la arquitectura Transformer y están construidos como modelos solo decodificador.

La generación actual es Qwen 2.5, disponible en varios tamaños: 0.5B, 1.5B, 3B, 7B, 14B, 32B y 72B. Además de los modelos de texto, hay Qwen VL para procesamiento de imágenes y QwQ para razonamiento avanzado. Los modelos están disponibles como modelos de pesos abiertos, generalmente bajo la licencia Qwen, que permite el uso comercial bajo ciertas condiciones.

Las versiones Instruct están optimizadas para diálogos e instrucciones. También existen versiones Base que solo continúan texto, pero para la mayoría de usuarios las versiones Instruct son las relevantes.

¿Para quién es este artículo?

Este artículo va dirigido a:

  • Principiantes, que quieren entender qué modelos Qwen existen y cuál se ajusta a sus necesidades
  • Desarrolladores, que buscan un modelo fuerte en programación para uso local
  • Usuarios que necesitan modelos multilingües, especialmente para alemán y chino
  • Usuarios de hogar, que desean ejecutar un modelo Qwen en su computadora
  • Todos, que deseen obtener una visión general de la serie Qwen

Términos importantes

TérminoSignificado
ParámetrosLos valores aprendidos del modelo, cantidad expresada en miles de millones (B)
InstructVersión de un modelo optimizada para instrucciones
BaseVersión original sin optimización Instruct
TokenizadorDivide el texto en tokens que el modelo procesa
Longitud de contextoNúmero máximo de tokens que el modelo puede procesar simultáneamente
MultilingüeModelo que domina varios idiomas en nivel alto
VisiónModelo que puede procesar imágenes como entrada
RazonamientoPensamiento lógico y resolución de problemas paso a paso
CuantizaciónReducción de la precisión del almacenamiento para ahorrar VRAM
GGUFFormato de archivo para modelos cuantizados, utilizado por Ollama

Panorama de los modelos Qwen

Qwen 2.5

Qwen 2.5 es la generación principal actual y se lanzó en septiembre de 2024. Comprende siete tamaños que cubren un espectro extremadamente amplio:

  • Qwen 2.5 0.5B: El modelo más pequeño con 0,5 mil millones de parámetros. Se ejecuta en casi cualquier dispositivo, incluso en smartphones, y está pensado para tareas muy básicas.
  • Qwen 2.5 1.5B: Un poco más grande, aún muy compacto. Adecuado para procesamiento de texto fundamental en hardware débil.
  • Qwen 2.5 3B: Un buen modelo compacto para laptops sin tarjeta gráfica potente. Ofrece un rendimiento aceptable para chat y tareas simples.
  • Qwen 2.5 7B: El punto óptimo para muchos usuarios. Proporciona un buen equilibrio entre rendimiento y requisitos de hardware, similar a Llama 3.1 8B.
  • Qwen 2.5 14B: Un modelo de tamaño medio con rendimiento significativamente mejor que 7B. Requiere más VRAM, pero funciona en GPUs consumer potentes.
  • Qwen 2.5 32B: Un modelo grande que a menudo compite con modelos de 70B en benchmarks. Necesita una GPU potente, pero ofrece un rendimiento excelente.
  • Qwen 2.5 72B: El modelo más grande de la generación. Compite con Llama 3.1 70B y Mistral Large, pero requiere hardware correspondiente.

Todos los modelos Qwen 2.5 tienen una longitud de contexto de 128.000 tokens y son fuertes en programación, matemáticas y multilingüismo.

Qwen VL

Qwen VL (Vision-Language) es la variante multimodal de Qwen. Puede procesar imágenes como entrada y responder preguntas sobre ellas. Qwen VL se basa en el modelo de texto y se amplía con un codificador de visión.

Los casos de uso van desde descripciones de imágenes hasta la lectura de diagramas y el análisis de capturas de pantalla. Qwen VL está disponible en varios tamaños, siendo Qwen 2.5 VL 7B y 72B los más comunes.

QwQ

QwQ es un modelo de razonamiento especializado de Alibaba. Está entrenado para analizar problemas paso a paso antes de dar una respuesta. Similar al modelo o1 de OpenAI, QwQ dedica más tiempo al razonamiento y así proporciona mejores resultados en tareas complejas.

QwQ es particularmente sólido en matemáticas, lógica y razonamiento multinivel. Es menos adecuado para tareas simples de chat, donde la velocidad es más importante que el pensamiento profundo. QwQ se basa en Qwen 2.5 32B y requiere una cantidad de VRAM correspondiente.

Especificaciones técnicas

ModeloParámetrosLongitud de contextoTipoCaracterística
Qwen 2.5 0.5B0,5B128KTextoHuella mínima
Qwen 2.5 1.5B1,5B128KTextoCompacto para Edge
Qwen 2.5 3B3B128KTextoCompacto para laptops
Qwen 2.5 7B7B128KTextoVersátil
Qwen 2.5 14B14B128KTextoTamaño medio
Qwen 2.5 32B32B128KTextoCompite con modelos de 70B
Qwen 2.5 72B72B128KTextoBuque insignia
Qwen 2.5 VL 7B7B128KMultimodalVisión
Qwen 2.5 VL 72B72B128KMultimodalVisión
QwQ 32B32B128KRazonamientoPensamiento paso a paso

Requisitos de VRAM de los modelos Qwen

El consumo de VRAM depende del tamaño del modelo y de la cuantización. La siguiente tabla muestra valores orientativos para Q4_K_M.

ModeloVRAM en Q4_K_MVRAM en Q8VRAM en FP16
Qwen 2.5 0.5Bca. 0,5 GBca. 1 GBca. 1 GB
Qwen 2.5 1.5Bca. 1,5 GBca. 2 GBca. 3 GB
Qwen 2.5 3Bca. 2,5 GBca. 4 GBca. 6 GB
Qwen 2.5 7Bca. 5 GBca. 8 GBca. 14 GB
Qwen 2.5 14Bca. 9 GBca. 15 GBca. 28 GB
Qwen 2.5 32Bca. 20 GBca. 35 GBca. 64 GB
Qwen 2.5 72Bca. 42 GBca. 76 GBca. 144 GB

Estos valores son aproximados y pueden variar ligeramente. Además, necesitarás entre 1 y 2 GB para el contexto. Encontrarás más detalles en el artículo Requisitos de RAM y VRAM y en Tamaño del modelo y necesidades de almacenamiento.

Rendimiento y capacidades

Qwen 2.5 0.5B a 3B funcionan bien para tareas simples: resúmenes, preguntas básicas, procesamiento de texto fundamental. No están pensados para problemas complejos, pero se ejecutan en cualquier dispositivo, incluso en móviles.

Qwen 2.5 7B es un modelo versátil que se mantiene a la altura de Llama 3.1 8B en muchos benchmarks, e incluso lo supera. Qwen destaca especialmente en codificación y soporte multilingüe. La calidad con textos en alemán es excelente.

Qwen 2.5 14B y 32B ofrecen significativamente más capacidad. El modelo de 32B es particularmente interesante porque compite con modelos de 70B en muchos benchmarks, pero requiere mucho menos VRAM. Para usuarios con RTX 3090 o 4090, Qwen 2.5 32B es una opción excelente.

Qwen 2.5 72B es el buque insignia y compite directamente con Llama 3.1 70B y Llama 3.3 70B. En benchmarks de codificación, frecuentemente supera los modelos Llama. El soporte multilingüe se sitúa en un nivel muy alto.

Qwen VL es adecuado para tareas de procesamiento de imágenes. Puede describir imágenes, responder preguntas sobre su contenido y leer texto dentro de ellas. Su rendimiento es comparable al de Llama 3.2 Vision.

QwQ se especializa en razonamiento profundo. En problemas matemáticos, lógica y tareas de varios pasos, frecuentemente proporciona mejores resultados que modelos estándar. El costo es una mayor latencia, ya que el modelo desarrolla sus pensamientos paso a paso.

Casos de uso para modelos Qwen

Caso de usoModelo recomendadoPor qué
Codificación y programaciónQwen 2.5 7B o 32BCapacidades de codificación muy sólidas
Chat multilingüeQwen 2.5 7BMultilingüismo excelente
Análisis de imágenesQwen 2.5 VL 7BModelo de visión con buen rendimiento
Matemáticas y lógicaQwQ 32BEspecializado en razonamiento
Despliegue en edgeQwen 2.5 0.5B o 1.5BHuella mínima
Máximo rendimientoQwen 2.5 72BCompetencia con modelos comerciales

Si tienes dudas sobre cuál es el modelo más apropiado, consulta el artículo Encontrar un modelo para ayudarte en la decisión.

Ejecutar modelos Qwen con Ollama

Ollama es la forma más sencilla de ejecutar modelos Qwen localmente. Solo necesitas un comando en la terminal.

Iniciar Qwen 2.5 7B:

ollama run qwen2.5

Iniciar Qwen 2.5 32B:

ollama run qwen2.5:32b

Iniciar Qwen 2.5 VL 7B:

ollama run qwen2.5vl

Iniciar QwQ 32B:

ollama run qwq

Ollama descarga automáticamente una versión cuantizada apropiada, siendo Q4_K_M la predeterminada. Si deseas usar un nivel de cuantización diferente, puedes especificarlo:

ollama run qwen2.5:7b-q5_K_M

Para eliminar modelos que ya no necesites, usa el siguiente comando. Encontrarás más información en el artículo Gestionar modelos:

ollama rm qwen2.5

Trampas comunes

1. Elegir el tamaño incorrecto: Qwen 2.5 viene en siete tamaños diferentes. Asegúrate de seleccionar el tamaño adecuado para tu hardware. ollama run qwen2.5 carga por defecto la versión 7B. Si necesitas otro tamaño, debes especificarlo explícitamente.

2. QwQ es lento: QwQ es un modelo de razonamiento que requiere mucho tiempo para procesar problemas. Genera pasos intermedios detallados antes de llegar a la respuesta. No es apropiado para tareas de chat rápidas.

3. Usar el modelo de visión sin imágenes: Qwen VL está optimizado para texto e imágenes. Si lo usas solo para texto, desperdicias VRAM en el codificador de visión. Para tareas puramente textuales, usa el modelo estándar Qwen 2.5.

4. Tokenización centrada en chino: Qwen utiliza un tokenizador optimizado para chino. Esto significa que los textos en chino requieren menos tokens que con Llama. Para textos en alemán, el consumo de tokens es similar al de otros modelos, pero no siempre idéntico.

5. Revisar los términos de licencia: Los modelos Qwen están bajo la licencia Qwen, que permite uso comercial pero con ciertas restricciones. Para números de usuarios muy grandes o casos de uso especiales, deberías leer cuidadosamente la licencia. Es menos restrictiva que la licencia Llama, pero no tan libre como Apache 2.0.

6. Usar versiones antiguas de Qwen: Qwen 1.0 y Qwen 1.5 son versiones anteriores y significativamente más débiles que Qwen 2.5. Cuando inicies un modelo Qwen, siempre usa la versión actual 2.5.

7. Los modelos 32B y 72B requieren mucho VRAM: Qwen 2.5 32B cuantizado requiere aproximadamente 20 GB de VRAM, 72B aproximadamente 42 GB. Asegúrate de que tu hardware sea suficiente antes de descargar estos modelos.

Hardware, costos y seguridad

Hardware: Qwen 2.5 7B se ejecuta en una tarjeta gráfica con 8 GB de VRAM en Q4_K_M. El modelo de 14B requiere aproximadamente 9 GB, lo que funciona bien en una RTX 3060 con 12 GB. El modelo de 32B requiere aproximadamente 20 GB de VRAM, es decir, una RTX 3090 o 4090. El modelo de 72B necesita hardware de gama alta con 48 GB de VRAM o más. En un Mac con Apple Silicon, Qwen 2.5 7B funciona bien con 16 GB de RAM, mientras que 32B requiere al menos 32 GB.

Costos: Los modelos se pueden descargar gratuitamente. Los costos residen en el hardware. Para Qwen 2.5 7B, una tarjeta gráfica económica es suficiente. Para 32B y 72B, necesitas hardware costoso. Comparado con APIs en la nube que se facturan por uso de tokens, la ejecución local es más económica a largo plazo.

Seguridad: Los modelos Qwen se ejecutan localmente, tus datos permanecen en tu máquina. Esto es especialmente importante para datos sensibles. Ten en cuenta que los modelos Qwen no tienen filtros de seguridad integrados. Para aplicaciones en producción, deberías implementar medidas adicionales. Un aspecto con Qwen es su origen chino: algunos usuarios tienen preocupaciones sobre posibles influencias de censura en el entrenamiento. Sin embargo, cuando se ejecuta localmente, el modelo no tiene conexión con servidores en China.

Enlaces relacionados

Preguntas frecuentes

¿Qué modelo de Qwen debería probar primero?

Qwen 2.5 7B es la mejor opción para comenzar. Se ejecuta en la mayoría de tarjetas gráficas de consumidor con 8 GB de VRAM y ofrece un buen equilibrio entre rendimiento y requisitos de hardware. Inicia con ollama run qwen2.5.

¿Es Qwen mejor que Llama?

Depende del caso de uso. Qwen suele ser superior en programación y multilingüismo. Llama 3.3 70B tiende a destacar en razonamiento general. Para alemán y programación, Qwen es una opción muy sólida.

¿Puedo ejecutar Qwen 2.5 72B localmente?

Es complicado. Cuantizado (Q4_K_M), 72B requiere aproximadamente 42 GB de VRAM. Eso implica una RTX 4090 con 24 GB más paginación, o una Mac con 64 GB de RAM. Para la mayoría de usuarios, Qwen 2.5 32B es la mejor alternativa.

¿Qué es QwQ?

QwQ es un modelo especializado en razonamiento. Analiza los problemas paso a paso y genera pasos intermedios detallados. Destaca especialmente en matemáticas y lógica, pero es más lento que los modelos estándar. No es adecuado para tareas simples de chat.

¿Puede Qwen entender imágenes?

Sí, Qwen VL puede procesar imágenes. Puedes proporcionarle una imagen y hacer preguntas sobre ella. Los modelos estándar de Qwen 2.5 sin el sufijo VL no pueden procesar imágenes.

¿Qué tal es Qwen en alemán?

Qwen es muy bueno en alemán. El multilingüismo es un objetivo central del entrenamiento, y el alemán funciona notablemente mejor que en muchos otros modelos. Para aplicaciones en alemán, Qwen es una de las mejores opciones disponibles.

¿Son los modelos de Qwen gratuitos?

Los pesos del modelo se pueden descargar sin costo. La licencia de Qwen permite uso comercial con ciertas restricciones, similar a la licencia de Llama. Para la mayoría de usuarios y pequeñas empresas, el uso es gratuito.

¿Cuál es la diferencia entre Qwen 2.5 y versiones anteriores?

Qwen 2.5 es la generación actual con capacidades significativamente mejoradas en programación, matemáticas y multilingüismo. Las versiones anteriores como Qwen 1.5 son más débiles y ya no deberían utilizarse.

¿Está Qwen censurado por su origen chino?

Al ejecutarse localmente, Qwen no tiene conexión con servidores en China. Sin embargo, el modelo puede dar respuestas limitadas en ciertos temas, especialmente sobre política china, porque así fue definido durante el entrenamiento. Para la mayoría de casos de uso en contexto occidental, esto no es relevante.

¿Puedo ejecutar Qwen en una Mac?

Sí. Apple Silicon comparte memoria entre CPU y GPU. Una Mac con 16 GB de RAM puede ejecutar bien Qwen 2.5 7B. Para 32B necesitas al menos 32 GB de RAM, y para 72B al menos 64 GB.

¿Qué modelo de Qwen es mejor para programación?

Qwen 2.5 32B es una de las mejores opciones para programación en el ámbito local. Logra resultados excelentes en benchmarks de codificación y requiere 20 GB de VRAM, menos hardware que la versión 72B. Si tienes menos VRAM disponible, Qwen 2.5 7B es un buen compromiso.

Referencias

  • Alibaba Cloud - Descripción general del modelo Qwen y documentación
  • Biblioteca de modelos Ollama - Modelos Qwen
  • Hugging Face - Página del modelo Qwen
  • Informe técnico de Qwen 2.5 de Alibaba Cloud
Volver al blog
Share:

Entradas relacionadas