Skip to content
BotServBotServ
MistralMixtralMoEMistral 7BOllamaIA local

Modelos Mistral: Alternativa Open-Source Europea

Mistral 7B, Mixtral 8x7B, Mistral Large. Arquitectura, MoE, requisitos de hardware y uso local explicado.

S

schutzgeist

13 min read
Modelos Mistral: Alternativa Open-Source Europea

Modelos Mistral: la alternativa open-source europea

Qué cubre este artículo

  • Qué modelos Mistral existen y cómo se diferencian entre sí
  • Qué es una arquitectura Mixture-of-Experts y por qué Mixtral la utiliza
  • Cuánta VRAM necesitas para cada modelo Mistral
  • Cómo ejecutar modelos Mistral localmente con Ollama
  • Las fortalezas y debilidades de la serie de modelos

Introducción

Mistral AI es una empresa francesa de IA que desde 2023 desarrolla una de las series de modelos open-source más importantes del mundo. Fundada por investigadores antiguos de Meta y DeepMind, Mistral ha demostrado rápidamente que una empresa europea con un equipo pequeño puede construir modelos competitivos. El primer modelo, Mistral 7B, fue un hito importante: era pequeño, rápido y sin embargo más potente que muchos modelos más grandes de la competencia.

Si te interesa la IA local, los modelos Mistral son particularmente atractivos. Son eficientes, bien entrenados en idiomas europeos y disponibles en varios tamaños. En este artículo obtendrás una visión completa de la serie de modelos, su arquitectura y cómo implementarlos localmente.

¿Por qué necesito Mistral?

Los modelos Mistral tienen varias características que los hacen especialmente interesantes para IA local. En primer lugar, son extremadamente eficientes. Mistral 7B a menudo entrega mejores resultados que modelos comparables del mismo tamaño. Esto se debe a una arquitectura bien pensada y un entrenamiento cuidadoso.

En segundo lugar, los modelos Mistral son sólidos en idiomas europeos. Como Mistral es una empresa francesa, los modelos fueron entrenados multilingües desde el inicio. Alemán, francés, español e italiano funcionan a menudo mejor en Mistral que en modelos orientados principalmente al inglés.

En tercer lugar, Mistral introduce con Mixtral 8x7B una arquitectura especial: Mixture of Experts. Esta arquitectura combina múltiples submodelos y activa solo los relevantes para cada solicitud. El resultado es un modelo tan potente como uno grande, pero que responde más rápido.

En cuarto lugar, los modelos están disponibles bajo licencias libres. Mistral 7B y Mixtral 8x7B se encuentran bajo Apache 2.0, una de las licencias open-source más permisivas. Esto significa que puedes usarlos comercialmente sin temor a restricciones.

Mistral explicado brevemente

Mistral es una serie de Large Language Models de la empresa francesa Mistral AI. Los modelos se basan en la arquitectura Transformer, pero utilizan varias optimizaciones como Grouped-Query Attention y Sliding Window Attention para ser más eficientes.

Los nombres de los modelos siguen un esquema claro: “Mistral” seguido del número de parámetros identifica modelos densos, donde todos los parámetros están activos en cada solicitud. “Mixtral” identifica modelos Mixture-of-Experts, donde solo una parte de los parámetros se activa por solicitud. La designación “8x7B” significa que el modelo tiene 8 expertos con 7 mil millones de parámetros cada uno, de los cuales 2 se activan en cada solicitud.

Además de los modelos abiertos, Mistral también ofrece modelos comerciales como Mistral Large, que solo están disponibles a través de API. Para operación local, son relevantes los modelos open-weight.

Para quién es este artículo

Este artículo va dirigido a:

  • Principiantes que quieren entender qué modelos Mistral existen y cómo funcionan
  • Usuarios personales que buscan un modelo eficiente para idiomas europeos
  • Desarrolladores que quieren integrar Mistral en sus propias aplicaciones
  • Todos los interesados en arquitecturas MoE sin necesidad de sumergirse en papers de investigación
  • Usuarios que buscan una alternativa a Llama

Términos importantes

TérminoSignificado
ParámetrosLos valores aprendidos del modelo, número expresado en miles de millones (B)
MoEMixture of Experts, arquitectura con múltiples submodelos
ExpertoUn submodelo en una arquitectura MoE
RouterComponente que decide qué expertos se activan
Dense ModelModelo donde todos los parámetros están activos en cada solicitud
Sliding Window AttentionTécnica que procesa el contexto de manera eficiente
Grouped-Query AttentionOptimización que ahorra VRAM y tiempo de cálculo
CuantizaciónReducción de la precisión del almacenamiento para ahorrar VRAM
GGUFFormato de archivo para modelos cuantizados, utilizado por Ollama
Context LengthNúmero máximo de tokens que el modelo puede procesar simultáneamente

Descripción general de los modelos Mistral

Mistral AI ha publicado varios modelos que cubren diferentes audiencias y casos de uso. Aquí están los modelos más importantes para implementación local.

Mistral 7B

Mistral 7B fue el primer modelo de Mistral AI y se lanzó en septiembre de 2023. Tiene 7 mil millones de parámetros y es un modelo denso donde todos los parámetros están activos en cada solicitud. A pesar de su tamaño reducido, superó en muchos benchmarks al Llama 2 13B significativamente más grande.

Las fortalezas de Mistral 7B radican en eficiencia y velocidad. Se ejecuta en tarjetas gráficas con 8 GB de VRAM en forma cuantizada, lo que lo convierte en uno de los modelos más accesibles para empezar. El multilingüismo es bueno, especialmente para idiomas europeos.

Mistral 7B está bajo licencia Apache 2.0, lo que significa que puedes usarlo libremente, modificarlo e incluso usarlo comercialmente.

Mixtral 8x7B

Mixtral 8x7B se lanzó en diciembre de 2023 y es el primer modelo MoE de Mistral. Tiene 8 expertos con 7 mil millones de parámetros cada uno. En cada solicitud, el router activa 2 de los 8 expertos, basándose en el texto de entrada. El número total de parámetros es aproximadamente 47 mil millones, pero solo alrededor de 13 mil millones están activos en cada solicitud.

Esto significa: Mixtral 8x7B es tan potente como un modelo grande, pero tan rápido como un modelo 13B. En benchmarks, alcanza el nivel de Llama 2 70B, pero requiere menos potencia de cálculo por token.

Sin embargo, el requisito de VRAM es alto. Como los 8 expertos deben mantenerse en memoria, necesitas significativamente más VRAM que para un modelo 7B simple incluso en forma cuantizada. Mixtral 8x7B también está bajo Apache 2.0.

Mistral Nemo

Mistral Nemo es un desarrollo posterior realizado en colaboración con Nvidia. Tiene 12 mil millones de parámetros y es un modelo denso. Nemo ofrece una longitud de contexto de 128.000 tokens y es particularmente eficiente. Es una buena opción si necesitas un modelo de tamaño medio que ofrezca más rendimiento que 7B pero requiera menos VRAM que Mixtral.

Mistral Large

Mistral Large es el buque insignia de Mistral AI, pero no está disponible como modelo open-weight. Solo se puede acceder a través de la API de Mistral y no es relevante para operación local. Se menciona aquí únicamente por completitud.

Mixture of Experts: cómo funciona MoE

MoE es una arquitectura que divide un modelo en múltiples submodelos especializados, llamados expertos. En lugar de utilizar todos los parámetros en cada solicitud, un router selecciona los expertos más adecuados para cada token.

Imagina que tienes un equipo de 8 especialistas: uno en matemáticas, otro en programación, otro en historia y así sucesivamente. Cuando haces una pregunta, un coordinador la envía a los dos especialistas mejor capacitados. Los otros seis permanecen inactivos sin consumir tiempo de cálculo. Así es como funciona MoE.

La ventaja es clara: el modelo tiene más conocimiento y capacidades en total porque tiene más parámetros. Pero la ejecución es más rápida porque solo una parte de los parámetros está activa. La desventaja es que todos los expertos deben mantenerse en VRAM. El requisito de almacenamiento se basa en el número total de parámetros, no en los activos.

En Mixtral 8x7B, eso significa 47 mil millones de parámetros en total que deben caber en memoria. Cuantizado a Q4_K_M necesitas aproximadamente 26 GB de VRAM. Esto es significativamente más que para un modelo 7B, pero menos que para un modelo 70B.

Especificaciones técnicas

ModeloParámetrosParámetros activosContext LengthArquitecturaLicencia
Mistral 7B7B7B32KDenseApache 2.0
Mixtral 8x7B47B13B32KMoE (8x7B)Apache 2.0
Mistral Nemo12B12B128KDenseApache 2.0
Mistral Largepropietariopropietario128KDensecomercial

Consumo de VRAM de los modelos Mistral

El VRAM necesario depende del tamaño del modelo y la cuantización. Con modelos MoE, ten en cuenta que todos los expertos deben residir en memoria, aunque solo algunos estén activos en cada momento.

ModeloVRAM con Q4_K_MVRAM con Q8VRAM con FP16
Mistral 7Baprox. 5 GBaprox. 8 GBaprox. 14 GB
Mistral Nemo 12Baprox. 8 GBaprox. 13 GBaprox. 24 GB
Mixtral 8x7Baprox. 26 GBaprox. 49 GBaprox. 90 GB

Estos valores son aproximados y varían ligeramente según la implementación. Además del modelo, necesitarás entre 1 y 2 GB para el contexto. Encontrarás más detalles en el artículo Requisitos de RAM y VRAM y en Tamaño del modelo y consumo de memoria.

Rendimiento

Mistral 7B es notablemente potente para su tamaño. Supera a Llama 2 13B en muchos benchmarks y es un excelente modelo para empezar. Funciona bien para chat, resúmenes de textos y tareas de codificación sencillas. Con razonamiento complejo tropieza con limitaciones, algo esperado en un modelo de 7 mil millones de parámetros.

Mixtral 8x7B es significativamente más potente y alcanza el nivel de Llama 2 70B. Maneja tareas de razonamiento complejos, comunicación multilingüe y codificación exigente. La arquitectura MoE lo hace más rápido en ejecución que un modelo denso comparable. La calidad en alemán es buena, lo que hace que Mistral sea una alternativa sólida a Llama.

Mistral Nemo se posiciona entre 7B y Mixtral. Con 12 mil millones de parámetros ofrece más rendimiento que Mistral 7B pero requiere menos VRAM que Mixtral. Su amplio Context Length de 128.000 tokens lo hace ideal para procesar documentos largos.

Casos de uso para modelos Mistral

Caso de usoModelo recomendadoPor qué
Inicios en IA localMistral 7BPequeño, rápido, licencia Apache 2.0
Chat multilingüeMistral 7B o NemoExcelente soporte para idiomas europeos
Razonamiento complejoMixtral 8x7BAlto rendimiento gracias a MoE
Procesar documentos largosMistral NemoContext Length de 128K
Proyectos comercialesMistral 7B o MixtralApache 2.0 sin restricciones de uso
Operación eficiente en recursosMistral 7BSolo 5 GB VRAM con Q4

Si no estás seguro de qué modelo te conviene, el artículo Encontrar el modelo indicado te ayudará a decidir.

Ejecutar modelos Mistral con Ollama

Ollama es el método más simple para iniciar modelos Mistral localmente. Solo necesitas un comando en la terminal.

Iniciar Mistral 7B:

ollama run mistral

Iniciar Mixtral 8x7B:

ollama run mixtral

Iniciar Mistral Nemo:

ollama run mistral-nemo

Ollama descarga automáticamente una versión cuantizada apropiada, por defecto Q4_K_M. Si deseas usar un nivel de cuantización diferente, puedes especificarlo:

ollama run mistral:7b-q5_K_M

Los modelos que ya no necesites puedes eliminarlos con el siguiente comando. Más información en el artículo Gestionar modelos:

ollama rm mistral

Trampas comunes

1. Los modelos MoE requieren más VRAM de lo esperado: Mixtral 8x7B tiene 47 mil millones de parámetros en total. Aunque solo 13 mil millones están activos por consulta, los 47 mil millones completos deben residir en VRAM. Cuantizado necesitarás aproximadamente 26 GB, lo que requiere una RTX 3090 o 4090.

2. Context Length limitado de Mistral 7B: Mistral 7B tiene un Context Length nativo de 32.000 tokens. Es menor que el de Llama 3.1 con 128.000 tokens. Para documentos muy largos, Mistral Nemo u otro modelo con ventana de contexto mayor es la mejor opción.

3. Confundir modelos de peso abierto con comerciales: No todos los modelos Mistral están disponibles libremente. Mistral Large y Mistral Medium solo se pueden usar a través de API. Para operación local solo son relevantes Mistral 7B, Mixtral 8x7B y Mistral Nemo.

4. Ejecutar MoE en CPU es lento: Los modelos MoE están optimizados para GPUs. En una CPU sin aceleración GPU, Mixtral 8x7B es significativamente más lento que un modelo denso comparable. Si no tienes una GPU potente, usa mejor Mistral 7B.

5. Expectativas incorrectas sobre velocidad de MoE: Los modelos MoE son más rápidos que modelos densos del mismo tamaño total, pero no más rápidos que modelos densos pequeños. Mixtral 8x7B es más rápido que un modelo denso de 47B, pero no tan rápido como Mistral 7B.

6. Usar versiones antiguas: Mistral 7B v0.1 es la primera versión. También existen v0.2 y v0.3 con mejoras. Si usas Mistral 7B asegúrate de que estés usando la versión actual. Ollama ofrece la versión más reciente por defecto.

7. Revisar licencia con Fine-Tunes: Mistral 7B y Mixtral están bajo Apache 2.0, pero Fine-Tunes de terceros pueden tener otras licencias. Siempre verifica la licencia del modelo específico que descargas.

Hardware, costos y seguridad

Hardware: Mistral 7B es uno de los modelos más amigables con el hardware. Funciona en una tarjeta gráfica con 8 GB VRAM en Q4_K_M. Mixtral 8x7B requiere bastante más: aproximadamente 26 GB VRAM cuantizado, lo que requiere una RTX 3090 o 4090. Mistral Nemo está entre ambos con aproximadamente 8 GB VRAM en Q4_K_M. En una Mac con Apple Silicon, Mistral 7B funciona bien con 16 GB de RAM, Mixtral necesita al menos 32 GB.

Costos: Los modelos de peso abierto son gratuitos. Los costos recaen en el hardware. Para Mistral 7B basta una tarjeta gráfica económica como la RTX 3060 con 12 GB. Para Mixtral necesitas hardware de gama alta en el rango de 1.500 euros o más. Mistral Large a través de API tiene costo por tokens usados, lo que con uso intensivo puede ser más caro que operación local.

Seguridad: Como todos los modelos locales, tus datos permanecen en tu máquina. Los modelos Mistral no tienen filtros de seguridad incorporados, por lo que pueden generar contenido inapropiado. La licencia Apache 2.0 te da control total sobre el uso. Para aplicaciones en producción deberías implementar medidas de seguridad adicionales, como filtros de entrada o verificación de salida.

Enlaces relacionados

Preguntas frecuentes

¿Cuál es el modelo de Mistral por el que debo empezar?

Mistral 7B es la opción ideal para principiantes. Funciona en la mayoría de tarjetas gráficas de consumidor con 8 GB de VRAM y ofrece un buen desempeño. Comienza con ollama run mistral.

¿Qué significa Mixtral 8x7B?

El nombre indica que el modelo contiene 8 expertos con 7 mil millones de parámetros cada uno. En cada consulta se activan 2 de los 8 expertos. El número total de parámetros es aproximadamente 47 mil millones, pero solo 13 mil millones están activos por consulta.

¿Necesito más VRAM para Mixtral que para un modelo 7B?

Sí, significativamente más. Como todos los 8 expertos deben mantenerse en memoria, requieres aproximadamente 26 GB de VRAM con cuantización Q4_K_M, casi cinco veces más que para Mistral 7B.

¿Son gratuitos los modelos de Mistral?

Mistral 7B, Mixtral 8x7B y Mistral Nemo están bajo licencia Apache 2.0 y son gratuitos, incluso para uso comercial. Mistral Large y Mistral Medium son modelos comerciales disponibles únicamente a través de API.

¿Es Mistral mejor que Llama?

Depende del caso de uso. Mistral 7B es más eficiente que Llama 3.1 8B con desempeño similar. Mixtral 8x7B es comparable a Llama 3.1 70B. Para idiomas europeos, Mistral suele ser la mejor opción. Si buscas máximo desempeño, Llama 3.3 70B es más potente.

¿Qué tal es Mistral en alemán?

Los modelos de Mistral están bien entrenados en idiomas europeos, incluyendo el alemán. La calidad en alemán es frecuentemente superior a la de los modelos Llama, especialmente en formulaciones naturales. Para aplicaciones exclusivamente en alemán, Mistral es una opción recomendable.

¿Cuál es la diferencia entre Dense y MoE?

En un modelo denso todos los parámetros están activos en cada consulta. En un modelo MoE hay múltiples expertos, de los cuales solo una parte se activa por consulta. Los modelos MoE son más rápidos en ejecución, pero requieren la misma cantidad de VRAM que un modelo denso del mismo tamaño total.

¿Puedo ejecutar Mixtral en una RTX 3060 con 12 GB?

No, Mixtral 8x7B requiere aproximadamente 26 GB de VRAM incluso cuantizado. Una RTX 3060 con 12 GB es insuficiente. Necesitas al menos una RTX 3090 o 4090 con 24 GB, y aun así será ajustado. Como alternativa, puedes usar Mistral 7B.

¿Puedo usar Mistral en proyectos comerciales?

Sí. Mistral 7B, Mixtral 8x7B y Mistral Nemo están bajo Apache 2.0, que permite explícitamente el uso comercial. No hay restricciones respecto a número de usuarios o ingresos, a diferencia de la licencia de Llama de Meta.

¿Qué es Mistral Nemo y para quién es adecuado?

Mistral Nemo es un modelo de 12B desarrollado en colaboración con Nvidia. Ofrece una longitud de contexto de 128.000 tokens y se posiciona entre Mistral 7B y Mixtral. Es ideal para usuarios que necesitan más desempeño que 7B pero no pueden asumir el consumo de VRAM de Mixtral.

¿Existen modelos Mistral Vision?

Mistral ha lanzado Pixtral, un modelo de visión capaz de procesar imágenes. Sin embargo, no está disponible en la misma amplitud que los modelos de texto. Para aplicaciones puramente de texto, Mistral 7B, Nemo o Mixtral son la mejor opción.

Fuentes

  • Mistral AI, descripción de modelos y documentación
  • Ollama Model Library, modelos Mistral
  • Hugging Face, página del modelo Mistral AI
  • Mistral AI, reportes técnicos sobre Mistral 7B y Mixtral 8x7B
Volver al blog
Share:

Entradas relacionadas