Skip to content
BotServBotServ
MistralMistral NemoMistral LargeIA LocalOllama

Usar modelos Mistral localmente

Ejecutar modelos Mistral en local. Modelos, hardware, cuantización y aplicaciones de Mistral Nemo hasta Large 2.

S

schutzgeist

4 min read
Usar modelos Mistral localmente

Usar modelos Mistral localmente

Qué cubre este artículo sobre modelos Mistral

  • Cuáles son los modelos Mistral adecuados para ejecutar localmente.
  • Cómo cargarlos con Ollama u otras herramientas.
  • Qué hardware necesitas.
  • Cómo afecta la cuantización a la calidad y la velocidad.
  • Aplicaciones típicas y errores comunes.

Introducción: usar modelos Mistral localmente

Mistral AI es una empresa europea que desarrolla modelos de lenguaje potentes y eficientes. Muchos modelos Mistral son de código abierto y se pueden ejecutar localmente. Esto resulta especialmente interesante para quienes valoran la privacidad de datos, el control y la independencia de proveedores en la nube estadounidenses.

Los modelos Mistral destacan por su buen soporte multilingüe, arquitecturas eficientes y sólidas capacidades de codificación. Ejecutados localmente en Ollama o llama.cpp, funcionan sin necesidad de conexión a internet.

¿Qué es Mistral?

Mistral AI desarrolla modelos fundacionales y los ofrece tanto a través de APIs como bajo licencias de código abierto. Las variantes locales más conocidas son:

  • Mistral 7B: Primer modelo de código abierto de 7B con alto rendimiento.
  • Mixtral 8x7B: Sparse Mixture-of-Experts con excelente eficiencia.
  • Mixtral 8x22B: Variante MoE más grande.
  • Mistral Nemo: Modelo de 12B con fuerte soporte multilingüe.
  • Mistral Large 2: Modelo potente de código cerrado, solo disponible por API.
  • Codestral: Especializado en programación.
  • Mathstral: Enfocado en matemáticas.

Términos importantes

  • MoE: Mixture-of-Experts, activa solo parte de los parámetros por token.
  • Sliding Window Attention: Mecanismo de atención eficiente.
  • RoPE: Codificación posicional para contextos más largos.
  • Grouped-Query Attention: Reduce el uso de memoria durante el decoding.
  • GGUF: Formato para ejecución local con llama.cpp.
  • vLLM: Motor para inferencia local rápida.

Modelos en resumen

ModeloTamañoTipoUso
Mistral 7B v0.37BDenseChat general, Coding
Mixtral 8x7B47B activo 8x7BMoETareas avanzadas
Mixtral 8x22B141B activo 8x22BMoERespuestas de alta calidad
Mistral Nemo12BDenseMultilingüismo
Codestral22BDenseGeneración de código
Mathstral7BDenseMatemáticas

Requisitos de hardware

  • Mistral 7B Q4: aproximadamente 5 GB RAM/VRAM.
  • Mistral Nemo Q4: aproximadamente 8 GB RAM/VRAM.
  • Mixtral 8x7B Q4: aproximadamente 32 GB RAM/VRAM.
  • Mixtral 8x22B Q4: mucha memoria, frecuentemente múltiples GPUs.
  • Codestral Q4: aproximadamente 15 GB RAM/VRAM.

Los modelos MoE se pueden cuantizar, pero requieren mucha memoria por la cantidad de expertos. Para hardware de consumidor, Mistral 7B, Nemo y Mathstral son los más apropiados.

Instalación con Ollama

Ollama proporciona muchos modelos Mistral previamente empaquetados:

ollama pull mistral
ollama pull mistral-nemo
ollama pull mixtral
ollama pull codestral
ollama pull mathstral

Para iniciar:

ollama run mistral

Uso a través de la API

Una vez que Ollama esté en ejecución, puedes enviar consultas mediante la API:

curl http://localhost:11434/api/generate -d '{
  "model": "mistral",
  "prompt": "Explica la cuantización en tres oraciones."
}'

Cuantización

Para operación local, las versiones de 4 bits suelen ser suficientes. Se recomienda un formato como Q4_K_M. En modelos MoE, la calidad puede deteriorarse más con cuantización fuerte que en modelos densos. Para codificación y matemáticas, Q5_K_M o Q6_K funcionan mejor.

Aplicaciones

  • Chat y asesoramiento: Mistral 7B o Nemo.
  • Codificación: Codestral o Mistral 7B.
  • Matemáticas: Mathstral.
  • RAG: Nemo o Mistral 7B con documentos en alemán.
  • Agentes: Mixtral 8x7B para uso de herramientas más complejo.

Multilingüismo

Mistral Nemo fue entrenado explícitamente para un excelente soporte multilingüe. Mistral 7B v0.3 también proporciona resultados sólidos en alemán. Para aplicaciones solo en alemán, los modelos especializados alemanes o las variantes más recientes de Qwen y Llama a menudo funcionan mejor.

Errores comunes

  • Elegir el modelo incorrecto: Mixtral requiere mucha memoria.
  • Cuantización demasiado agresiva: MoE sufre más con 4 bits.
  • Falta de system prompt: Mistral responde bien a instrucciones claras.
  • Versión desactualizada: v0.1 y v0.3 difieren notablemente.
  • MoE no comprendido: Solo una parte de los expertos está activa por token, pero el archivo sigue siendo grande.

Enlaces e información adicional

FAQ: Modelos Mistral localmente

¿Puedo ejecutar modelos Mistral en una GPU? Sí. Ollama, llama.cpp y vLLM soportan CUDA, ROCm y Metal.

¿Se pueden usar realmente los modelos Mistral localmente? Sí, los modelos de código abierto se pueden descargar y ejecutar localmente.

¿Qué modelo para el uso del alemán? Mistral Nemo o Mistral 7B v0.3 son buenos candidatos.

¿Vale la pena Mixtral para hardware de consumidor? Solo si hay suficiente RAM o VRAM disponible. Los modelos de 7B y 12B suelen ser más adecuados.

¿Es Codestral mejor que Mistral 7B para codificación? Sí, Codestral está especializado y generalmente proporciona mejores resultados de código.

Fuentes y lecturas adicionales

Resumen: usar modelos Mistral localmente

Mistral ofrece modelos potentes de código abierto para ejecución local. Para iniciarse, Mistral 7B y Nemo son buenos puntos de partida. Para tareas más complejas, considera Mixtral o Codestral. Lo importante es contar con memoria suficiente, elegir la cuantización adecuada y alinear el modelo con tu caso de uso. Con Ollama puedes cargar y probar los modelos rápidamente. Si prefieres modelos open source europeos, Mistral es una alternativa sólida frente a Llama y Qwen.

Volver al blog
Share:

Entradas relacionadas