Usar modelos Mistral localmente
Qué cubre este artículo sobre modelos Mistral
- Cuáles son los modelos Mistral adecuados para ejecutar localmente.
- Cómo cargarlos con Ollama u otras herramientas.
- Qué hardware necesitas.
- Cómo afecta la cuantización a la calidad y la velocidad.
- Aplicaciones típicas y errores comunes.
Introducción: usar modelos Mistral localmente
Mistral AI es una empresa europea que desarrolla modelos de lenguaje potentes y eficientes. Muchos modelos Mistral son de código abierto y se pueden ejecutar localmente. Esto resulta especialmente interesante para quienes valoran la privacidad de datos, el control y la independencia de proveedores en la nube estadounidenses.
Los modelos Mistral destacan por su buen soporte multilingüe, arquitecturas eficientes y sólidas capacidades de codificación. Ejecutados localmente en Ollama o llama.cpp, funcionan sin necesidad de conexión a internet.
¿Qué es Mistral?
Mistral AI desarrolla modelos fundacionales y los ofrece tanto a través de APIs como bajo licencias de código abierto. Las variantes locales más conocidas son:
- Mistral 7B: Primer modelo de código abierto de 7B con alto rendimiento.
- Mixtral 8x7B: Sparse Mixture-of-Experts con excelente eficiencia.
- Mixtral 8x22B: Variante MoE más grande.
- Mistral Nemo: Modelo de 12B con fuerte soporte multilingüe.
- Mistral Large 2: Modelo potente de código cerrado, solo disponible por API.
- Codestral: Especializado en programación.
- Mathstral: Enfocado en matemáticas.
Términos importantes
- MoE: Mixture-of-Experts, activa solo parte de los parámetros por token.
- Sliding Window Attention: Mecanismo de atención eficiente.
- RoPE: Codificación posicional para contextos más largos.
- Grouped-Query Attention: Reduce el uso de memoria durante el decoding.
- GGUF: Formato para ejecución local con llama.cpp.
- vLLM: Motor para inferencia local rápida.
Modelos en resumen
| Modelo | Tamaño | Tipo | Uso |
|---|---|---|---|
| Mistral 7B v0.3 | 7B | Dense | Chat general, Coding |
| Mixtral 8x7B | 47B activo 8x7B | MoE | Tareas avanzadas |
| Mixtral 8x22B | 141B activo 8x22B | MoE | Respuestas de alta calidad |
| Mistral Nemo | 12B | Dense | Multilingüismo |
| Codestral | 22B | Dense | Generación de código |
| Mathstral | 7B | Dense | Matemáticas |
Requisitos de hardware
- Mistral 7B Q4: aproximadamente 5 GB RAM/VRAM.
- Mistral Nemo Q4: aproximadamente 8 GB RAM/VRAM.
- Mixtral 8x7B Q4: aproximadamente 32 GB RAM/VRAM.
- Mixtral 8x22B Q4: mucha memoria, frecuentemente múltiples GPUs.
- Codestral Q4: aproximadamente 15 GB RAM/VRAM.
Los modelos MoE se pueden cuantizar, pero requieren mucha memoria por la cantidad de expertos. Para hardware de consumidor, Mistral 7B, Nemo y Mathstral son los más apropiados.
Instalación con Ollama
Ollama proporciona muchos modelos Mistral previamente empaquetados:
ollama pull mistral
ollama pull mistral-nemo
ollama pull mixtral
ollama pull codestral
ollama pull mathstral
Para iniciar:
ollama run mistral
Uso a través de la API
Una vez que Ollama esté en ejecución, puedes enviar consultas mediante la API:
curl http://localhost:11434/api/generate -d '{
"model": "mistral",
"prompt": "Explica la cuantización en tres oraciones."
}'
Cuantización
Para operación local, las versiones de 4 bits suelen ser suficientes. Se recomienda un formato como Q4_K_M. En modelos MoE, la calidad puede deteriorarse más con cuantización fuerte que en modelos densos. Para codificación y matemáticas, Q5_K_M o Q6_K funcionan mejor.
Aplicaciones
- Chat y asesoramiento: Mistral 7B o Nemo.
- Codificación: Codestral o Mistral 7B.
- Matemáticas: Mathstral.
- RAG: Nemo o Mistral 7B con documentos en alemán.
- Agentes: Mixtral 8x7B para uso de herramientas más complejo.
Multilingüismo
Mistral Nemo fue entrenado explícitamente para un excelente soporte multilingüe. Mistral 7B v0.3 también proporciona resultados sólidos en alemán. Para aplicaciones solo en alemán, los modelos especializados alemanes o las variantes más recientes de Qwen y Llama a menudo funcionan mejor.
Errores comunes
- Elegir el modelo incorrecto: Mixtral requiere mucha memoria.
- Cuantización demasiado agresiva: MoE sufre más con 4 bits.
- Falta de system prompt: Mistral responde bien a instrucciones claras.
- Versión desactualizada: v0.1 y v0.3 difieren notablemente.
- MoE no comprendido: Solo una parte de los expertos está activa por token, pero el archivo sigue siendo grande.
Enlaces e información adicional
- BotServ.de Modelos de IA locales
- BotServ.de Fundamentos de cuantización
- BotServ.de Configurar Ollama
- BotServ.de RAG local
FAQ: Modelos Mistral localmente
¿Puedo ejecutar modelos Mistral en una GPU? Sí. Ollama, llama.cpp y vLLM soportan CUDA, ROCm y Metal.
¿Se pueden usar realmente los modelos Mistral localmente? Sí, los modelos de código abierto se pueden descargar y ejecutar localmente.
¿Qué modelo para el uso del alemán? Mistral Nemo o Mistral 7B v0.3 son buenos candidatos.
¿Vale la pena Mixtral para hardware de consumidor? Solo si hay suficiente RAM o VRAM disponible. Los modelos de 7B y 12B suelen ser más adecuados.
¿Es Codestral mejor que Mistral 7B para codificación? Sí, Codestral está especializado y generalmente proporciona mejores resultados de código.
Fuentes y lecturas adicionales
- Mistral AI: https://mistral.ai/
- Ollama Library: https://ollama.com/library/mistral
- Hugging Face Mistral: https://huggingface.co/mistralai
Resumen: usar modelos Mistral localmente
Mistral ofrece modelos potentes de código abierto para ejecución local. Para iniciarse, Mistral 7B y Nemo son buenos puntos de partida. Para tareas más complejas, considera Mixtral o Codestral. Lo importante es contar con memoria suficiente, elegir la cuantización adecuada y alinear el modelo con tu caso de uso. Con Ollama puedes cargar y probar los modelos rápidamente. Si prefieres modelos open source europeos, Mistral es una alternativa sólida frente a Llama y Qwen.


