Recomendaciones de modelos Ollama por caso de uso
Qué cubre este artículo sobre recomendaciones de modelos
- Modelos recomendados para casos de uso típicos.
- Diferencias entre modelos de chat, coding, reasoning y vision.
- Cómo elegir el tamaño correcto de modelo.
- Recomendaciones de cuantización.
- Consideraciones de hardware.
Introducción: Recomendaciones de modelos Ollama por caso de uso
La elección del modelo es una de las decisiones más importantes en Ollama. No todos los modelos sirven para todo. Algunos son versátiles y rápidos, otros especializados en coding, reasoning o vision. El hardware también determina qué tamaño de modelo y cuantización son viables. Conocer los modelos adecuados te ahorra tiempo y frustraciones.
Este artículo ofrece recomendaciones prácticas de modelos para los casos de uso más comunes.
Términos clave
- 7B, 13B, 70B: Tamaño del modelo en miles de millones de parámetros.
- Instruct: Modelo optimizado para seguir instrucciones.
- Chat: Modelo para diálogos.
- Coder: Modelo para tareas de programación.
- Vision: Modelo que procesa imágenes.
- Reasoning: Modelo para razonamiento lógico.
- Embedding: Modelo para representaciones vectoriales.
- Quant: Nivel de cuantización.
Chat general
| Modelo | Tamaño | Uso |
|---|---|---|
| llama3.1:8b | 8B | Rápido, buena calidad general |
| qwen2.5:7b | 7B | Rápido, bueno para español |
| mistral:7b | 7B | Ágil, compacto |
| llama3.1:70b | 70B | Mayor calidad, requiere mucho VRAM |
Para preguntas cotidianas, los modelos de 7B a 8B con cuantización Q4-K son suficientes.
Coding
| Modelo | Uso |
|---|---|
| qwen2.5-coder:14b | Autocompletado de código |
| codellama:7b | Tareas sencillas |
| deepseek-coder:6.7b | Rápido y competente |
| qwen2.5-coder:32b | Mejor calidad |
Para coding, num_predict debe ser lo suficientemente alto, ya que las respuestas son más largas.
Vision y análisis de imágenes
| Modelo | Uso |
|---|---|
| llava:13b | Descripción de imágenes |
| llava-llama3:8b | Balance entre tamaño y calidad |
| bakllava | Mejor comprensión de vision |
Los modelos de vision necesitan RAM/VRAM adicional.
Reasoning
| Modelo | Uso |
|---|---|
| qwen2.5:14b | Lógica y matemáticas |
| deepseek-r1 | Reasoning con justificaciones detalladas |
| phi4 | Modelo de reasoning más pequeño |
Los modelos de reasoning suelen dar respuestas más largas porque piensan paso a paso.
RAG
| Modelo | Uso |
|---|---|
| llama3.1:8b | RAG estándar |
| qwen2.5:7b | Buen aprovechamiento de contexto |
| mistral:7b | Rápido |
Para RAG, el modelo de embedding es igualmente importante.
Traducciones y resúmenes
| Modelo | Uso |
|---|---|
| qwen2.5:7b | Español/inglés, resúmenes |
| mixtral:8x7b | Tareas multilingües |
| gemma2:9b | Calidad con necesidades moderadas |
Modelos de embedding
Para RAG y búsqueda semántica:
nomic-embed-textmxbai-embed-largesnowflake-arctic-embed
Elegir tamaño de modelo
| VRAM | Tamaño de modelo |
|---|---|
| 8 GB | 7B Q4 |
| 12 GB | 13B Q4 |
| 24 GB | 13B Q5/Q6 o 70B Q4 con CPU offload |
| 48 GB+ | 70B Q4 o mayor |
Si un modelo no cabe en el VRAM, se ralentizará o fallará.
Elegir cuantización
| Prioridad | Recomendación |
|---|---|
| Velocidad máxima | Q4_0 |
| Buen balance | Q4_K_M |
| Mejor calidad | Q5_K_M |
| Máxima calidad | Q8_0 |
Recomendación para principiantes
Si empiezas con Ollama, comienza con llama3.1:8b o qwen2.5:7b. Ambos son rápidos, de buena calidad y funcionan con 8 GB de VRAM.
Orientación por hardware
- Mini-PC/Notebook: Modelos de 3B a 7B.
- PC de IA con 16-24 GB VRAM: 7B a 13B.
- Workstation con 48 GB+: Modelos de 70B posibles.
- Solo CPU: 3B a 7B con Q4.
Consejos
- Comienza con la Model Library en Ollama.com.
- Prueba varios modelos.
- Presta atención a la cuantización.
- Elige un modelo apropiado para cada caso de uso.
- Ejecuta benchmarks.
Enlaces e información adicional
- BotServ.de Benchmarks de modelos Ollama
- BotServ.de Longitud de contexto en Ollama
- BotServ.de Cuantización en la práctica
- BotServ.de Coding con Ollama
FAQ: Recomendaciones de modelos Ollama
¿Cuál es el mejor modelo general? Llama 3.1 8B o Qwen 2.5 7B son buenos todoterrenos.
¿Qué modelo para coding? Qwen 2.5 Coder o DeepSeek Coder.
¿Puedo analizar imágenes con Ollama? Sí, con modelos de vision como Llava.
¿Necesito modelos de 70B? Solo si necesitas máxima calidad y tienes suficiente VRAM.
¿Qué modelo para RAG? Un modelo chat de 7B sólido generalmente es suficiente.
Fuentes y lecturas complementarias
- Ollama Library: https://ollama.com/library
- Hugging Face: https://huggingface.co/
- LMSYS Chatbot Arena: https://chat.lmsys.org/
Resumen: Recomendaciones de modelos Ollama por caso de uso
La elección de modelo en Ollama depende del caso de uso, el hardware y la cuantización deseada. Llama 3.1 y Qwen 2.5 son buenos todoterrenos, Qwen Coder y DeepSeek Coder se adaptan bien a la programación, y Llava para vision. Para RAG y tareas sencillas, los modelos de 7B son suficientes. Si prestas atención a la cuantización y al VRAM, encontrarás rápidamente un modelo que funcione fluidamente y ofrezca buenos resultados.


