Skip to content
BotServBotServ
OllamaModelosRecomendacionesChatCoding

Recomendaciones de Modelos Ollama por Caso de Uso

Elige modelos Ollama para Chat, Coding, Vision, RAG y Reasoning. Comparación y consejos prácticos.

S

schutzgeist

3 min read
Recomendaciones de Modelos Ollama por Caso de Uso

Recomendaciones de modelos Ollama por caso de uso

Qué cubre este artículo sobre recomendaciones de modelos

  • Modelos recomendados para casos de uso típicos.
  • Diferencias entre modelos de chat, coding, reasoning y vision.
  • Cómo elegir el tamaño correcto de modelo.
  • Recomendaciones de cuantización.
  • Consideraciones de hardware.

Introducción: Recomendaciones de modelos Ollama por caso de uso

La elección del modelo es una de las decisiones más importantes en Ollama. No todos los modelos sirven para todo. Algunos son versátiles y rápidos, otros especializados en coding, reasoning o vision. El hardware también determina qué tamaño de modelo y cuantización son viables. Conocer los modelos adecuados te ahorra tiempo y frustraciones.

Este artículo ofrece recomendaciones prácticas de modelos para los casos de uso más comunes.

Términos clave

  • 7B, 13B, 70B: Tamaño del modelo en miles de millones de parámetros.
  • Instruct: Modelo optimizado para seguir instrucciones.
  • Chat: Modelo para diálogos.
  • Coder: Modelo para tareas de programación.
  • Vision: Modelo que procesa imágenes.
  • Reasoning: Modelo para razonamiento lógico.
  • Embedding: Modelo para representaciones vectoriales.
  • Quant: Nivel de cuantización.

Chat general

ModeloTamañoUso
llama3.1:8b8BRápido, buena calidad general
qwen2.5:7b7BRápido, bueno para español
mistral:7b7BÁgil, compacto
llama3.1:70b70BMayor calidad, requiere mucho VRAM

Para preguntas cotidianas, los modelos de 7B a 8B con cuantización Q4-K son suficientes.

Coding

ModeloUso
qwen2.5-coder:14bAutocompletado de código
codellama:7bTareas sencillas
deepseek-coder:6.7bRápido y competente
qwen2.5-coder:32bMejor calidad

Para coding, num_predict debe ser lo suficientemente alto, ya que las respuestas son más largas.

Vision y análisis de imágenes

ModeloUso
llava:13bDescripción de imágenes
llava-llama3:8bBalance entre tamaño y calidad
bakllavaMejor comprensión de vision

Los modelos de vision necesitan RAM/VRAM adicional.

Reasoning

ModeloUso
qwen2.5:14bLógica y matemáticas
deepseek-r1Reasoning con justificaciones detalladas
phi4Modelo de reasoning más pequeño

Los modelos de reasoning suelen dar respuestas más largas porque piensan paso a paso.

RAG

ModeloUso
llama3.1:8bRAG estándar
qwen2.5:7bBuen aprovechamiento de contexto
mistral:7bRápido

Para RAG, el modelo de embedding es igualmente importante.

Traducciones y resúmenes

ModeloUso
qwen2.5:7bEspañol/inglés, resúmenes
mixtral:8x7bTareas multilingües
gemma2:9bCalidad con necesidades moderadas

Modelos de embedding

Para RAG y búsqueda semántica:

  • nomic-embed-text
  • mxbai-embed-large
  • snowflake-arctic-embed

Elegir tamaño de modelo

VRAMTamaño de modelo
8 GB7B Q4
12 GB13B Q4
24 GB13B Q5/Q6 o 70B Q4 con CPU offload
48 GB+70B Q4 o mayor

Si un modelo no cabe en el VRAM, se ralentizará o fallará.

Elegir cuantización

PrioridadRecomendación
Velocidad máximaQ4_0
Buen balanceQ4_K_M
Mejor calidadQ5_K_M
Máxima calidadQ8_0

Recomendación para principiantes

Si empiezas con Ollama, comienza con llama3.1:8b o qwen2.5:7b. Ambos son rápidos, de buena calidad y funcionan con 8 GB de VRAM.

Orientación por hardware

  • Mini-PC/Notebook: Modelos de 3B a 7B.
  • PC de IA con 16-24 GB VRAM: 7B a 13B.
  • Workstation con 48 GB+: Modelos de 70B posibles.
  • Solo CPU: 3B a 7B con Q4.

Consejos

  • Comienza con la Model Library en Ollama.com.
  • Prueba varios modelos.
  • Presta atención a la cuantización.
  • Elige un modelo apropiado para cada caso de uso.
  • Ejecuta benchmarks.

Enlaces e información adicional

FAQ: Recomendaciones de modelos Ollama

¿Cuál es el mejor modelo general? Llama 3.1 8B o Qwen 2.5 7B son buenos todoterrenos.

¿Qué modelo para coding? Qwen 2.5 Coder o DeepSeek Coder.

¿Puedo analizar imágenes con Ollama? Sí, con modelos de vision como Llava.

¿Necesito modelos de 70B? Solo si necesitas máxima calidad y tienes suficiente VRAM.

¿Qué modelo para RAG? Un modelo chat de 7B sólido generalmente es suficiente.

Fuentes y lecturas complementarias

Resumen: Recomendaciones de modelos Ollama por caso de uso

La elección de modelo en Ollama depende del caso de uso, el hardware y la cuantización deseada. Llama 3.1 y Qwen 2.5 son buenos todoterrenos, Qwen Coder y DeepSeek Coder se adaptan bien a la programación, y Llava para vision. Para RAG y tareas sencillas, los modelos de 7B son suficientes. Si prestas atención a la cuantización y al VRAM, encontrarás rápidamente un modelo que funcione fluidamente y ofrezca buenos resultados.

Volver al blog
Share:

Entradas relacionadas