Comparativa de Modelos Ollama
Qué cubre este artículo
- Criterios relevantes para una comparativa.
- Cómo evaluar aspectos rápidos y lentos.
- Métodos de benchmark.
- Procedimientos prácticos de comparación.
- Consejos para resultados significativos.
Introducción: Comparativa de Modelos Ollama
La biblioteca de Ollama crece constantemente. Los modelos varían en tamaño, velocidad, capacidades y requisitos de hardware. Quien busca el modelo adecuado para un caso de uso no debe confiar únicamente en valores de benchmark, sino realizar pruebas propias. Una comparativa sistemática ayuda a encontrar el mejor modelo para tu hardware y caso de uso específico.
Este artículo muestra cómo comparar modelos de Ollama.
Terminología clave
- Benchmark: Prueba estandarizada.
- Latency: Tiempo hasta la primera respuesta.
- Throughput: Tokens por segundo.
- Accuracy: Corrección de las respuestas.
- Hallucination: Información inventada.
- Quant: Variante de cuantización.
- Task-Specific: Tarea especializada.
- Gold-Standard: Respuesta de referencia.
Criterios de comparación
| Criterio | Significado |
|---|---|
| Velocidad | Tokens por segundo, tiempo de inicio |
| Calidad | Corrección, completitud |
| Requisito VRAM | Necesidades de memoria |
| Contexto | Longitud máxima de tokens |
| Idioma | Alemán, inglés, multilingüe |
| Especialización | Codificación, chat, visión, razonamiento |
| Licencia | Uso comercial |
Procedimiento
- Define el caso de uso.
- Selecciona candidatos.
- Crea tareas de prueba.
- Evalúa cada candidato de forma consistente.
- Mide velocidad.
- Evalúa calidad.
- Documenta requisitos de VRAM y RAM.
- Elige el mejor equilibrio.
Medir velocidad
ollama run llama3.1:8b --verbose
O con un script:
import time, requests
for model in ["llama3.1:8b", "qwen2.5:7b"]:
start = time.time()
response = requests.post("http://localhost:11434/api/generate", json={
"model": model,
"prompt": "Erkläre Docker.",
"stream": False
})
duration = time.time() - start
eval_count = response.json().get("eval_count", 0)
print(f"{model}: {eval_count/duration:.2f} tokens/s")
Probar calidad
Preguntas preparadas con respuestas conocidas:
- Resumen.
- Traducción.
- Cálculo.
- Consulta de hechos.
- Tarea de codificación.
- Acertijo lógico.
Cada respuesta se verifica contra un estándar de referencia o evaluación manual.
Mantener el prompt idéntico
ollama run llama3.1:8b "Fasse Docker in drei Sätzen zusammen."
ollama run qwen2.5:7b "Fasse Docker in drei Sätzen zusammen."
Normalización de parámetros
Usa los mismos valores de temperature, num_predict y num_ctx para todos los candidatos:
{
"options": {
"temperature": 0.1,
"num_predict": 200,
"num_ctx": 4096
}
}
Consejos
- Ejecuta múltiples rondas por modelo.
- Mantén los prompts idénticos.
- Evalúa modelos según el caso de uso.
- Presta atención a las alucinaciones.
- Documenta la cuantización por modelo.
- No sobrevalores una respuesta individual.
- Evita sesgos.
Herramientas
- Comandos de ollama.
- curl y jq.
- Scripts en Python.
- Calculadora de VRAM.
- MTEB para embeddings.
- LMSYS Chatbot Arena como referencia.
Enlaces y recursos adicionales
- BotServ.de Benchmarks de Modelos Ollama
- BotServ.de Recomendaciones de Modelos Ollama
- BotServ.de Galería de Modelos Ollama
- BotServ.de Tools Buscador de Modelos
FAQ: Comparativa de Modelos Ollama
¿Cuántos modelos debo probar? Generalmente bastam 2-5 candidatos adecuados.
¿Cuál es el mejor modelo objetivamente? No existe uno. Depende de tu aplicación y hardware.
¿Necesito benchmarks? Sí, aunque las tareas propias suelen ser más reveladoras.
¿Cómo comparo velocidad? Mide tokens por segundo con el mismo prompt.
¿Debo probar diferentes cuantizaciones? Sí, Q4 versus Q5 puede traer grandes diferencias en calidad y velocidad.
Fuentes y lecturas adicionales
- LMSYS Arena: https://chat.lmsys.org/
- MTEB: https://huggingface.co/spaces/mteb/leaderboard
- Ollama Library: https://ollama.com/library
Resumen: Comparativa de Modelos Ollama
Una buena comparativa de modelos considera velocidad, calidad, requisitos de VRAM, longitud de contexto y especialización. Prompts y parámetros idénticos son esenciales. Los benchmarks ayudan, pero pruebas sobre tus propias tareas ofrecen resultados más realistas. Si compruebas 2-5 candidatos adecuados en tus aplicaciones específicas, encontrarás el mejor equilibrio para tu hardware y proyecto.


