Skip to content
BotServBotServ
OllamaModelosComparativaBenchmarkTest

Comparativa de Modelos Ollama

Comparar modelos Ollama sistemáticamente. Criterios, benchmarks, tareas y métodos de prueba prácticos.

S

schutzgeist

2 min read
Comparativa de Modelos Ollama

Comparativa de Modelos Ollama

Qué cubre este artículo

  • Criterios relevantes para una comparativa.
  • Cómo evaluar aspectos rápidos y lentos.
  • Métodos de benchmark.
  • Procedimientos prácticos de comparación.
  • Consejos para resultados significativos.

Introducción: Comparativa de Modelos Ollama

La biblioteca de Ollama crece constantemente. Los modelos varían en tamaño, velocidad, capacidades y requisitos de hardware. Quien busca el modelo adecuado para un caso de uso no debe confiar únicamente en valores de benchmark, sino realizar pruebas propias. Una comparativa sistemática ayuda a encontrar el mejor modelo para tu hardware y caso de uso específico.

Este artículo muestra cómo comparar modelos de Ollama.

Terminología clave

  • Benchmark: Prueba estandarizada.
  • Latency: Tiempo hasta la primera respuesta.
  • Throughput: Tokens por segundo.
  • Accuracy: Corrección de las respuestas.
  • Hallucination: Información inventada.
  • Quant: Variante de cuantización.
  • Task-Specific: Tarea especializada.
  • Gold-Standard: Respuesta de referencia.

Criterios de comparación

CriterioSignificado
VelocidadTokens por segundo, tiempo de inicio
CalidadCorrección, completitud
Requisito VRAMNecesidades de memoria
ContextoLongitud máxima de tokens
IdiomaAlemán, inglés, multilingüe
EspecializaciónCodificación, chat, visión, razonamiento
LicenciaUso comercial

Procedimiento

  1. Define el caso de uso.
  2. Selecciona candidatos.
  3. Crea tareas de prueba.
  4. Evalúa cada candidato de forma consistente.
  5. Mide velocidad.
  6. Evalúa calidad.
  7. Documenta requisitos de VRAM y RAM.
  8. Elige el mejor equilibrio.

Medir velocidad

ollama run llama3.1:8b --verbose

O con un script:

import time, requests

for model in ["llama3.1:8b", "qwen2.5:7b"]:
    start = time.time()
    response = requests.post("http://localhost:11434/api/generate", json={
        "model": model,
        "prompt": "Erkläre Docker.",
        "stream": False
    })
    duration = time.time() - start
    eval_count = response.json().get("eval_count", 0)
    print(f"{model}: {eval_count/duration:.2f} tokens/s")

Probar calidad

Preguntas preparadas con respuestas conocidas:

  • Resumen.
  • Traducción.
  • Cálculo.
  • Consulta de hechos.
  • Tarea de codificación.
  • Acertijo lógico.

Cada respuesta se verifica contra un estándar de referencia o evaluación manual.

Mantener el prompt idéntico

ollama run llama3.1:8b "Fasse Docker in drei Sätzen zusammen."
ollama run qwen2.5:7b "Fasse Docker in drei Sätzen zusammen."

Normalización de parámetros

Usa los mismos valores de temperature, num_predict y num_ctx para todos los candidatos:

{
  "options": {
    "temperature": 0.1,
    "num_predict": 200,
    "num_ctx": 4096
  }
}

Consejos

  • Ejecuta múltiples rondas por modelo.
  • Mantén los prompts idénticos.
  • Evalúa modelos según el caso de uso.
  • Presta atención a las alucinaciones.
  • Documenta la cuantización por modelo.
  • No sobrevalores una respuesta individual.
  • Evita sesgos.

Herramientas

  • Comandos de ollama.
  • curl y jq.
  • Scripts en Python.
  • Calculadora de VRAM.
  • MTEB para embeddings.
  • LMSYS Chatbot Arena como referencia.

Enlaces y recursos adicionales

FAQ: Comparativa de Modelos Ollama

¿Cuántos modelos debo probar? Generalmente bastam 2-5 candidatos adecuados.

¿Cuál es el mejor modelo objetivamente? No existe uno. Depende de tu aplicación y hardware.

¿Necesito benchmarks? Sí, aunque las tareas propias suelen ser más reveladoras.

¿Cómo comparo velocidad? Mide tokens por segundo con el mismo prompt.

¿Debo probar diferentes cuantizaciones? Sí, Q4 versus Q5 puede traer grandes diferencias en calidad y velocidad.

Fuentes y lecturas adicionales

Resumen: Comparativa de Modelos Ollama

Una buena comparativa de modelos considera velocidad, calidad, requisitos de VRAM, longitud de contexto y especialización. Prompts y parámetros idénticos son esenciales. Los benchmarks ayudan, pero pruebas sobre tus propias tareas ofrecen resultados más realistas. Si compruebas 2-5 candidatos adecuados en tus aplicaciones específicas, encontrarás el mejor equilibrio para tu hardware y proyecto.

Volver al blog
Share:

Entradas relacionadas