Importar modelos GGUF en Ollama
Qué cubre este artículo sobre importación de GGUF
- Qué es el formato GGUF.
- Cómo importar un modelo GGUF en Ollama.
- Estructura de un Modelfile de Ollama.
- Cuantización y parámetros.
- Errores comunes y soluciones.
Introducción: importar modelos GGUF en Ollama
Ollama trabaja con archivos GGUF. Si deseas utilizar tus propios modelos o descargarlos desde Hugging Face, puedes convertirlos al formato GGUF e importarlos en Ollama. La importación se realiza a través de un Modelfile, que referencia el archivo GGUF y define parámetros como temperatura, longitud de contexto y prompt del sistema. Esto abre la posibilidad de ejecutar modelos especializados, variantes finetuneadas o cuantizaciones recientes localmente.
Este artículo te muestra el proceso completo de importación de GGUF a Ollama.
Conceptos clave
- GGUF: GPT-Generated Unified Format, formato binario para LLMs.
- Modelfile: Receta de Ollama para un modelo.
- FROM: Referencia a archivo GGUF o modelo existente.
- PARAMETER: Parámetros de ejecución como temperatura.
- TEMPLATE: Formato del prompt.
- SYSTEM: Prompt del sistema.
- Cuantización: Reducción de la precisión del modelo.
- Adapter: Adaptadores LoRA para finetuning.
Requisitos previos
- Ollama instalado.
- Archivo GGUF disponible.
- Suficiente almacenamiento y RAM/VRAM.
Fuentes de modelos GGUF
- Repositorio TheBloke en Hugging Face.
- Páginas individuales de modelos con archivos GGUF.
- Conversión propia con
convert.pyollama.cpp.
Un Modelfile simple
FROM ./mein-modell.Q4_K_M.gguf
PARAMETER temperature 0.7
PARAMETER top_p 0.9
PARAMETER top_k 40
PARAMETER num_ctx 4096
SYSTEM "Hilfreicher Assistent"
Guárdalo como Modelfile en el mismo directorio que el archivo GGUF.
Crear el modelo
ollama create mein-modell -f Modelfile
Probar
ollama run mein-modell
Usar un modelo Ollama existente como base
En lugar de un archivo GGUF, también puedes utilizar un modelo Ollama como base:
FROM llama3.1
PARAMETER temperature 0.5
SYSTEM "Fachspezifischer Assistent"
Personalizar el template
El template controla cómo se ensamblan el prompt, el sistema y la respuesta:
TEMPLATE """{{ if .System }}<|start_header_id|>system<|end_header_id|>
{{ .System }}<|eot_id|>{{ end }}{{ if .Prompt }}<|start_header_id|>user<|end_header_id|>
{{ .Prompt }}<|eot_id|>{{ end }}<|start_header_id|>assistant<|end_header_id|>
{{ .Response }}<|eot_id|>"""
Este ejemplo sigue el patrón de Llama 3.
Usar adaptadores LoRA
FROM llama3.1
ADAPTER ./mein-lora.bin
PARAMETER temperature 0.7
Elegir la cuantización
| Cuant | Tamaño | Calidad |
|---|---|---|
| Q4_0 | pequeño | aceptable |
| Q4_K_M | pequeño | buena |
| Q5_K_M | medio | muy buena |
| Q6_K | mayor | alta |
| Q8_0 | grande | muy alta |
Una cuantización menor significa menos consumo de VRAM, pero menor calidad.
Parámetros explicados
temperature: Creatividad frente a determinismo.top_p: Nucleus sampling.top_k: Limitación de tokens top-K.num_ctx: Longitud de contexto.num_predict: Longitud máxima de respuesta.seed: Reproducibilidad.
Resolución de problemas
- Archivo no encontrado: Verifica la ruta en el Modelfile.
- GGUF inválido: Comprueba la versión y reconvierte si es necesario.
- RAM insuficiente: Elige una cuantización más pequeña.
- Template incorrecto: Adapta el formato al modelo.
- Parámetro ignorado: Recrea el modelo.
Consejos prácticos
- Versiona tus Modelfiles.
- Usa rutas relativas para el archivo GGUF.
- Verifica el espacio en disco antes de importar.
- Examina modelos existentes con
ollama show --modelfile. - Aplica un esquema de nomenclatura consistente.
Enlaces y referencias adicionales
- BotServ.de Ollama Modelfiles
- BotServ.de Ollama Cuantización en práctica
- BotServ.de Ollama Finetuning
- BotServ.de Comandos Ollama
Preguntas frecuentes: importación de GGUF
¿Dónde obtengo archivos GGUF? Hugging Face es la fuente más común.
¿Necesito reiniciar Ollama?
No, ollama create es suficiente.
¿Puedo tener varias cuantizaciones? Sí, crea un modelo separado para cada cuantización.
¿Qué hago si el modelo no inicia? Verifica RAM/VRAM, reduce la cuantización y consulta los logs.
¿Puedo usar templates ChatML? Sí, personaliza el template en el Modelfile.
Fuentes y referencias adicionales
- Ollama Modelfile: https://github.com/ollama/ollama/blob/main/docs/modelfile.md
- GGUF: https://github.com/ggerganov/ggml/blob/master/docs/gguf.md
- Hugging Face: https://huggingface.co/
Resumen: importar modelos GGUF en Ollama
Importar tus propios modelos GGUF en Ollama abre acceso a modelos especializados y actuales. Un Modelfile define la base, parámetros, template y prompt del sistema. La cuantización, el espacio en disco y templates apropiados son los factores clave para el éxito. Si versionas tus Modelfiles y revisas cuidadosamente los errores, puedes integrar cualquier archivo GGUF en tu entorno local Ollama y expandir significativamente tu catálogo de modelos.


