Skip to content
BotServBotServ
OllamaGGUFImportModelfileCuantificación

Importar Modelos GGUF en Ollama

Usa tus propios modelos GGUF en Ollama. Modelfiles, cuantificación, parámetros e importación.

S

schutzgeist

3 min read
Importar Modelos GGUF en Ollama

Importar modelos GGUF en Ollama

Qué cubre este artículo sobre importación de GGUF

  • Qué es el formato GGUF.
  • Cómo importar un modelo GGUF en Ollama.
  • Estructura de un Modelfile de Ollama.
  • Cuantización y parámetros.
  • Errores comunes y soluciones.

Introducción: importar modelos GGUF en Ollama

Ollama trabaja con archivos GGUF. Si deseas utilizar tus propios modelos o descargarlos desde Hugging Face, puedes convertirlos al formato GGUF e importarlos en Ollama. La importación se realiza a través de un Modelfile, que referencia el archivo GGUF y define parámetros como temperatura, longitud de contexto y prompt del sistema. Esto abre la posibilidad de ejecutar modelos especializados, variantes finetuneadas o cuantizaciones recientes localmente.

Este artículo te muestra el proceso completo de importación de GGUF a Ollama.

Conceptos clave

  • GGUF: GPT-Generated Unified Format, formato binario para LLMs.
  • Modelfile: Receta de Ollama para un modelo.
  • FROM: Referencia a archivo GGUF o modelo existente.
  • PARAMETER: Parámetros de ejecución como temperatura.
  • TEMPLATE: Formato del prompt.
  • SYSTEM: Prompt del sistema.
  • Cuantización: Reducción de la precisión del modelo.
  • Adapter: Adaptadores LoRA para finetuning.

Requisitos previos

  • Ollama instalado.
  • Archivo GGUF disponible.
  • Suficiente almacenamiento y RAM/VRAM.

Fuentes de modelos GGUF

  • Repositorio TheBloke en Hugging Face.
  • Páginas individuales de modelos con archivos GGUF.
  • Conversión propia con convert.py o llama.cpp.

Un Modelfile simple

FROM ./mein-modell.Q4_K_M.gguf

PARAMETER temperature 0.7
PARAMETER top_p 0.9
PARAMETER top_k 40
PARAMETER num_ctx 4096

SYSTEM "Hilfreicher Assistent"

Guárdalo como Modelfile en el mismo directorio que el archivo GGUF.

Crear el modelo

ollama create mein-modell -f Modelfile

Probar

ollama run mein-modell

Usar un modelo Ollama existente como base

En lugar de un archivo GGUF, también puedes utilizar un modelo Ollama como base:

FROM llama3.1

PARAMETER temperature 0.5
SYSTEM "Fachspezifischer Assistent"

Personalizar el template

El template controla cómo se ensamblan el prompt, el sistema y la respuesta:

TEMPLATE """{{ if .System }}<|start_header_id|>system<|end_header_id|>
{{ .System }}<|eot_id|>{{ end }}{{ if .Prompt }}<|start_header_id|>user<|end_header_id|>
{{ .Prompt }}<|eot_id|>{{ end }}<|start_header_id|>assistant<|end_header_id|>
{{ .Response }}<|eot_id|>"""

Este ejemplo sigue el patrón de Llama 3.

Usar adaptadores LoRA

FROM llama3.1
ADAPTER ./mein-lora.bin
PARAMETER temperature 0.7

Elegir la cuantización

CuantTamañoCalidad
Q4_0pequeñoaceptable
Q4_K_Mpequeñobuena
Q5_K_Mmediomuy buena
Q6_Kmayoralta
Q8_0grandemuy alta

Una cuantización menor significa menos consumo de VRAM, pero menor calidad.

Parámetros explicados

  • temperature: Creatividad frente a determinismo.
  • top_p: Nucleus sampling.
  • top_k: Limitación de tokens top-K.
  • num_ctx: Longitud de contexto.
  • num_predict: Longitud máxima de respuesta.
  • seed: Reproducibilidad.

Resolución de problemas

  • Archivo no encontrado: Verifica la ruta en el Modelfile.
  • GGUF inválido: Comprueba la versión y reconvierte si es necesario.
  • RAM insuficiente: Elige una cuantización más pequeña.
  • Template incorrecto: Adapta el formato al modelo.
  • Parámetro ignorado: Recrea el modelo.

Consejos prácticos

  • Versiona tus Modelfiles.
  • Usa rutas relativas para el archivo GGUF.
  • Verifica el espacio en disco antes de importar.
  • Examina modelos existentes con ollama show --modelfile.
  • Aplica un esquema de nomenclatura consistente.

Enlaces y referencias adicionales

Preguntas frecuentes: importación de GGUF

¿Dónde obtengo archivos GGUF? Hugging Face es la fuente más común.

¿Necesito reiniciar Ollama? No, ollama create es suficiente.

¿Puedo tener varias cuantizaciones? Sí, crea un modelo separado para cada cuantización.

¿Qué hago si el modelo no inicia? Verifica RAM/VRAM, reduce la cuantización y consulta los logs.

¿Puedo usar templates ChatML? Sí, personaliza el template en el Modelfile.

Fuentes y referencias adicionales

Resumen: importar modelos GGUF en Ollama

Importar tus propios modelos GGUF en Ollama abre acceso a modelos especializados y actuales. Un Modelfile define la base, parámetros, template y prompt del sistema. La cuantización, el espacio en disco y templates apropiados son los factores clave para el éxito. Si versionas tus Modelfiles y revisas cuidadosamente los errores, puedes integrar cualquier archivo GGUF en tu entorno local Ollama y expandir significativamente tu catálogo de modelos.

Volver al blog
Share:

Entradas relacionadas