GGUF-Modelle in Ollama importieren
Was dieser Artikel über GGUF-Importe behandelt
- Was das GGUF-Format ist.
- Wie man ein GGUF-Modell in Ollama importiert.
- Aufbau eines Ollama-Modelfiles.
- Quantisierung und Parameter.
- Typische Fehler und Lösungen.
Einleitung: GGUF-Modelle in Ollama importieren
Ollama arbeitet mit GGUF-Dateien. Wer eigene oder von Hugging Face heruntergeladene Modelle nutzen möchte, kann diese in das GGUF-Format konvertieren und in Ollama importieren. Der Import erfolgt über ein sogenanntes Modelfile, das auf die GGUF-Datei verweist und Parameter wie Temperatur, Kontextlänge und System-Prompt festlegt. Das eröffnet die Möglichkeit, Spezialmodelle, feingetunte Varianten oder aktuelle Quantisierungen lokal laufen zu lassen.
Dieser Artikel zeigt den kompletten Importprozess von GGUF nach Ollama.
Wichtige Begriffe
- GGUF: GPT-Generated Unified Format, Binärformat für LLMs.
- Modelfile: Ollama-Rezept für ein Modell.
- FROM: Verweis auf GGUF-Datei oder bestehendes Modell.
- PARAMETER: Laufzeitparameter wie Temperatur.
- TEMPLATE: Prompt-Formatierung.
- SYSTEM: System-Prompt.
- Quantisierung: Reduktion der Modellpräzision.
- Adapter: LoRA-Adapter für Feintuning.
Voraussetzungen
- Ollama installiert.
- GGUF-Datei vorhanden.
- Genug Speicher und RAM/VRAM.
Quellen für GGUF-Modelle
- Hugging Face TheBloke-Repository.
- Einzelne Modell-Seiten mit GGUF-Dateien.
- Eigene Konvertierung mit
convert.pyoderllama.cpp.
Ein einfaches Modelfile
FROM ./mein-modell.Q4_K_M.gguf
PARAMETER temperature 0.7
PARAMETER top_p 0.9
PARAMETER top_k 40
PARAMETER num_ctx 4096
SYSTEM "Hilfreicher Assistent"
Speichern als Modelfile im gleichen Verzeichnis wie die GGUF-Datei.
Modell erstellen
ollama create mein-modell -f Modelfile
Testen
ollama run mein-modell
Vorhandenes Ollama-Modell als Basis
Statt einer GGUF-Datei kann auch ein Ollama-Modell als Basis dienen:
FROM llama3.1
PARAMETER temperature 0.5
SYSTEM "Fachspezifischer Assistent"
Template anpassen
Das Template steuert, wie Prompt, System und Antwort zusammengesetzt werden:
TEMPLATE """{{ if .System }}<|start_header_id|>system<|end_header_id|>
{{ .System }}<|eot_id|>{{ end }}{{ if .Prompt }}<|start_header_id|>user<|end_header_id|>
{{ .Prompt }}<|eot_id|>{{ end }}<|start_header_id|>assistant<|end_header_id|>
{{ .Response }}<|eot_id|>"""
Dieses Beispiel ist an Llama 3 angelehnt.
LoRA-Adapter nutzen
FROM llama3.1
ADAPTER ./mein-lora.bin
PARAMETER temperature 0.7
Quantisierung wählen
| Quant | Grösse | Qualität |
|---|---|---|
| Q4_0 | klein | akzeptabel |
| Q4_K_M | klein | gut |
| Q5_K_M | mittel | sehr gut |
| Q6_K | grösser | hoch |
| Q8_0 | gross | sehr hoch |
Niedrigere Quantisierung bedeutet weniger VRAM-Verbrauch, aber schlechtere Qualität.
Parameter erklärt
temperature: Kreativität vs. Determinismus.top_p: Nucleus-Sampling.top_k: Begrenzung der Tokens-Top-K.num_ctx: Kontextlänge.num_predict: Maximale Antwortlänge.seed: Reproduzierbarkeit.
Fehlerbehebung
- Datei nicht gefunden: Pfad im Modelfile prüfen.
- Ungültiges GGUF: Version prüfen, neu konvertieren.
- Nicht genug RAM: Kleinere Quantisierung wählen.
- Template falsch: Formatierung an Modell anpassen.
- Parameter ignoriert: Modell neu erstellen.
Tipps
- Modelfiles versionieren.
- Pfad zur GGUF-Datei relativ angeben.
- Speicherplatz vor dem Import prüfen.
- Mit
ollama show --modelfileexistierende Modelle untersuchen. - Konsistentes Benennungsschema verwenden.
Weiterführende Links und Infos
- BotServ.de Ollama Modelfiles
- BotServ.de Ollama Quantisierung Praxis
- BotServ.de Ollama Feintuning
- BotServ.de Ollama Befehle
FAQ: GGUF-Import
Woher bekomme ich GGUF-Dateien? Hugging Face ist die gängigste Quelle.
Muss ich Ollama neu starten?
Nein, ollama create reicht aus.
Kann ich mehrere Quantisierungen haben? Ja, pro Quantisierung ein eigenes Modell anlegen.
Was ist, wenn das Modell nicht startet? RAM/VRAM prüfen, Quantisierung reduzieren, Logs lesen.
Kann ich ChatML-Templates nutzen? Ja, das Template im Modelfile anpassen.
Quellen und weiterführende Literatur
- Ollama Modelfile: https://github.com/ollama/ollama/blob/main/docs/modelfile.md
- GGUF: https://github.com/ggerganov/ggml/blob/master/docs/gguf.md
- Hugging Face: https://huggingface.co/
Zusammenfassung: GGUF-Modelle in Ollama importieren
Der Import eigener GGUF-Modelle in Ollama eröffnet Zugang zu spezialisierten und aktuellen Modellen. Ein Modelfile definiert Basis, Parameter, Template und System-Prompt. Quantisierung, Speicherplatz und passende Templates sind die wichtigsten Erfolgsfaktoren. Wer Modelfiles versioniert und sorgfältig auf Fehler prüft, kann beliebige GGUF-Dateien in die lokale Ollama-Umgebung integrieren und so das Modellangebot erheblich erweitern.


