Skip to content
BotServBotServ
OllamaGGUFImportModelfileQuantisierung

GGUF-Modelle in Ollama importieren

Eigene GGUF-Modelle in Ollama nutzen. Modelfiles, Quantisierung, Parameter und Import-Schritte.

S

schutzgeist

2 min read
GGUF-Modelle in Ollama importieren

GGUF-Modelle in Ollama importieren

Was dieser Artikel über GGUF-Importe behandelt

  • Was das GGUF-Format ist.
  • Wie man ein GGUF-Modell in Ollama importiert.
  • Aufbau eines Ollama-Modelfiles.
  • Quantisierung und Parameter.
  • Typische Fehler und Lösungen.

Einleitung: GGUF-Modelle in Ollama importieren

Ollama arbeitet mit GGUF-Dateien. Wer eigene oder von Hugging Face heruntergeladene Modelle nutzen möchte, kann diese in das GGUF-Format konvertieren und in Ollama importieren. Der Import erfolgt über ein sogenanntes Modelfile, das auf die GGUF-Datei verweist und Parameter wie Temperatur, Kontextlänge und System-Prompt festlegt. Das eröffnet die Möglichkeit, Spezialmodelle, feingetunte Varianten oder aktuelle Quantisierungen lokal laufen zu lassen.

Dieser Artikel zeigt den kompletten Importprozess von GGUF nach Ollama.

Wichtige Begriffe

  • GGUF: GPT-Generated Unified Format, Binärformat für LLMs.
  • Modelfile: Ollama-Rezept für ein Modell.
  • FROM: Verweis auf GGUF-Datei oder bestehendes Modell.
  • PARAMETER: Laufzeitparameter wie Temperatur.
  • TEMPLATE: Prompt-Formatierung.
  • SYSTEM: System-Prompt.
  • Quantisierung: Reduktion der Modellpräzision.
  • Adapter: LoRA-Adapter für Feintuning.

Voraussetzungen

  • Ollama installiert.
  • GGUF-Datei vorhanden.
  • Genug Speicher und RAM/VRAM.

Quellen für GGUF-Modelle

  • Hugging Face TheBloke-Repository.
  • Einzelne Modell-Seiten mit GGUF-Dateien.
  • Eigene Konvertierung mit convert.py oder llama.cpp.

Ein einfaches Modelfile

FROM ./mein-modell.Q4_K_M.gguf

PARAMETER temperature 0.7
PARAMETER top_p 0.9
PARAMETER top_k 40
PARAMETER num_ctx 4096

SYSTEM "Hilfreicher Assistent"

Speichern als Modelfile im gleichen Verzeichnis wie die GGUF-Datei.

Modell erstellen

ollama create mein-modell -f Modelfile

Testen

ollama run mein-modell

Vorhandenes Ollama-Modell als Basis

Statt einer GGUF-Datei kann auch ein Ollama-Modell als Basis dienen:

FROM llama3.1

PARAMETER temperature 0.5
SYSTEM "Fachspezifischer Assistent"

Template anpassen

Das Template steuert, wie Prompt, System und Antwort zusammengesetzt werden:

TEMPLATE """{{ if .System }}<|start_header_id|>system<|end_header_id|>
{{ .System }}<|eot_id|>{{ end }}{{ if .Prompt }}<|start_header_id|>user<|end_header_id|>
{{ .Prompt }}<|eot_id|>{{ end }}<|start_header_id|>assistant<|end_header_id|>
{{ .Response }}<|eot_id|>"""

Dieses Beispiel ist an Llama 3 angelehnt.

LoRA-Adapter nutzen

FROM llama3.1
ADAPTER ./mein-lora.bin
PARAMETER temperature 0.7

Quantisierung wählen

QuantGrösseQualität
Q4_0kleinakzeptabel
Q4_K_Mkleingut
Q5_K_Mmittelsehr gut
Q6_Kgrösserhoch
Q8_0grosssehr hoch

Niedrigere Quantisierung bedeutet weniger VRAM-Verbrauch, aber schlechtere Qualität.

Parameter erklärt

  • temperature: Kreativität vs. Determinismus.
  • top_p: Nucleus-Sampling.
  • top_k: Begrenzung der Tokens-Top-K.
  • num_ctx: Kontextlänge.
  • num_predict: Maximale Antwortlänge.
  • seed: Reproduzierbarkeit.

Fehlerbehebung

  • Datei nicht gefunden: Pfad im Modelfile prüfen.
  • Ungültiges GGUF: Version prüfen, neu konvertieren.
  • Nicht genug RAM: Kleinere Quantisierung wählen.
  • Template falsch: Formatierung an Modell anpassen.
  • Parameter ignoriert: Modell neu erstellen.

Tipps

  • Modelfiles versionieren.
  • Pfad zur GGUF-Datei relativ angeben.
  • Speicherplatz vor dem Import prüfen.
  • Mit ollama show --modelfile existierende Modelle untersuchen.
  • Konsistentes Benennungsschema verwenden.

FAQ: GGUF-Import

Woher bekomme ich GGUF-Dateien? Hugging Face ist die gängigste Quelle.

Muss ich Ollama neu starten? Nein, ollama create reicht aus.

Kann ich mehrere Quantisierungen haben? Ja, pro Quantisierung ein eigenes Modell anlegen.

Was ist, wenn das Modell nicht startet? RAM/VRAM prüfen, Quantisierung reduzieren, Logs lesen.

Kann ich ChatML-Templates nutzen? Ja, das Template im Modelfile anpassen.

Quellen und weiterführende Literatur

Zusammenfassung: GGUF-Modelle in Ollama importieren

Der Import eigener GGUF-Modelle in Ollama eröffnet Zugang zu spezialisierten und aktuellen Modellen. Ein Modelfile definiert Basis, Parameter, Template und System-Prompt. Quantisierung, Speicherplatz und passende Templates sind die wichtigsten Erfolgsfaktoren. Wer Modelfiles versioniert und sorgfältig auf Fehler prüft, kann beliebige GGUF-Dateien in die lokale Ollama-Umgebung integrieren und so das Modellangebot erheblich erweitern.

Zurück zum KI Blog
Share:

Ähnliche Beiträge