Modell-Finder für lokale KI
Was dieser Artikel über den Modell-Finder behandelt
- Wie man das passende lokale Modell findet.
- Welche Kriterien bei der Auswahl wichtig sind.
- Welche Kategorien es gibt: Text, Coding, Vision, Audio und mehr.
- Wie man Modelle nach Hardware, Lizenz und Aufgabe filtert.
- Bekannte Listen und Tools zur Modellsuche.
Einleitung: Modell-Finder für lokale KI
Die Zahl quelloffener KI-Modelle wächst täglich. Für Einsteiger ist es schwierig, das richtige Modell für einen Anwendungsfall zu finden. Ein Modell-Finder hilft dabei, Modelle nach Aufgabe, Hardware, Lizenz und Sprache zu filtern. Man spart Zeit und vermeidet, Modelle herunterzuladen, die auf dem eigenen Rechner gar nicht laufen.
Dieser Artikel zeigt, worauf man bei der Modellauswahl achten sollte und welche Tools und Listen es gibt.
Wichtige Begriffe
- Parametergrösse: Anzahl der Modellgewichte, zum Beispiel 7B oder 70B.
- Quantisierung: Reduktion der Bitanzahl, um Modelle kleiner zu machen.
- Kontextlänge: Maximale Anzahl an Tokens, die das Modell verarbeiten kann.
- Tool-Calling: Fähigkeit, strukturierte Funktionsaufrufe zu erzeugen.
- Lizenz: Erlaubte Nutzung, zum Beispiel Apache 2.0 oder Llama 3 Community License.
- VRAM: Videospeicher der GPU.
- MoE: Mixture-of-Experts, speichereffiziente Architektur.
Kriterien für die Modellauswahl
1. Anwendungsfall
Überlege zuerst, wofür das Modell genutzt wird:
- Allgemeine Konversation
- Coding
- Mathematik und Reasoning
- Vision und Bildanalyse
- Audio und Sprache
- Einbettungen und Reranking
2. Hardware
Prüfe RAM und VRAM:
- 7B-Modelle in 4 Bit: ca. 4 bis 6 GB.
- 13B-Modelle in 4 Bit: ca. 8 bis 10 GB.
- 70B-Modelle in 4 Bit: 40 GB und mehr.
- MoE-Modelle brauchen mehr Speicher als dichte Modelle gleicher Grösse.
3. Sprache
- Deutsche Modelle oder mehrsprachige Modelle
- Englisch für Coding und Fachliteratur
- Spezialmodelle für bestimmte Sprachen
4. Lizenz
- Apache 2.0: sehr freizügig.
- MIT: ebenfalls offen.
- Llama 3 Community License: kommerziell nutzbar mit Einschränkungen.
- Kommerzielle Nutzung prüfen.
5. Kontextlänge
Für lange Dokumente oder Coding-Projekte braucht man lange Kontextfenster. 8K reichen für Chat, 32K bis 128K für Dokumentenanalyse.
Modellkategorien
Textmodelle
Allrounder für Konversation, Zusammenfassung und Textgenerierung. Beispiele: Llama 3.1, Qwen 2.5, Mistral 7B, Gemma.
Coding-Modelle
Optimiert für Code-Generierung und Fehlersuche. Beispiele: Qwen 2.5 Coder, CodeLlama, Codestral, DeepSeek-Coder.
Reasoning-Modelle
Für mathematische und logische Aufgaben. Beispiele: DeepSeek-R1, Mathstral, Qwen QWQ.
Visionmodelle
Verstehen Bilder und kombinieren sie mit Text. Beispiele: LLaVA, Qwen-VL, BakLLaVA.
Speech-to-Text und Text-to-Speech
Wandeln Sprache in Text und umgekehrt. Beispiele: Whisper, faster-whisper, Piper, MeloTTS.
Embedding- und Reranking-Modelle
Für RAG und semantische Suche. Beispiele: BGE, nomic-embed-text, BAAI.
Bekannte Modell-Finder und Listen
- Ollama Library: https://ollama.com/library
- Hugging Face: https://huggingface.co/models
- LMSYS Arena: Benchmarks und Ranglisten.
- Artificial Analysis: Vergleich von Modellen.
- LocalLLaMA Subreddit: Community-Empfehlungen.
- TheBloke auf Hugging Face: Quantisierungen in GGUF.
Entscheidungsbaum
1. Anwendungsfall wählen
2. Passende Kategorie finden
3. Hardware prüfen (RAM/VRAM)
4. Benötigte Kontextlänge ermitteln
5. Lizenz prüfen
6. Modell in 4 Bit testen
7. Qualität am eigenen Datensatz messen
Typische Stolpersteine
- Nur auf Benchmarks schauen: Echte Anwendung kann anders aussehen.
- Zu grosses Modell wählen: Läuft nicht auf der Hardware.
- Lizenz ignorieren: Kommerzielle Nutzung verboten.
- Kontextlänge unterschätzen: Lange Dokumente brauchen mehr Kontext.
- Tool-Calling vergessen: Nicht jedes Modell unterstützt Funktionsaufrufe.
Weiterführende Links und Infos
- BotServ.de Lokale KI-Modelle
- BotServ.de Hardware-Anforderungen
- BotServ.de Quantisierungs-Grundlagen
- BotServ.de Ollama einrichten
FAQ: Modell-Finder
Wie finde ich schnell ein passendes Modell? Starte mit Ollama Library, filtere nach Kategorie und teste 7B- oder 8B-Varianten.
Was ist die beste Grösse für den Einstieg? 7B bis 8B in 4 Bit laufen auf vielen Consumer-Systemen und liefern brauchbare Ergebnisse.
Sollte ich immer das grösste Modell nehmen? Nein. Grössere Modelle sind langsamer und brauchen mehr Speicher. Für viele Aufgaben reicht ein kleineres Modell.
Sind MoE-Modelle besser? Sie können effizienter sein, brauchen aber oft mehr Speicherplatz. Für den Einstieg sind dichte Modelle einfacher.
Wie teste ich ein Modell? Lade es mit Ollama herunter und probiere typische Prompts aus Deinem Anwendungsfall.
Quellen und weiterführende Literatur
- Ollama Library: https://ollama.com/library
- Hugging Face Models: https://huggingface.co/models
- LMSYS Chatbot Arena: https://chat.lmsys.org/
Zusammenfassung: Modell-Finder für lokale KI
Der richtige Modell-Finder spart Zeit und Hardware. Wichtigste Kriterien sind Anwendungsfall, Hardware, Sprache, Lizenz und Kontextlänge. Für Einsteiger eignen sich 7B- bis 8B-Modelle in 4 Bit. Spezialisierte Coding-, Reasoning- und Visionmodelle gibt es für jede Aufgabe. Wer immer am echten Datensatz testet, findet schneller das passende Modell als mit Benchmarks allein.


