Vision-Modelle im Vergleich
Was dieser Artikel über Vision-Modelle behandelt
- Die wichtigsten lokalen Vision-Modelle im Vergleich.
- LLaVA, BakLLaVA, MiniCPM-V und Moondream im Detail.
- Welches Modell für welche Bild-Aufgabe.
- Hardware-Anforderungen und Geschwindigkeit.
- Praxisbeispiele für Bildanalyse, OCR und Dokumentenverarbeitung.
Einleitung: Vision-Modelle verständlich erklärt
Vision-Modelle können Bilder verstehen: Sie beschreiben, was auf einem Foto ist, lesen Text (OCR), analysieren Diagramme und beantworten Fragen zu Bildern. Kombiniert mit Textmodellen ermöglichen sie multimodale KI: Text + Bild.
Dieser Artikel richtet sich an Anwender, die Bilder mit lokaler KI analysieren wollen. Grundlagen findest Du in Bildanalyse und Ollama Vision.
Warum brauche ich Vision-Modelle?
Stell Dir vor, Du willst ein Foto beschreiben, Text aus einem Screenshot extrahieren oder ein Diagramm analysieren. Vision-Modelle können das, lokal, ohne dass das Bild in die Cloud geht.
Vision-Modelle im Vergleich kurz erklärt
Vision-Modelle verbinden einen Bild-Encoder mit einem Sprachmodell. Sie sehen ein Bild und generieren Text dazu. LLaVA ist das bekannteste, MiniCPM-V das stärkste für die Größe, Moondream das kleinste für Edge.
Der Kerngedanke lautet: Bild rein, Text raus.
Für wen ist dieser Artikel gedacht?
- Entwickler, die Bildverständnis einbauen.
- Analysten, die Diagramme und Screenshots auswerten.
- Dokumentenverarbeiter, die OCR + Verständnis brauchen.
- Privacy-Bewusste, die Bilder lokal analysieren.
Wichtige Begriffe
- Vision-Modell - Bild + Text. Wann nützlich: für Bildverständnis.
- Multimodal - Mehrere Modi (Text + Bild). Wann nützlich: das Konzept.
- OCR - Text aus Bildern. Wann nützlich: für Dokumente.
- VLM - Vision-Language-Model. Wann nützlich: der Fachbegriff.
- Ollama - Modellserver. Wann nützlich: zum Ausführen.
- Encoder - Bild zu Vektor. Wann nützlich: wie es funktioniert.
Die Modelle im Vergleich
| Modell | Entwickler | Größen | Stärke | VRAM | Best für |
|---|---|---|---|---|---|
| LLaVA | UW-Madison | 7B-34B | Bewährt, gut dokumentiert | 5-20 GB | Allgemeine Bildanalyse |
| MiniCPM-V 2.6 | OpenBMB | 8B | Stark für Größe | ~6 GB | Effiziente Bildanalyse |
| BakLLaVA | Skunkworks | 7B | Mistral-basiert | ~5 GB | Schnelle Analyse |
| Moondream | Moondream | 1.8B | Sehr klein | ~2 GB | Edge, IoT, schnell |
| Qwen2-VL | Alibaba | 2B-72B | Mehrsprachig | 3-40 GB | Mehrsprachige Bilder |
Detaillierter Vergleich
1. LLaVA (Large Language and Vision Assistant)
Stärken:
- Bewährt, gut dokumentiert
- Verschiedene Größen (7B-34B)
- Gute Beschreibungen und Fragen
- LLaVA-NeXT: Verbesserte Version
Schwächen:
- Nicht das neueste Modell
- Deutsch okay, nicht top
Empfehlung: llava:13b für gute Balance.
2. MiniCPM-V 2.6 (OpenBMB)
Stärken:
- Beste Qualität für 8B-Größe
- Sehr gutes OCR und Dokumentenverständnis
- Kann mehrere Bilder gleichzeitig
- Stark für Diagramme und Tabellen
Schwächen:
- Weniger bekannt
- Weniger Fine-Tunes
Empfehlung: minicpm-v:8b für beste Effizienz.
3. BakLLaVA
Stärken:
- Mistral-basiert (gutes Deutsch)
- Schnell für die Qualität
- Gut für allgemeine Bildanalyse
Schwächen:
- Nur 7B verfügbar
- Nicht so stark wie MiniCPM-V
Empfehlung: bakllava:7b für deutschsprachige Bildanalyse.
4. Moondream
Stärken:
- Sehr klein (1.8B, ~2GB VRAM)
- Schnell für Edge/IoT
- Gut für einfache Bildbeschreibungen
Schwächen:
- Limitierte Fähigkeiten
- Kein komplexes Reasoning
Empfehlung: moondream:1.8b für Edge-Geräte und schnelle Tests.
5. Qwen2-VL
Stärken:
- Exzellente Mehrsprachigkeit
- Stark für chinesische/japanische Bilder
- Gutes OCR
- Video-Verständnis (Qwen2.5-VL)
Schwächen:
- Größere Modelle brauchen viel VRAM
- Alibaba-Modell
Empfehlung: qwen2-vl:7b für mehrsprachige Bildanalyse.
Aufgaben-Vergleich
| Aufgabe | Empfehlung | Warum |
|---|---|---|
| Bild beschreiben | llava:13b | Bewährt |
| OCR / Text extrahieren | minicpm-v:8b | Bestes OCR |
| Diagramme analysieren | minicpm-v:8b | Versteht Struktur |
| Screenshots auswerten | minicpm-v:8b | Gut für UI-Elemente |
| Mehrere Bilder | minicpm-v:8b | Multi-Image-Support |
| Schnelle Beschreibung | moondream:1.8b | Sehr schnell |
| Mehrsprachige Bilder | qwen2-vl:7b | Beste Mehrsprachigkeit |
| Edge/IoT | moondream:1.8b | Kleinste Größe |
Praxisbeispiel: Bild beschreiben
import requests
import base64
# Bild laden
with open("foto.jpg", "rb") as f:
image_b64 = base64.b64encode(f.read()).decode()
# Ollama Vision API
response = requests.post("http://ollama:11434/api/chat", json={
"model": "minicpm-v:8b",
"messages": [
{
"role": "user",
"content": "Beschreibe dieses Bild im Detail.",
"images": [image_b64]
}
],
"stream": False
})
print(response.json()["message"]["content"])
Praxisbeispiel: OCR aus Screenshot
# Screenshot analysieren
response = requests.post("http://ollama:11434/api/chat", json={
"model": "minicpm-v:8b",
"messages": [
{
"role": "user",
"content": "Extrahiere allen Text aus diesem Screenshot. Gib den Text strukturiert zurück.",
"images": [screenshot_b64]
}
],
"stream": False
})
Praxisbeispiel: Diagramm analysieren
# Diagramm verstehen
response = requests.post("http://ollama:11434/api/chat", json={
"model": "minicpm-v:8b",
"messages": [
{
"role": "user",
"content": "Analysiere dieses Diagramm. Was zeigt es? Welche Trends erkennst Du?",
"images": [diagram_b64]
}
],
"stream": False
})
Sicherheitshinweise
- Bilder können sensible Daten enthalten: Screenshots, Dokumente, Gesichter. Lokale Verarbeitung schützt. Siehe Datenschutz.
- OCR-Fehler: Textextraktion kann fehlerhaft sein. Validierung wichtig.
- Prompt Injection: Bilder können versteckte Anweisungen enthalten. Siehe Prompt Injection.
Typische Stolpersteine
- Zu großes Modell: 34B Vision-Modell auf 8GB = OOM. MiniCPM-V oder Moondream wählen.
- Falsche Erwartung: Vision-Modelle beschreiben, sie erstellen keine Bilder. Für Bildgenerierung: Stable Diffusion.
- Kein OCR: Nicht alle Vision-Modelle sind gut für OCR. MiniCPM-V ist spezialisiert.
- Mehrere Bilder: Nicht alle Modelle können mehrere Bilder gleichzeitig. MiniCPM-V kann es.
- Deutsch: Deutsch-Qualität variiert. Qwen2-VL und BakLLaVA sind gut.
Weiterführende Links
- Bildanalyse - Bilder mit KI analysieren.
- Dokumentenanalyse - Dokumente verstehen.
- Ollama Vision - Vision in Ollama.
- Ollama Vision API - API-Referenz.
- Textmodelle - Für Text ohne Bild.
- Multimodale KI - Übersicht.
Key Takeaways:
- Vision-Modelle verstehen Bilder: Beschreibung, OCR, Analyse.
- minicpm-v:8b = beste Effizienz für lokale Bildanalyse.
- llava:13b = bewährt, gut dokumentiert.
- moondream:1.8b = für Edge und schnelle Tests.
- qwen2-vl = für mehrsprachige Bilder.
- Für OCR und Dokumente: MiniCPM-V ist spezialisiert.
FAQ
Was ist ein Vision-Modell?
Welches Vision-Modell lokal?
Kann ich OCR lokal machen?
Wie viel VRAM brauche ich?
Kann das Modell Bilder generieren?
Kann ich mehrere Bilder gleichzeitig analysieren?
Kann das Modell Videos analysieren?
Sind meine Bilder sicher?
Quellen und weiterführende Literatur
- LLaVA - LLaVA-Projekt.
- MiniCPM-V - OpenBMB-Modell.
- Moondream - Moondream.
- Qwen-VL - Alibaba Vision.
- Ollama - Modellserver.


