Skip to content
BotServBotServ
Vision-ModelleLLaVABakLLaVAMiniCPM-VMoondreamBildverständnis

Vision-Modelle im Vergleich

Vision-Modelle für lokale KI im Vergleich. LLaVA, BakLLaVA, MiniCPM-V, Moondream: Bildverständnis lokal.

S

schutzgeist

4 min read
Vision-Modelle im Vergleich

Vision-Modelle im Vergleich

Was dieser Artikel über Vision-Modelle behandelt

  • Die wichtigsten lokalen Vision-Modelle im Vergleich.
  • LLaVA, BakLLaVA, MiniCPM-V und Moondream im Detail.
  • Welches Modell für welche Bild-Aufgabe.
  • Hardware-Anforderungen und Geschwindigkeit.
  • Praxisbeispiele für Bildanalyse, OCR und Dokumentenverarbeitung.

Einleitung: Vision-Modelle verständlich erklärt

Vision-Modelle können Bilder verstehen: Sie beschreiben, was auf einem Foto ist, lesen Text (OCR), analysieren Diagramme und beantworten Fragen zu Bildern. Kombiniert mit Textmodellen ermöglichen sie multimodale KI: Text + Bild.

Dieser Artikel richtet sich an Anwender, die Bilder mit lokaler KI analysieren wollen. Grundlagen findest Du in Bildanalyse und Ollama Vision.

Warum brauche ich Vision-Modelle?

Stell Dir vor, Du willst ein Foto beschreiben, Text aus einem Screenshot extrahieren oder ein Diagramm analysieren. Vision-Modelle können das, lokal, ohne dass das Bild in die Cloud geht.

Vision-Modelle im Vergleich kurz erklärt

Vision-Modelle verbinden einen Bild-Encoder mit einem Sprachmodell. Sie sehen ein Bild und generieren Text dazu. LLaVA ist das bekannteste, MiniCPM-V das stärkste für die Größe, Moondream das kleinste für Edge.

Der Kerngedanke lautet: Bild rein, Text raus.

Für wen ist dieser Artikel gedacht?

  • Entwickler, die Bildverständnis einbauen.
  • Analysten, die Diagramme und Screenshots auswerten.
  • Dokumentenverarbeiter, die OCR + Verständnis brauchen.
  • Privacy-Bewusste, die Bilder lokal analysieren.

Wichtige Begriffe

  • Vision-Modell - Bild + Text. Wann nützlich: für Bildverständnis.
  • Multimodal - Mehrere Modi (Text + Bild). Wann nützlich: das Konzept.
  • OCR - Text aus Bildern. Wann nützlich: für Dokumente.
  • VLM - Vision-Language-Model. Wann nützlich: der Fachbegriff.
  • Ollama - Modellserver. Wann nützlich: zum Ausführen.
  • Encoder - Bild zu Vektor. Wann nützlich: wie es funktioniert.

Die Modelle im Vergleich

ModellEntwicklerGrößenStärkeVRAMBest für
LLaVAUW-Madison7B-34BBewährt, gut dokumentiert5-20 GBAllgemeine Bildanalyse
MiniCPM-V 2.6OpenBMB8BStark für Größe~6 GBEffiziente Bildanalyse
BakLLaVASkunkworks7BMistral-basiert~5 GBSchnelle Analyse
MoondreamMoondream1.8BSehr klein~2 GBEdge, IoT, schnell
Qwen2-VLAlibaba2B-72BMehrsprachig3-40 GBMehrsprachige Bilder

Detaillierter Vergleich

1. LLaVA (Large Language and Vision Assistant)

Stärken:

  • Bewährt, gut dokumentiert
  • Verschiedene Größen (7B-34B)
  • Gute Beschreibungen und Fragen
  • LLaVA-NeXT: Verbesserte Version

Schwächen:

  • Nicht das neueste Modell
  • Deutsch okay, nicht top

Empfehlung: llava:13b für gute Balance.

2. MiniCPM-V 2.6 (OpenBMB)

Stärken:

  • Beste Qualität für 8B-Größe
  • Sehr gutes OCR und Dokumentenverständnis
  • Kann mehrere Bilder gleichzeitig
  • Stark für Diagramme und Tabellen

Schwächen:

  • Weniger bekannt
  • Weniger Fine-Tunes

Empfehlung: minicpm-v:8b für beste Effizienz.

3. BakLLaVA

Stärken:

  • Mistral-basiert (gutes Deutsch)
  • Schnell für die Qualität
  • Gut für allgemeine Bildanalyse

Schwächen:

  • Nur 7B verfügbar
  • Nicht so stark wie MiniCPM-V

Empfehlung: bakllava:7b für deutschsprachige Bildanalyse.

4. Moondream

Stärken:

  • Sehr klein (1.8B, ~2GB VRAM)
  • Schnell für Edge/IoT
  • Gut für einfache Bildbeschreibungen

Schwächen:

  • Limitierte Fähigkeiten
  • Kein komplexes Reasoning

Empfehlung: moondream:1.8b für Edge-Geräte und schnelle Tests.

5. Qwen2-VL

Stärken:

  • Exzellente Mehrsprachigkeit
  • Stark für chinesische/japanische Bilder
  • Gutes OCR
  • Video-Verständnis (Qwen2.5-VL)

Schwächen:

  • Größere Modelle brauchen viel VRAM
  • Alibaba-Modell

Empfehlung: qwen2-vl:7b für mehrsprachige Bildanalyse.

Aufgaben-Vergleich

AufgabeEmpfehlungWarum
Bild beschreibenllava:13bBewährt
OCR / Text extrahierenminicpm-v:8bBestes OCR
Diagramme analysierenminicpm-v:8bVersteht Struktur
Screenshots auswertenminicpm-v:8bGut für UI-Elemente
Mehrere Bilderminicpm-v:8bMulti-Image-Support
Schnelle Beschreibungmoondream:1.8bSehr schnell
Mehrsprachige Bilderqwen2-vl:7bBeste Mehrsprachigkeit
Edge/IoTmoondream:1.8bKleinste Größe

Praxisbeispiel: Bild beschreiben

import requests
import base64

# Bild laden
with open("foto.jpg", "rb") as f:
    image_b64 = base64.b64encode(f.read()).decode()

# Ollama Vision API
response = requests.post("http://ollama:11434/api/chat", json={
    "model": "minicpm-v:8b",
    "messages": [
        {
            "role": "user",
            "content": "Beschreibe dieses Bild im Detail.",
            "images": [image_b64]
        }
    ],
    "stream": False
})

print(response.json()["message"]["content"])

Praxisbeispiel: OCR aus Screenshot

# Screenshot analysieren
response = requests.post("http://ollama:11434/api/chat", json={
    "model": "minicpm-v:8b",
    "messages": [
        {
            "role": "user",
            "content": "Extrahiere allen Text aus diesem Screenshot. Gib den Text strukturiert zurück.",
            "images": [screenshot_b64]
        }
    ],
    "stream": False
})

Praxisbeispiel: Diagramm analysieren

# Diagramm verstehen
response = requests.post("http://ollama:11434/api/chat", json={
    "model": "minicpm-v:8b",
    "messages": [
        {
            "role": "user",
            "content": "Analysiere dieses Diagramm. Was zeigt es? Welche Trends erkennst Du?",
            "images": [diagram_b64]
        }
    ],
    "stream": False
})

Sicherheitshinweise

  • Bilder können sensible Daten enthalten: Screenshots, Dokumente, Gesichter. Lokale Verarbeitung schützt. Siehe Datenschutz.
  • OCR-Fehler: Textextraktion kann fehlerhaft sein. Validierung wichtig.
  • Prompt Injection: Bilder können versteckte Anweisungen enthalten. Siehe Prompt Injection.

Typische Stolpersteine

  • Zu großes Modell: 34B Vision-Modell auf 8GB = OOM. MiniCPM-V oder Moondream wählen.
  • Falsche Erwartung: Vision-Modelle beschreiben, sie erstellen keine Bilder. Für Bildgenerierung: Stable Diffusion.
  • Kein OCR: Nicht alle Vision-Modelle sind gut für OCR. MiniCPM-V ist spezialisiert.
  • Mehrere Bilder: Nicht alle Modelle können mehrere Bilder gleichzeitig. MiniCPM-V kann es.
  • Deutsch: Deutsch-Qualität variiert. Qwen2-VL und BakLLaVA sind gut.

Key Takeaways:

  • Vision-Modelle verstehen Bilder: Beschreibung, OCR, Analyse.
  • minicpm-v:8b = beste Effizienz für lokale Bildanalyse.
  • llava:13b = bewährt, gut dokumentiert.
  • moondream:1.8b = für Edge und schnelle Tests.
  • qwen2-vl = für mehrsprachige Bilder.
  • Für OCR und Dokumente: MiniCPM-V ist spezialisiert.

FAQ

Was ist ein Vision-Modell?

Ein Modell, das Bilder versteht: Es beschreibt Fotos, liest Text (OCR), analysiert Diagramme und beantwortet Fragen zu Bildern. Kombiniert Bild-Encoder mit Sprachmodell.

Welches Vision-Modell lokal?

minicpm-v:8b für beste Effizienz. llava:13b für bewährte Qualität. moondream:1.8b für Edge. qwen2-vl für Mehrsprachigkeit.

Kann ich OCR lokal machen?

Ja, MiniCPM-V ist sehr gut für OCR. Alternativ: Tesseract (klassisch) oder EasyOCR. Vision-Modelle verstehen den Kontext besser als reines OCR.

Wie viel VRAM brauche ich?

moondream:1.8b ~2 GB. minicpm-v:8b ~6 GB. llava:13b ~8-10 GB. Für gute Bildanalyse mindestens 8B empfohlen.

Kann das Modell Bilder generieren?

Nein, Vision-Modelle analysieren Bilder, sie erstellen keine. Für Bildgenerierung: Stable Diffusion, FLUX oder DALL-E (Cloud).

Kann ich mehrere Bilder gleichzeitig analysieren?

Ja, MiniCPM-V unterstützt mehrere Bilder pro Anfrage. Das ist nützlich für Vergleiche oder Dokumente mit mehreren Seiten.

Kann das Modell Videos analysieren?

Qwen2.5-VL kann Videos. Für andere Modelle: Einzelbilder aus dem Video extrahieren und nacheinander analysieren.

Sind meine Bilder sicher?

Ja, wenn Du lokale Modelle nutzt. Alle Bilder bleiben auf Deinem Rechner. Bei Cloud-APIs gehen Bilder raus, für sensible Bilder lokale Modelle nutzen.

Quellen und weiterführende Literatur

Zurück zum KI Blog
Share:

Ähnliche Beiträge