Modelos de visión comparados
Qué cubre este artículo
- Los principales modelos de visión locales en comparación.
- LLaVA, BakLLaVA, MiniCPM-V y Moondream en detalle.
- Qué modelo para cada tarea de imagen.
- Requisitos de hardware y velocidad.
- Casos prácticos para análisis de imágenes, OCR y procesamiento de documentos.
Introducción: modelos de visión explicados
Los modelos de visión entienden imágenes: describen lo que hay en una foto, leen texto (OCR), analizan diagramas y responden preguntas sobre imágenes. Combinados con modelos de texto, permiten IA multimodal: texto + imagen.
Este artículo va dirigido a usuarios que quieren analizar imágenes con IA local. Encontrarás fundamentos en Análisis de imágenes y Ollama Vision.
¿Por qué necesito modelos de visión?
Imagina que quieres describir una foto, extraer texto de una captura de pantalla o analizar un diagrama. Los modelos de visión pueden hacerlo localmente, sin que la imagen salga a la nube.
Modelos de visión explicados brevemente
Los modelos de visión conectan un codificador de imágenes con un modelo de lenguaje. Ven una imagen y generan texto sobre ella. LLaVA es el más conocido, MiniCPM-V el más potente para su tamaño, Moondream el más pequeño para edge.
La idea fundamental es simple: imagen adentro, texto afuera.
¿Para quién es este artículo?
- Desarrolladores que quieren integrar comprensión de imágenes.
- Analistas que procesan diagramas y capturas de pantalla.
- Procesadores de documentos que necesitan OCR + comprensión.
- Usuarios con conciencia de privacidad que analizan imágenes localmente.
Términos importantes
- Modelo de visión - Imagen + texto. Cuándo es útil: para comprensión de imágenes.
- Multimodal - Varios modos (texto + imagen). Cuándo es útil: el concepto.
- OCR - Texto de imágenes. Cuándo es útil: para documentos.
- VLM - Vision-Language-Model. Cuándo es útil: el término técnico.
- Ollama - Servidor de modelos. Cuándo es útil: para ejecutar.
- Encoder - Imagen a vector. Cuándo es útil: cómo funciona.
Comparación de modelos
| Modelo | Desarrollador | Tamaños | Fortaleza | VRAM | Mejor para |
|---|---|---|---|---|---|
| LLaVA | UW-Madison | 7B-34B | Probado, bien documentado | 5-20 GB | Análisis general de imágenes |
| MiniCPM-V 2.6 | OpenBMB | 8B | Potente para su tamaño | ~6 GB | Análisis eficiente de imágenes |
| BakLLaVA | Skunkworks | 7B | Basado en Mistral | ~5 GB | Análisis rápido |
| Moondream | Moondream | 1.8B | Muy pequeño | ~2 GB | Edge, IoT, rápido |
| Qwen2-VL | Alibaba | 2B-72B | Multilingüe | 3-40 GB | Imágenes multilingües |
Comparación detallada
1. LLaVA (Large Language and Vision Assistant)
Fortalezas:
- Probado, bien documentado
- Varios tamaños (7B-34B)
- Buenas descripciones y respuestas a preguntas
- LLaVA-NeXT: versión mejorada
Debilidades:
- No es el modelo más reciente
- Alemán correcto, no óptimo
Recomendación: llava:13b para un buen equilibrio.
2. MiniCPM-V 2.6 (OpenBMB)
Fortalezas:
- Mejor calidad para tamaño 8B
- OCR muy bueno y comprensión de documentos
- Puede procesar múltiples imágenes simultáneamente
- Potente para diagramas y tablas
Debilidades:
- Menos conocido
- Menos fine-tunes disponibles
Recomendación: minicpm-v:8b para mejor eficiencia.
3. BakLLaVA
Fortalezas:
- Basado en Mistral (buen rendimiento multilingüe)
- Rápido para su calidad
- Bueno para análisis general de imágenes
Debilidades:
- Solo disponible en 7B
- No tan potente como MiniCPM-V
Recomendación: bakllava:7b para análisis de imágenes en múltiples idiomas.
4. Moondream
Fortalezas:
- Muy pequeño (1.8B, ~2GB VRAM)
- Rápido para edge e IoT
- Bueno para descripciones simples de imágenes
Debilidades:
- Capacidades limitadas
- Sin razonamiento complejo
Recomendación: moondream:1.8b para dispositivos edge y pruebas rápidas.
5. Qwen2-VL
Fortalezas:
- Multilingüismo excelente
- Potente para imágenes en chino y japonés
- OCR bueno
- Comprensión de video (Qwen2.5-VL)
Debilidades:
- Los modelos más grandes requieren mucho VRAM
- Modelo de Alibaba
Recomendación: qwen2-vl:7b para análisis multilingüe de imágenes.
Comparación por tareas
| Tarea | Recomendación | Por qué |
|---|---|---|
| Describir imagen | llava:13b | Probado |
| OCR / Extraer texto | minicpm-v:8b | Mejor OCR |
| Analizar diagramas | minicpm-v:8b | Entiende la estructura |
| Evaluar capturas | minicpm-v:8b | Bueno para elementos UI |
| Múltiples imágenes | minicpm-v:8b | Soporte multi-imagen |
| Descripción rápida | moondream:1.8b | Muy rápido |
| Imágenes multilingües | qwen2-vl:7b | Mejor multilingüismo |
| Edge/IoT | moondream:1.8b | Tamaño más pequeño |
Caso práctico: describir una imagen
import requests
import base64
# Cargar imagen
with open("foto.jpg", "rb") as f:
image_b64 = base64.b64encode(f.read()).decode()
# API de Ollama Vision
response = requests.post("http://ollama:11434/api/chat", json={
"model": "minicpm-v:8b",
"messages": [
{
"role": "user",
"content": "Describe esta imagen en detalle.",
"images": [image_b64]
}
],
"stream": False
})
print(response.json()["message"]["content"])
Caso práctico: OCR de captura de pantalla
# Analizar captura de pantalla
response = requests.post("http://ollama:11434/api/chat", json={
"model": "minicpm-v:8b",
"messages": [
{
"role": "user",
"content": "Extrae todo el texto de esta captura. Devuelve el texto de forma estructurada.",
"images": [screenshot_b64]
}
],
"stream": False
})
Caso práctico: analizar un diagrama
# Entender diagrama
response = requests.post("http://ollama:11434/api/chat", json={
"model": "minicpm-v:8b",
"messages": [
{
"role": "user",
"content": "Analiza este diagrama. ¿Qué muestra? ¿Qué tendencias ves?",
"images": [diagram_b64]
}
],
"stream": False
})
Consideraciones de seguridad
- Las imágenes pueden contener datos sensibles: capturas de pantalla, documentos, rostros. El procesamiento local los protege. Ver Privacidad.
- Errores de OCR: la extracción de texto puede ser inexacta. La validación es importante.
- Inyección de prompts: las imágenes pueden contener instrucciones ocultas. Ver Prompt Injection.
Errores comunes
- Modelo demasiado grande: modelo Vision 34B en 8GB = OOM. Elige MiniCPM-V o Moondream.
- Expectativas incorrectas: los modelos de visión describen imágenes, no las crean. Para generación: Stable Diffusion.
- Sin OCR: no todos los modelos de visión son buenos para OCR. MiniCPM-V está especializado.
- Múltiples imágenes: no todos los modelos soportan múltiples imágenes simultáneamente. MiniCPM-V sí.
- Multilingüismo: la calidad multilingüe varía. Qwen2-VL y BakLLaVA son buenos.
Enlaces relacionados
- Análisis de imágenes - Analizar imágenes con IA.
- Análisis de documentos - Entender documentos.
- Ollama Vision - Vision en Ollama.
- API de Ollama Vision - Referencia de API.
- Modelos de texto - Para texto sin imagen.
- IA multimodal - Resumen general.
Puntos clave:
- Los modelos de visión entienden imágenes: descripción, OCR, análisis.
- minicpm-v:8b = mejor eficiencia para análisis local de imágenes.
- llava:13b = probado, bien documentado.
- moondream:1.8b = para edge y pruebas rápidas.
- qwen2-vl = para imágenes multilingües.
- Para OCR y documentos: MiniCPM-V está especializado.
Preguntas frecuentes
¿Qué es un modelo de visión?
¿Qué modelo de visión usar localmente?
¿Puedo hacer OCR localmente?
¿Cuánto VRAM necesito?
¿Puede el modelo generar imágenes?
¿Puedo analizar múltiples imágenes simultáneamente?
¿Puede el modelo analizar videos?
¿Mis imágenes son seguras?
Fuentes y lecturas complementarias
- LLaVA - Proyecto LLaVA.
- MiniCPM-V - Modelo OpenBMB.
- Moondream - Moondream.
- Qwen-VL - Vision Alibaba.
- Ollama - Servidor de modelos.


