Ejecutar modelos de visión en local
Qué cubre este artículo sobre modelos de visión
- Qué son los modelos de visión y cómo funcionan.
- Qué aplicaciones son posibles en local.
- Modelos de visión conocidos de código abierto.
- Requisitos de hardware y optimización.
- OCR, descripción de imágenes y sistemas de preguntas y respuestas visuales.
Introducción: ejecutar modelos de visión en local
Los modelos de visión pueden comprender imágenes, describirlas y responder preguntas sobre ellas. Los modelos de visión locales permiten procesar datos de imágenes sin enviarlos a servicios en la nube. Esto es importante para imágenes médicas, documentos sensibles, inspección industrial y protección de datos.
Un modelo de visión recibe una imagen y opcionalmente un prompt de texto. Luego proporciona una descripción, identifica objetos o responde preguntas. Cuando se ejecuta en local, todos los datos permanecen en tu ordenador.
¿Por qué necesito modelos de visión locales?
Razones:
- Privacidad: Las imágenes nunca salen de tu red.
- Costos: Sin cuotas por imagen.
- Desconexión: Funcionan sin conexión a internet.
- Control: Tú eliges el modelo y la configuración.
- Integración: Conexión con tus propias aplicaciones.
Aplicaciones
- Descripción de imágenes: Textos alternativos para sitios web y accesibilidad.
- Análisis de documentos: Leer estructuras y contenido de imágenes.
- OCR: Reconocimiento de texto en documentos escaneados.
- Detección de objetos: Contar y clasificar elementos.
- Control de calidad: Encontrar defectos en imágenes de producción.
- Imágenes médicas: Apoyo en clasificación previa.
- Sistemas autónomos: Procesamiento de imágenes para robots o drones.
Modelos de visión conocidos
- LLaVA: Modelo de visión de código abierto muy popular.
- BakLLaVA: Variante mejorada para Ollama.
- Moondream: Modelo de visión compacto y eficiente.
- CogVLM: Potente modelo de visión chino.
- InternVL: Modelo de visión de alto rendimiento.
- Qwen-VL: Modelo de visión de Alibaba.
Cómo funcionan los modelos de visión
Los modelos de visión combinan un codificador de imágenes con un modelo de lenguaje. El codificador convierte la imagen en una serie de vectores. El modelo de lenguaje procesa estos vectores junto con el prompt de texto. De esta forma se genera la respuesta.
Esto significa que los modelos de visión requieren más memoria y capacidad de cálculo que los modelos de solo texto. El codificador de imágenes añade parámetros adicionales y pasos de procesamiento.
Requisitos de hardware
- VRAM: Mínimo 8 GB para modelos pequeños, 16 GB o más para mejor calidad.
- GPU: Se recomiendan NVIDIA o Apple Silicon. AMD e Intel están cada vez mejor soportados.
- RAM: 16 GB de RAM del sistema como mínimo.
- Almacenamiento: Los modelos ocupan varios GB, se recomienda SSD.
Modelos pequeños como Moondream funcionan incluso en hardware menos potente. Para tareas productivas vale la pena invertir en más VRAM.
Preparación de imágenes
- Tamaño: Las imágenes muy grandes ralentizan el procesamiento. Redimensiona a tamaños típicos como 336x336 o 448x448 píxeles.
- Formato: JPEG o PNG, según la aplicación.
- Calidad: La alta calidad ayuda con detalles finos.
- Recorte: Muestra solo la zona relevante.
- Contraste: Una buena iluminación y contraste mejoran los resultados.
Integración con Ollama
Ollama ya soporta modelos de visión. Ejemplo:
ollama pull llava:7b
ollama run llava:7b
En el chat puedes cargar una imagen y hacer preguntas sobre ella. Open WebUI proporciona una interfaz gráfica para esto.
Problemas comunes
- Imágenes demasiado grandes: Tiempos de procesamiento largos.
- Modelo incorrecto: No todos los modelos de visión hablan bien español.
- VRAM insuficiente: El modelo se traslada a CPU.
- Resolución baja: Las imágenes pequeñas pierden detalles.
- Prompts imprecisos: Las preguntas poco claras generan respuestas deficientes.
- Alucinaciones: El modelo interpreta mal las imágenes.
Enlaces e información adicional
- BotServ.de Análisis de imágenes
- BotServ.de IA multimodal
- BotServ.de Hardware para IA local
- Ollama Vision Models
FAQ: Modelos de visión
¿Pueden los modelos de visión reconocer texto manuscrito? Sí, especialmente modelos con capacidades OCR o pasos OCR adicionales ayudan con esto.
¿Siempre necesito una GPU? Para modelos grandes sí. Los modelos pequeños como Moondream funcionan en CPU moderna.
¿Son conformes los modelos de visión locales con la protección de datos? Sí, siempre que las imágenes no salgan de tu infraestructura.
¿Qué rapidez tienen los modelos de visión locales? Según el modelo y el hardware, entre segundos y minutos por imagen.
¿Puedo procesar varias imágenes a la vez? Sí, pero el VRAM y la capacidad de cálculo limitan el rendimiento.
Fuentes y literatura adicional
- LLaVA: https://llava-vl.github.io/
- Moondream: https://moondream.ai/
- Ollama: https://ollama.com/
- Qwen-VL: https://github.com/QwenLM/Qwen-VL
Resumen: ejecutar modelos de visión en local
Los modelos de visión locales permiten descripción de imágenes, OCR, detección de objetos y sistemas de preguntas y respuestas visuales en tu propia red. Protegen datos de imágenes sensibles y ofrecen control total. Lo importante es tener suficiente VRAM, preparar las imágenes adecuadamente, elegir modelos apropiados y usar prompts precisos. Herramientas como Ollama y Open WebUI hacen que empezar sea fácil. Si consideras los requisitos de hardware, puedes usar IA de visión de forma productiva y conforme a la protección de datos.


