Ollama
Qué cubre este artículo
- Qué es Ollama y por qué lo necesitas.
- Qué alternativas existen para ejecutar modelos de lenguaje localmente.
- Cómo instalar Ollama e iniciar tu primer modelo.
- Cómo usar Ollama desde la línea de comandos y mediante la API.
- Enlaces a guías detalladas.
Introducción
Modelos de lenguaje abiertos como Llama, Qwen o Mistral están disponibles libremente. Aun así, necesitas software que los ejecute. Este software se llama entorno de ejecución o motor de inferencia. Ollama es un entorno de ejecución de este tipo. Descarga los archivos del modelo, los gestiona y proporciona tanto una interfaz de chat como una API. Así puedes interactuar con modelos o integrarlos en tus propias aplicaciones sin usar servicios en la nube.
¿Por qué necesitas Ollama?
Un gran modelo de lenguaje es esencialmente un archivo enorme. Para obtener respuestas de él, debe cargarse en lo que se conoce como inference runner. Este runner recibe el prompt, calcula la respuesta apropiada y la devuelve. Ollama empaqueta exactamente este runner, la gestión de modelos y una API en una herramienta fácil de usar.
Las alternativas incluyen:
- llama.cpp - Entorno de ejecución rápido en C++, muy flexible, pero más complejo.
- LM Studio - Aplicación gráfica con interfaz de usuario.
- vLLM - Entorno de ejecución de alto rendimiento para uso en servidor.
- Text Generation Inference (TGI) - De Hugging Face, pensado más para entornos de producción.
- KoboldCpp - Enfocado en juegos de rol y textos creativos.
Ollama destaca principalmente por su simplicidad. Un solo comando es suficiente para tener un modelo en ejecución.
Instalación
En Linux instala Ollama con un script:
curl -fsSL https://ollama.com/install.sh | sh
Para macOS y Windows hay instaladores oficiales en la web de Ollama. Después de la instalación, Ollama se ejecuta como servicio en segundo plano y está disponible desde la línea de comandos.
Primeros pasos
Descarga e inicia un modelo:
ollama pull llama3.1
ollama run llama3.1
pull descarga el modelo del repositorio de Ollama. run inicia la interfaz de chat en la terminal. Puedes empezar a conversar inmediatamente. Para terminar la sesión, presiona Ctrl + D o escribe /bye.
Usar Ollama como API
Ollama proporciona una API que sigue la estructura de la API de OpenAI. Esto facilita la migración. Ejemplo con curl:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "llama3.1",
"messages": [
{"role": "user", "content": "Explica Ollama en tres oraciones."}
]
}'
La respuesta llega en formato JSON. Tus propias aplicaciones, frameworks de agentes o frontends de chat pueden usar esta API directamente.
¿Qué puede hacer Ollama?
| Función | Utilidad |
|---|---|
| Gestión de modelos | Descargar, listar, eliminar modelos |
| Chat | Conversar directamente con modelos en la terminal |
| API | Integrar programas o frameworks |
| Modelfiles | Crear configuraciones personalizadas de modelos |
| Almacenamiento | Los modelos permanecen localmente en tu máquina |
Cuándo elegir Ollama
- Buscas una solución simple para IA local.
- Quieres conectar programas a modelos locales mediante una API.
- Trabajas con frameworks de agentes como LangGraph, CrewAI o AutoGen.
- La privacidad y la independencia de APIs en la nube son importantes.
Contenido y guías detalladas
- Instalar Ollama - Paso a paso en Linux, macOS y Windows.
- API de Ollama - Endpoints, ejemplos e integración en tus propios programas.
- Gestionar modelos en Ollama - Pull, list, run, rm y modelfiles personalizados.
- Ollama en Windows - Instalación, configuración de GPU y WSL2 en Windows.
- Ollama en Linux - Instalación con systemd, soporte de GPU para Ubuntu, Debian y Fedora.
- Ollama en macOS - Apple Silicon, Metal Framework y Unified Memory.
- Ollama con Docker - Instalación containerizada con soporte de GPU y docker-compose.
- Configuración de Ollama - Variables de entorno, modelfiles y ajuste de rendimiento.
- Acceso por red en Ollama - Acceso remoto, firewall, reverse proxy y seguridad.
- Solucionar problemas en Ollama - Problemas comunes y soluciones para GPU, OOM y más.
- Requisitos de hardware para Ollama - Recomendaciones de VRAM, RAM y GPU según el tamaño del modelo.
FAQ - Preguntas frecuentes
¿Es Ollama gratuito?
Sí, Ollama es Open Source y gratuito. Los únicos costos son los de hardware y electricidad.
¿Puedo usar Ollama sin tarjeta gráfica?
Sí, Ollama también funciona en CPU. Los modelos grandes serán más lentos, pero los modelos de 7B pequeños suelen ser suficientemente rápidos.
¿Es la API de Ollama compatible con OpenAI?
Sí, Ollama proporciona un endpoint en /v1 compatible con la API de chat de OpenAI. Muchas herramientas y frameworks pueden usarlo directamente.
¿Qué modelos funcionan con Ollama?
Muchos modelos abiertos como Llama 3.1, Qwen 2.5, Mistral, Code Llama y muchos otros. Puedes encontrar la lista completa en la biblioteca de Ollama.


