Ollama en Linux: instalación y configuración
Qué cubre este artículo sobre Ollama en Linux
- Instalación de Ollama en Ubuntu, Debian y Fedora mediante script oficial e instalación manual
- Configuración y verificación de soporte GPU para Nvidia CUDA y AMD ROCm
- Entendimiento del servicio systemd, inicio, detención y configuración permanente
- Descarga del primer modelo y uso desde línea de comandos y API
- Identificación y resolución de problemas y trampas comunes
Introducción: Ollama en Linux explicado
Ollama es una herramienta compacta que te permite ejecutar modelos de lenguaje grandes localmente en tu propio equipo. En Linux, Ollama funciona de manera especialmente estable y eficiente en recursos, ya que se ejecuta como servicio de fondo a través de systemd. No necesitas cloud, suscripción ni conexión a internet constante una vez que un modelo se ha descargado.
En esta guía te llevaré paso a paso por cada etapa que necesitas para que Ollama funcione correctamente en Linux. Me dirijo a quienes nunca han iniciado un modelo de lenguaje local. Obtendrás comandos concretos, explicaciones y orientación cuando algo no funcione como se espera.
¿Por qué necesito esta guía?
Imagina que quieres usar un modelo de lenguaje para conversaciones privadas o experimentar sin enviar tus datos a un proveedor en la nube. Tienes un equipo Linux con una tarjeta gráfica y simplemente quieres comenzar. Sin una guía estructurada, rápidamente te enfrentarás a preguntas como: ¿dónde se guardan los modelos en disco? ¿Cómo inicio Ollama automáticamente al encender? ¿Por qué el modelo aparentemente no utiliza la GPU?
Aquí es exactamente donde este artículo te ayuda. Te guía desde la instalación, pasando por la configuración de GPU, hasta el uso de la API, cubriendo todos los puntos relevantes paso a paso. Al final, tendrás una instalación de Ollama funcionando, que se inicia automáticamente con el sistema y es accesible desde línea de comandos y API.
Ollama en Linux explicado brevemente
Ollama es una herramienta de código abierto que carga, gestiona y ejecuta modelos de lenguaje locales. En Linux, lo instalas mediante un simple script de shell que descarga el binario y configura un servicio systemd. Este servicio asegura que Ollama se ejecute en segundo plano y sea accesible a través de un servidor HTTP local en el puerto 11434. Interactúas con Ollama usando la herramienta de línea de comandos ollama o la API REST.
Los modelos se guardan por defecto en /usr/share/ollama/.ollama/models. Puedes ajustar esta ruta mediante la variable de entorno OLLAMA_MODELS si, por ejemplo, deseas usar una unidad de disco o partición separada.
A quién va dirigida esta guía
Esta guía está pensada para usuarios de Linux que instalan Ollama por primera vez. Debes tener conocimientos básicos de línea de comandos, es decir, saber cómo abrir una terminal y ejecutar comandos. Experiencia previa con modelos de lenguaje o systemd es útil, pero no es obligatoria.
Si ya usas Ollama en Windows o macOS y quieres cambiar a Linux, aquí encontrarás las diferencias específicas y opciones de configuración que Linux ofrece.
Términos importantes sobre Ollama en Linux
| Término | Explicación |
|---|---|
| Ollama | Herramienta de código abierto para ejecutar modelos de lenguaje localmente |
| systemd | Sistema init y gestor de servicios en distribuciones Linux modernas |
| curl | Herramienta de línea de comandos para descargar archivos y realizar llamadas API |
| apt | Gestor de paquetes en Debian y Ubuntu |
| dnf | Gestor de paquetes en Fedora |
| CUDA | Plataforma de Nvidia para computación acelerada por GPU |
| ROCm | Plataforma de AMD para computación acelerada por GPU |
| OLLAMA_MODELS | Variable de entorno para la ubicación de almacenamiento de modelos |
| OLLAMA_HOST | Variable de entorno para la dirección en la que Ollama escucha |
| Service | Proceso de fondo gestionado por systemd |
| Journalctl | Herramienta para leer registros de systemd |
Requisitos previos
Antes de instalar Ollama, verifica estos requisitos:
- Distribución Linux: Ubuntu 22.04 o superior, Debian 12 o superior, Fedora 39 o superior. Otras distribuciones también funcionan siempre que utilicen systemd.
- RAM: Mínimo 8 GB para modelos pequeños, 16 GB o más para modelos de 7 mil millones de parámetros en adelante.
- Espacio en disco: Aproximadamente 5 GB para Ollama más 4 a 40 GB por modelo, según el tamaño.
- Controladores GPU: Si deseas usar una GPU de Nvidia, deben estar instalados los controladores propietarios. Para GPUs AMD necesitas ROCm.
- Conexión a internet: Requerida para la instalación y la descarga del primer modelo.
Verifica si tu GPU de Nvidia es reconocida con este comando:
nvidia-smi
Si ves una tabla con tu tarjeta gráfica y la versión del controlador, el controlador está correctamente instalado. Sin salida o con un mensaje de error, primero debes instalar los controladores de Nvidia.
Paso 1: Instalar Ollama
El método más sencillo es el script oficial de instalación. Abre una terminal y ejecuta:
curl -fsSL https://ollama.com/install.sh | sh
Este script descarga el binario de Ollama, configura el servicio systemd e inicia Ollama automáticamente. Después de que se complete la instalación, puedes verificar si Ollama está funcionando:
ollama --version
La salida te muestra la versión instalada. Si recibe un mensaje de error indicando que no se encuentra el comando, reinicia tu terminal o ejecuta source ~/.bashrc.
Instalación manual
Si prefieres no usar el script o tu distribución no es compatible, puedes instalar Ollama manualmente:
# Descargar binario
sudo curl -L https://ollama.com/download/ollama-linux-amd64 -o /usr/local/bin/ollama
sudo chmod +x /usr/local/bin/ollama
# Crear usuario y grupo
sudo useradd -r -s /bin/false -m -d /usr/share/ollama ollama
Después debes crear el archivo de servicio systemd tú mismo. Encontrarás más información en la sección sobre systemd más abajo.
Paso 2: Configurar soporte GPU
Nvidia CUDA
Si tienes una GPU de Nvidia y los controladores propietarios instalados, Ollama reconoce CUDA automáticamente. No necesitas instalar paquetes adicionales. Después de la instalación, verifica si Ollama usa la GPU:
ollama ps
En la salida verás bajo la columna PROCESSOR ya sea 100% GPU o una mezcla de CPU y GPU. Si muestra 100% CPU, Ollama no está usando la GPU. En este caso, verifica con nvidia-smi si el controlador funciona.
AMD ROCm
Para tarjetas gráficas AMD, Ollama necesita ROCm. En Ubuntu y Debian puedes configurar ROCm mediante el instalador oficial de AMD. Los usuarios de Fedora encontrarán ROCm en los repositorios. Después de instalar ROCm, reinicia el servicio de Ollama:
sudo systemctl restart ollama
Luego verifica también con ollama ps si la GPU es reconocida. No todas las tarjetas AMD son soportadas por ROCm, los modelos más antiguos pueden funcionar solo con CPU.
Paso 3: Entender el servicio systemd
En Linux, Ollama se ejecuta como servicio systemd. Esto significa que Ollama corre en segundo plano e inicia automáticamente cuando arranca el sistema. El archivo de configuración del servicio se encuentra en /etc/systemd/system/ollama.service y tiene este aspecto:
[Unit]
Description=Ollama Service
After=network-online.target
[Service]
ExecStart=/usr/local/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3
Environment="PATH=/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin"
[Install]
WantedBy=default.target
Los comandos más importantes para gestionar el servicio:
# Consultar estado
sudo systemctl status ollama
# Iniciar servicio
sudo systemctl start ollama
# Detener servicio
sudo systemctl stop ollama
# Reiniciar servicio
sudo systemctl restart ollama
# Habilitar inicio automático
sudo systemctl enable ollama
# Deshabilitar inicio automático
sudo systemctl disable ollama
Los registros del servicio se consultan con journalctl:
# Mostrar últimos registros
sudo journalctl -u ollama -n 50
# Seguir registros en tiempo real
sudo journalctl -u ollama -f
Paso 4: Ejecutar tu primer modelo
Después de la instalación, puedes descargar e iniciar un modelo inmediatamente. Para empezar, te recomendamos un modelo pequeño como llama3.2:
ollama run llama3.2
Ollama descarga el modelo automáticamente antes de iniciarlo. La descarga puede tardar varios minutos dependiendo del tamaño del modelo y tu conexión a Internet. Una vez cargado el modelo, aparece un prompt donde puedes interactuar directamente con él.
Usa el comando /bye para salir del chat. Para ver todos los modelos descargados:
ollama list
Encontrarás más modelos en el directorio oficial en ollama.com/library. Para más detalles sobre cómo gestionar modelos, consulta el artículo Modelos verwalten.
Paso 5: Usar la API
Ollama expone una API REST en http://localhost:11434. Puedes llamar a esta API usando curl o desde cualquier lenguaje de programación que soporte HTTP.
Llamar API con curl
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Erkläre systemd in drei Sätzen.",
"stream": false
}'
La respuesta se devuelve como un objeto JSON. Con "stream": false obtienes la respuesta completa de una vez. Sin este parámetro, la respuesta se transmite por partes.
Llamar API con Python
import requests
response = requests.post(
"http://localhost:11434/api/generate",
json={
"model": "llama3.2",
"prompt": "Erkläre systemd in drei Sätzen.",
"stream": False
}
)
print(response.json()["response"])
Una descripción detallada de todos los puntos finales de la API la encontrarás en el artículo Ollama API.
Configuración mediante variables de entorno
Ollama se puede configurar a través de varias variables de entorno. Las más importantes son:
- OLLAMA_MODELS: Define dónde se almacenan los modelos. Por defecto es
~/.ollama/modelspara cada usuario o/usr/share/ollama/.ollama/modelspara el servicio. - OLLAMA_HOST: Especifica la dirección y puerto en el que Ollama escucha. Por defecto es
127.0.0.1:11434. - OLLAMA_ORIGINS: Controla qué orígenes se permiten para CORS, importante si deseas acceder a Ollama desde un frontend en el navegador.
Añades estas variables en el archivo de configuración del servicio systemd. Abre el archivo con un editor:
sudo systemctl edit ollama
Se abre un archivo vacío donde puedes introducir configuraciones de anulación. Ejemplo:
[Service]
Environment="OLLAMA_MODELS=/mnt/data/ollama-models"
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_ORIGINS=http://localhost:3000,http://localhost:8080"
Guarda el archivo y recarga systemd:
sudo systemctl daemon-reload
sudo systemctl restart ollama
Encontrarás información detallada sobre todas las opciones de configuración en el artículo Konfiguration.
Ollama en Ubuntu/Debian vs Fedora
La instalación con el script oficial funciona igual en Ubuntu, Debian y Fedora. Sin embargo, hay algunas diferencias en los detalles:
| Aspecto | Ubuntu / Debian | Fedora |
|---|---|---|
| Gestor de paquetes | apt | dnf |
| Controladores Nvidia | A través de ubuntu-drivers autoinstall o manualmente | A través de dnf install akmod-nvidia |
| ROCm | A través del instalador de AMD | A través de dnf install rocm |
| Firewall | ufw (si está instalado) | firewalld (activo por defecto) |
En Fedora, ten en cuenta que firewalld puede bloquear el puerto 11434 si deseas acceder a Ollama desde la red. Abre el puerto con:
sudo firewall-cmd --permanent --add-port=11434/tcp
sudo firewall-cmd --reload
En Ubuntu con ufw, usa:
sudo ufw allow 11434/tcp
Encontrarás más información sobre los fundamentos de Ubuntu en el artículo Ubuntu.
Problemas comunes con Ollama en Linux
-
La GPU no se reconoce: Ollama utiliza solo la CPU aunque haya una tarjeta gráfica instalada. Generalmente es por un controlador faltante u obsoleto. Verifica con
nvidia-smiorocminfosi el sistema reconoce la GPU. -
El servicio no inicia: Si
systemctl status ollamamuestra un error, revisa los registros conjournalctl -u ollama -n 50. Frecuentemente el problema es una ruta incorrecta en el archivo del servicio o un problema de permisos. -
Los modelos se guardan en el disco equivocado: Por defecto, Ollama almacena modelos en el directorio home del usuario del servicio. Si hay poco espacio, establece
OLLAMA_MODELSen una partición con suficiente capacidad. -
El puerto 11434 está en uso: Si otro servicio ya está usando este puerto, Ollama no inicia. Cambia el puerto con
OLLAMA_HOST, por ejemplo a127.0.0.1:11435. -
Problemas de permisos con el usuario del servicio: El usuario
ollamanecesita permisos de lectura y escritura en el directorio de modelos. Si modificasOLLAMA_MODELS, asegúrate de que el usuarioollamapueda escribir allí. -
Errores CORS desde el navegador: Si utilizas un frontend web y quieres acceder a Ollama desde el navegador, debes configurar
OLLAMA_ORIGINS. Sin esta configuración, Ollama bloquea las solicitudes del navegador. -
Versión de Ollama desactualizada: Las versiones antiguas no soportan algunos modelos. Actualiza Ollama ejecutando de nuevo el script de instalación.
Encontrarás más soluciones para errores comunes en el artículo Fehlerbehebung.
Hardware, costos y seguridad con Ollama en Linux
Hardware
Para una velocidad útil, una GPU es recomendable. Una GPU Nvidia con 8 GB de VRAM es suficiente para modelos de hasta aproximadamente 7 mil millones de parámetros. Para modelos más grandes necesitas más VRAM o aceptas una ejecución más lenta en CPU. Más sobre CPU versus GPU lo encontrarás en el artículo CPU vs. GPU.
Costos
Ollama es gratuito y de código abierto. Los costos surgen únicamente del hardware. Si ya tienes una máquina Linux con una tarjeta gráfica adecuada, no hay costos adicionales.
Seguridad
Ollama escucha por defecto solo en 127.0.0.1, así que solo es accesible localmente. Si configuras OLLAMA_HOST en 0.0.0.0, Ollama estará disponible en toda la red. En ese caso deberías instalar un firewall y limitar el acceso. Los modelos y conversaciones permanecen en tu máquina, sin transferencia de datos a servidores externos.
Encontrarás conceptos fundamentales sobre la ejecución local de modelos de lenguaje en el artículo LLM lokal betreiben.
Enlaces adicionales e información sobre Ollama en Linux
- Ollama Übersicht - Introducción general a Ollama
- Ollama Installation - Instalación en otros sistemas operativos
- Ollama mit Docker - Ejecutar Ollama en contenedores
- Modelle verwalten - Descargar, actualizar y eliminar modelos
- Konfiguration - Descripción general de todas las opciones de configuración
- Fehlerbehebung - Soluciones para problemas comunes
- Ollama API - Endpoints de API y ejemplos
- LLM lokal betreiben - Fundamentos de los modelos de lenguaje locales
- CPU vs. GPU - Conceptos básicos de hardware
- Ubuntu - Conceptos básicos de Ubuntu
Preguntas frecuentes: Ollama en Linux
¿Cuanta RAM necesito para Ollama en Linux?
Mínimo 8 GB para modelos pequeños como llama3.2 con 3 mil millones de parámetros. Para modelos de 7 a 8 mil millones de parámetros se recomiendan 16 GB. Los modelos más grandes a partir de 13 mil millones de parámetros se benefician notablemente de 32 GB o más.
¿Dónde almacena Ollama los modelos en Linux?
Por defecto en /usr/share/ollama/.ollama/models cuando Ollama se ejecuta como servicio systemd. Puedes cambiar la ruta usando la variable de entorno OLLAMA_MODELS.
¿Necesito una GPU para Ollama?
No, Ollama funciona también en CPU. Pero una GPU acelera significativamente la generación de respuestas. En CPU, los modelos de 3 a 7 mil millones de parámetros aún son usables, mientras que los modelos más grandes se vuelven muy lentos.
¿Cómo actualizo Ollama en Linux?
Ejecuta el script de instalación nuevamente: curl -fsSL https://ollama.com/install.sh | sh. La instalación existente se sobrescribe, pero tus modelos y configuración se conservan.
¿Inicia Ollama automáticamente al arrancar?
Sí, si el servicio systemd está habilitado. Verifica con systemctl is-enabled ollama. Si muestra enabled, Ollama se iniciará automáticamente. Si no es así, activa el inicio automático con sudo systemctl enable ollama.
¿Puedo instalar Ollama sin sudo?
El script de instalación requiere permisos sudo porque copia el binario a /usr/local/bin y crea un servicio systemd. Una instalación manual en el directorio home sin sudo es posible, pero entonces tendrías que iniciar Ollama manualmente.
¿Cómo hago que Ollama sea accesible en la red?
Configura OLLAMA_HOST en 0.0.0.0:11434 en el archivo del servicio systemd y abre el puerto en tu firewall. Ten en cuenta que Ollama será accesible desde cualquier máquina en la red.
¿Funciona Ollama con tarjetas gráficas AMD?
Sí, si ROCm está instalado y la tarjeta gráfica es compatible con ROCm. No todas las GPU de AMD son compatibles, y los modelos más antiguos podrían funcionar solo en CPU.
¿Cómo sé si Ollama está utilizando la GPU?
Inicia un modelo y ejecuta ollama ps en otra terminal. La columna PROCESSOR indica si se está utilizando la GPU. Alternativamente, nvidia-smi muestra la utilización de GPU en tiempo real.
¿Puedo ejecutar varios modelos simultáneamente?
Sí, Ollama puede mantener varios modelos en memoria al mismo tiempo. Ten en cuenta que cada modelo ocupa VRAM. Si no hay suficiente VRAM, Ollama descargará partes a la RAM del sistema, lo que ralentiza las respuestas.
¿Cómo desinstalo Ollama?
Detén el servicio, desactívalo y elimina los archivos:
sudo systemctl stop ollama
sudo systemctl disable ollama
sudo rm /usr/local/bin/ollama
sudo rm /etc/systemd/system/ollama.service
sudo systemctl daemon-reload
También puedes eliminar los modelos en /usr/share/ollama/.ollama/models si ya no los necesitas.
Fuentes y lecturas adicionales
- Documentación oficial de Ollama:
ollama.com - Repositorio de Ollama en GitHub:
github.com/ollama/ollama - Documentación de systemd:
systemd.io - Documentación de Nvidia CUDA:
docs.nvidia.com/cuda - Documentación de AMD ROCm:
rocmdocs.amd.com


