Configuración de Ollama: Todas las opciones y ajustes
Qué cubre este artículo sobre configuración de Ollama
- Qué variables de entorno ofrece Ollama y cómo configurarlas
- Cómo cambiar la ubicación de almacenamiento de modelos para que tu disco no se llene
- Cómo permitir acceso de red desde otros dispositivos
- Cómo crear variantes de modelos personalizadas con Modelfiles
- Cómo optimizar el rendimiento mediante capas GPU, paralelismo y longitud de contexto
Introducción: configuración de Ollama explicada
Ollama funciona de inmediato después de la instalación. Descargas un modelo, haces una pregunta, obtienes una respuesta. Para experimentos iniciales, eso es suficiente. Pero en cuanto trabajas en serio con modelos locales, surgen preguntas que solo se resuelven mediante configuración: ¿Dónde se guardan los modelos? ¿Cuánta VRAM debe usar Ollama? ¿Pueden otros dispositivos en la red acceder a Ollama? ¿Cómo mantengo un modelo más tiempo en RAM?
Este artículo te guía a través de todos los ajustes importantes. Aprenderás qué variables de entorno existen, cómo escribir Modelfiles y cómo configurar Ollama en Linux, Windows y macOS. Todo paso a paso, con ejemplos que puedes usar directamente.
Si aún no lo has instalado, primero lee la descripción general de Ollama y la guía de instalación.
¿Por qué necesito configuración?
Imagina que instalaste Ollama en Windows y descargas algunos modelos. Un modelo de 7B ocupa alrededor de 4,5 GB, uno de 13B unos 7 GB, y con modelos más grandes se vuelve complicado rápidamente. Por defecto, Ollama guarda todo en la unidad del sistema, normalmente la unidad C. Después de tres o cuatro modelos, tu SSD está llena y Windows te advierte sobre espacio insuficiente.
No es un error, sino la configuración predeterminada. Ollama no sabe que tienes una gran unidad de almacenamiento en D. Debes indicar a Ollama mediante la variable de entorno OLLAMA_MODELS dónde deben ir los modelos.
Otro ejemplo: quieres acceder a Ollama desde una segunda PC o desde tu teléfono en la red inalámbrica. Por defecto, Ollama solo escucha en localhost, es decir, no acepta conexiones externas. Solo con OLLAMA_HOST=0.0.0.0 y los OLLAMA_ORIGINS correctos abres el servicio a tu red. Más información en el artículo Acceso de red.
O trabajas con documentos largos y necesitas un contexto más grande. Por defecto, Ollama usa 2048 tokens como ventana de contexto. Para textos más largos, debes aumentar el valor mediante un Modelfile o un parámetro API. Más sobre longitud de contexto en el artículo básico Longitud de contexto.
La configuración no es un extra opcional, sino el requisito previo para adaptar Ollama a tu hardware y tu forma de uso.
Configuración de Ollama resumida
Ollama se configura principalmente mediante variables de entorno. Son pares clave-valor que Ollama lee al iniciarse. Las estableces en el sistema operativo y Ollama las adopta en el siguiente inicio.
Además existen Modelfiles. Son archivos de texto en los que describes cómo debe comportarse un modelo específico: qué indicación de sistema aplica, qué parámetros rigen la temperatura o la longitud de contexto, y si el modelo se basa en otro modelo.
Las variables de entorno más importantes son OLLAMA_MODELS (ubicación de almacenamiento), OLLAMA_HOST (dirección de red), OLLAMA_ORIGINS (fuentes permitidas), OLLAMA_GPU_LAYERS (capas GPU), OLLAMA_NUM_PARALLEL (solicitudes paralelas) y OLLAMA_MAX_LOADED_MODELS (modelos cargados simultáneamente).
Para quién es esta configuración
Este artículo está dirigido a principiantes que han instalado Ollama y ahora desean más control. No necesitas conocimientos de programación, solo familiaridad básica con tu sistema operativo. Se muestra por separado cómo establecer una variable de entorno en Linux, Windows y macOS.
Si usas Ollama en producción, por ejemplo como backend para una aplicación de chat en LAN, aquí también encontrarás temas avanzados como sintonización de rendimiento y configuración de systemd.
Términos importantes sobre configuración de Ollama
| Término | Significado |
|---|---|
| Variable de entorno | Un par clave-valor en el sistema operativo que Ollama lee al iniciarse, p. ej. OLLAMA_MODELS=/data/ollama |
| Modelfile | Un archivo de texto que describe cómo se configura un modelo: modelo base, indicación de sistema, parámetros |
OLLAMA_MODELS | Define el directorio donde Ollama almacena y carga modelos |
OLLAMA_HOST | Determina la dirección y puerto en los que Ollama escucha, p. ej. 0.0.0.0:11434 |
OLLAMA_ORIGINS | Lista de orígenes permitidos para CORS, importante para frontends web |
OLLAMA_GPU_LAYERS | Número de capas del modelo que se descargan a la GPU |
OLLAMA_NUM_PARALLEL | Número de solicitudes que Ollama procesa simultáneamente |
OLLAMA_MAX_LOADED_MODELS | Número máximo de modelos que permanecen simultáneamente en memoria |
| Context Window | Número de tokens que el modelo puede considerar como contexto |
| System Prompt | Una instrucción que recibe el modelo al inicio y que controla su comportamiento |
Variables de entorno en resumen
Ollama conoce varias variables de entorno. Aquí están las más importantes con descripción y valor predeterminado:
| Variable | Descripción | Predeterminado |
|---|---|---|
OLLAMA_HOST | Dirección y puerto en los que Ollama escucha | 127.0.0.1:11434 |
OLLAMA_MODELS | Directorio para almacenamiento de modelos | ~/.ollama/models |
OLLAMA_ORIGINS | Orígenes permitidos para solicitudes CORS | * (en versiones más recientes) |
OLLAMA_GPU_LAYERS | Capas que se descargan a la GPU | Automático, según VRAM |
OLLAMA_NUM_PARALLEL | Número de solicitudes paralelas por modelo | 1 |
OLLAMA_MAX_LOADED_MODELS | Máximo de modelos cargados simultáneamente | 1 (con RAM limitada) |
OLLAMA_KEEP_ALIVE | Tiempo que un modelo permanece en RAM después de la última solicitud | 5m |
OLLAMA_NUM_CTX | Longitud de contexto estándar en tokens | 2048 |
OLLAMA_FLASH_ATTENTION | Activa Flash Attention, ahorra VRAM | 0 (desactivado) |
OLLAMA_KV_CACHE_TYPE | Tipo de dato para KV-Cache, p. ej. q8_0 para menos VRAM | Tipo de dato predeterminado |
OLLAMA_DEBUG | Activa logs detallados | 0 |
OLLAMA_LLM_LIBRARY | Fuerza una biblioteca backend específica | Automático |
No necesitas establecer cada variable. La mayoría de los valores predeterminados tienen sentido. En las secciones siguientes se muestra cuándo debes ajustar qué variable.
Cambiar ubicación de almacenamiento de modelos (OLLAMA_MODELS)
El ajuste de configuración más común es cambiar la ubicación de almacenamiento de modelos. Por defecto, Ollama coloca los modelos en el directorio de inicio. En Windows suele ser C:\Users\TuNombre\.ollama\models, en Linux ~/.ollama/models, en macOS ~/.ollama/models.
Si tu unidad del sistema es pequeña, querrás mover los modelos a otra unidad de disco.
Linux
Define la variable de forma permanente en tu configuración de shell:
echo 'export OLLAMA_MODELS=/data/ollama/models' >> ~/.bashrc
source ~/.bashrc
Si ejecutas Ollama como servicio systemd, consulta la sección Configuración en Linux más adelante.
Windows
- Presiona la tecla Windows y busca “Variables de entorno”
- Haz clic en “Editar variables de entorno del sistema”
- Haz clic en “Variables de entorno”
- En “Variables de usuario”, haz clic en “Nuevo”
- Nombre:
OLLAMA_MODELS, Valor:D:\ollama\models - Confirma con OK
- Reinicia Ollama, preferiblemente desde el Administrador de tareas o reiniciando el sistema
macOS
En macOS, define la variable en tu configuración de shell si inicias Ollama desde la terminal:
echo 'export OLLAMA_MODELS=/Volumes/Data/ollama/models' >> ~/.zshrc
source ~/.zshrc
Si usas la app de Ollama, inicia la app desde la terminal con la variable establecida, o utiliza launchctl setenv:
launchctl setenv OLLAMA_MODELS /Volumes/Data/ollama/models
Luego reinicia la app de Ollama. Mueve los modelos existentes del directorio anterior al nuevo para evitar descargarlos de nuevo.
Configurar la red (OLLAMA_HOST, OLLAMA_ORIGINS)
Por defecto, Ollama escucha en 127.0.0.1:11434, solo en tu máquina local. Si quieres acceder a Ollama desde otro dispositivo en la red, necesitas cambiar la dirección de escucha.
Establece OLLAMA_HOST en 0.0.0.0:11434 para que Ollama escuche en todas las interfaces de red:
export OLLAMA_HOST=0.0.0.0:11434
Después puedes acceder a Ollama desde otro dispositivo usando la dirección IP de tu máquina, por ejemplo http://192.168.1.100:11434.
Si usas un frontend web como Open WebUI que se ejecuta en el navegador y envía solicitudes a Ollama, también necesitas OLLAMA_ORIGINS. Los navegadores envían un encabezado Origin, y Ollama verifica que sea permitido:
export OLLAMA_ORIGINS=http://192.168.1.50:3000,http://localhost:3000
Separa múltiples orígenes con comas. Encontrarás información detallada en el artículo Acceso en red.
Atención: si expones Ollama a Internet, cualquiera puede usar tus modelos. Restringe el acceso a tu red local o coloca un proxy inverso con autenticación.
Controlar capas de GPU
Ollama decide automáticamente cuántas capas de un modelo se descargan en la GPU. Esto depende de tu VRAM disponible. A veces, sin embargo, quieres intervenir manualmente, por ejemplo si Ollama consume demasiado VRAM y afecta otros programas.
Con OLLAMA_GPU_LAYERS especificas cuántas capas van a la GPU. El resto se ejecuta en CPU:
export OLLAMA_GPU_LAYERS=20
Un valor más alto significa más capas en la GPU y respuestas más rápidas, pero también mayor consumo de VRAM. Un valor más bajo conserva VRAM, pero hace las respuestas más lentas.
También puedes establecer el valor por modelo mediante un Modelfile, ver la siguiente sección. Encontrarás más información sobre GPU offloading en el artículo GPU Offloading.
Modelfiles: crear modelos personalizados
Los Modelfiles son archivos de texto donde defines cómo se configura un modelo. Puedes establecer un System Prompt, ajustar parámetros como temperatura y longitud de contexto, y construir sobre un modelo existente.
Estructura de un Modelfile
Un Modelfile consiste en instrucciones, una por línea. Las más importantes son:
FROM: el modelo base en el que construyes el tuyoSYSTEM: el System Prompt que controla el comportamiento del modeloPARAMETER: parámetros del modelo como temperatura, longitud de contexto, Top-KTEMPLATE: la plantilla de prompt, cómo se formatean las entradas
Un ejemplo simple
Crea un archivo llamado Modelfile:
FROM llama3.1:8b
SYSTEM "Du bist ein hilfreicher Assistent, der auf Deutsch antwortet. Du erklärst Dinge einfach und verständlich."
PARAMETER temperature 0.7
PARAMETER num_ctx 4096
PARAMETER top_p 0.9
Crea el modelo con:
ollama create mein-assistent -f Modelfile
Después lo ejecutas como cualquier otro modelo:
ollama run mein-assistent
Parámetros a simple vista
| Parámetro | Significado | Valor típico |
|---|---|---|
temperature | Controla la creatividad, menor = más determinístico | 0.7 a 0.9 |
num_ctx | Longitud de contexto en tokens | 2048 a 8192 |
top_p | Nucleus Sampling, limita la probabilidad de selección | 0.9 |
top_k | Limita la selección a los k tokens más probables | 40 |
repeat_penalty | Penaliza repeticiones | 1.1 |
num_gpu | Número de capas de GPU para este modelo | Automático o p. ej. 20 |
stop | Secuencias donde el modelo se detiene | p. ej. "\nUser:" |
Los Modelfiles son la forma más sencilla de adaptar un modelo a tu caso de uso sin modificar el modelo base. Encontrarás más sobre gestión de modelos en el artículo Gestionar modelos.
Optimización de rendimiento
Si usas Ollama intensamente, por ejemplo como backend para múltiples usuarios o aplicaciones, surgen cuestiones de rendimiento. Estas variables te ayudan.
OLLAMA_NUM_PARALLEL
Por defecto, Ollama procesa una solicitud por modelo a la vez. Si quieres procesar múltiples solicitudes en paralelo, aumenta el valor:
export OLLAMA_NUM_PARALLEL=2
Esto significa que Ollama procesa dos solicitudes simultáneamente. Esto consume más VRAM, porque la caché KV se mantiene para ambas solicitudes. Verifica que tu VRAM sea suficiente.
OLLAMA_MAX_LOADED_MODELS
Esta variable establece cuántos modelos permanecen en memoria simultáneamente. El valor por defecto suele ser 1, lo que significa que Ollama descarga un modelo antes de cargar el siguiente. Si cambias frecuentemente entre modelos, aumenta el valor:
export OLLAMA_MAX_LOADED_MODELS=2
Esto consume RAM y VRAM, porque ambos modelos se mantienen simultáneamente. Úsalo solo si tienes suficiente memoria.
Ajustar la longitud de contexto
La longitud de contexto determina cuántos tokens el modelo considera como historial. Más contexto te permite procesar documentos o conversaciones más largas, pero consume más VRAM. Establece la longitud de contexto mediante un Modelfile con PARAMETER num_ctx 8192, o a través de la API con el parámetro num_ctx.
Encontrarás información sobre longitud de contexto y consumo de VRAM en el artículo Longitud de contexto.
Controlar keep_alive
Con OLLAMA_KEEP_ALIVE especificas cuánto tiempo un modelo permanece en RAM después de la última solicitud. El valor por defecto es 5m, cinco minutos. Si envías solicitudes frecuentes, puedes aumentar el valor para ahorrar tiempo de carga:
export OLLAMA_KEEP_ALIVE=30m
Si quieres ahorrar RAM, establece el valor más bajo o en 0 para descargar el modelo inmediatamente.
Flash Attention
Con OLLAMA_FLASH_ATTENTION=1 activas Flash Attention. Esto puede reducir el consumo de VRAM con contextos largos y aumentar la velocidad. No todos los modelos lo soportan, pruébalo y compara.
Configuración en Linux (systemd)
En Linux, Ollama se ejecuta generalmente como servicio systemd. Las variables de entorno se definen en el archivo de servicio.
- Abre el archivo de servicio:
sudo systemctl edit ollama.service
- Agrega las variables en la sección override:
[Service]
Environment="OLLAMA_MODELS=/data/ollama/models"
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_ORIGINS=http://192.168.1.50:3000"
Environment="OLLAMA_NUM_PARALLEL=2"
- Guarda y recarga systemd:
sudo systemctl daemon-reload
sudo systemctl restart ollama
- Verifica que las variables estén activas:
systemctl show ollama --property=Environment
Este método es permanente y persiste después de reinicios. Nunca modifiques directamente el archivo de servicio original. Siempre usa systemctl edit para que tus cambios no se pierdan en las actualizaciones.
Configuración en Windows
En Windows, configuras las variables de entorno a través de la interfaz gráfica.
- Presiona la tecla Windows, escribe “variables de entorno”
- Selecciona “Editar variables de entorno del sistema”
- Haz clic en “Variables de entorno”
- En “Variables de usuario”, haz clic en “Nueva”
- Ingresa el nombre y valor, por ejemplo:
- Nombre:
OLLAMA_HOST, Valor:0.0.0.0:11434 - Nombre:
OLLAMA_MODELS, Valor:D:\ollama\models
- Nombre:
- Confirma con OK
- Cierra Ollama desde la bandeja del sistema (abajo a la derecha en la barra de tareas)
- Reinicia Ollama
Las variables de entorno entran en vigor cuando reinicas Ollama. Si lo ejecutas como servicio de Windows, define las variables en “Variables del sistema” en lugar de “Variables de usuario” para que el servicio las encuentre.
Configuración en macOS
En macOS, el método depende de cómo inicies Ollama.
Aplicación Ollama
Para la app gráfica, usa launchctl setenv:
launchctl setenv OLLAMA_MODELS /Volumes/Data/ollama/models
launchctl setenv OLLAMA_HOST 0.0.0.0:11434
Reinicia la aplicación Ollama. Estas variables permanecen hasta el siguiente reinicio. Para una solución permanente, crea un archivo plist en ~/Library/LaunchAgents/.
Terminal
Si inicias Ollama desde el terminal, define las variables en tu configuración de shell:
echo 'export OLLAMA_HOST=0.0.0.0:11434' >> ~/.zshrc
source ~/.zshrc
Luego inicia Ollama con ollama serve en el terminal.
Problemas comunes en la configuración
-
Las variables no se aplican: Debes reiniciar completamente Ollama, no solo recargar un modelo. En Linux con systemd:
sudo systemctl restart ollama. En Windows: cierra Ollama desde la bandeja del sistema y reinícialo. -
Los modelos desaparecen después de cambiar el directorio: Al cambiar
OLLAMA_MODELS, Ollama no reconoce los modelos antiguos. Mueve el contenido del directorio antiguo al nuevo, o descarga los modelos nuevamente. -
Errores de CORS en el navegador: Si un frontend web llama a Ollama y recibes errores como “CORS policy”, falta la origen en
OLLAMA_ORIGINS. Agrega la dirección del frontend, incluyendo el puerto. -
VRAM insuficiente con contexto grande: Una longitud de contexto de 8192 tokens requiere mucha más VRAM que 2048. Si Ollama falla o funciona extremadamente lentamente, reduce
num_ctxo habilita Flash Attention. -
Conflictos de puerto: Si el puerto 11434 está en uso, Ollama no inicia. Cambia el puerto con
OLLAMA_HOST=0.0.0.0:11435o encuentra y detén la aplicación que lo está bloqueando. -
El override de systemd se ignora: Verifica con
systemctl show ollama --property=Environmentque las variables se cargan realmente. Frecuentemente, olvidarsudo systemctl daemon-reloades la causa. -
Seguridad al compartir en la red:
OLLAMA_HOST=0.0.0.0abre Ollama a todos los dispositivos en la red. Sin autenticación, cualquiera puede usar tus modelos. Coloca un proxy inverso con protección de contraseña delante, o restringe el acceso mediante un firewall. -
Variables de Windows en el ámbito incorrecto: Si Ollama se ejecuta como servicio, las variables deben estar en “Variables del sistema”, no en “Variables de usuario”. De lo contrario, el servicio no las encontrará.
Encontrarás más ayuda en el artículo Fehlerbehebung.
Hardware, costos y seguridad en la configuración
La configuración depende mucho de tu hardware. Quién tenga mucha VRAM puede descargar más capas a la GPU, usar contextos más grandes y cargar varios modelos simultáneamente. Quién tenga poco VRAM debe hacer concesiones.
VRAM y capas
Un modelo de 8B con cuantización de 4 bits requiere alrededor de 5 GB de VRAM para los pesos. El cache KV del contexto se suma a esto. Con 4096 tokens de contexto, son otros 1 a 2 GB; con 8192 tokens, proporcionalmente más. Encuentra más información sobre cuantización y cómo reduce el uso de memoria en el artículo Quantisierung.
RAM y CPU
Si no todas las capas caben en la GPU, el resto se ejecuta en la CPU. Es más lentamente, pero funciona. Para sistemas solo CPU, elige modelos más pequeños y contextos cortos.
Costos
Ollama en sí es gratuito y de código abierto. Los costos surgen solo del hardware: una GPU con suficiente VRAM, RAM adecuada y espacio de almacenamiento para modelos. Si solo pruebas Ollama, una PC normal es suficiente. Para uso serio con modelos grandes, una GPU dedicada tiene sentido. Más información en el artículo LLM lokal betreiben.
Seguridad
Si usas Ollama solo localmente, no hay preocupaciones de seguridad. Tan pronto como permitas acceso a la red, no expongas Ollama directamente a internet. Usa un proxy inverso con autenticación, como Nginx o Caddy, y restringe el acceso a tu LAN. Configura OLLAMA_ORIGINS lo más restrictivamente posible.
Enlaces adicionales e información sobre configuración
- Ollama Übersicht - Introducción a Ollama
- Ollama Installation - Instalación paso a paso
- Ollama API - La API en detalle
- Modelle verwalten - Cargar, eliminar, actualizar modelos
- Netzwerkzugriff - Acceder a Ollama en la LAN
- Fehlerbehebung - Solucionar problemas comunes
- Kontextlänge - Cómo funcionan las ventanas de contexto
- Quantisierung - Reducir el tamaño de modelos
- GPU-Offloading - Descargar capas a la GPU
Preguntas frecuentes sobre configuración de Ollama
¿Dónde almacena Ollama los modelos por defecto?
En el directorio principal bajo ~/.ollama/models en Linux y macOS, bajo C:\Users\TuNombre\.ollama\models en Windows. Cambias la ubicación con OLLAMA_MODELS.
¿Cómo cambio el puerto de Ollama?
Establece OLLAMA_HOST=127.0.0.1:11435 para usar el puerto 11435. Reinicia Ollama después.
¿Qué es un Modelfile?
Un archivo de texto donde especificas en qué modelo base se basa el tuyo, qué system prompt se aplica y qué parámetros rigen. Lo creas con ollama create.
¿Cómo permito acceso desde la red?
Establece OLLAMA_HOST=0.0.0.0:11434 para que Ollama escuche en todas las interfaces de red. Agrega OLLAMA_ORIGINS si usas un frontend web.
¿Cómo aumento la longitud del contexto?
O bien mediante un Modelfile con PARAMETER num_ctx 8192, o mediante la API con el parámetro num_ctx en las opciones. Mayor contexto requiere más VRAM.
¿Qué hace OLLAMA_KEEP_ALIVE?
Determina cuánto tiempo un modelo permanece en RAM después de la última solicitud. Por defecto, cinco minutos. Valores más altos ahorran tiempo de carga pero cuestan RAM.
¿Cómo veo qué variables están activas?
En Linux con systemd: systemctl show ollama --property=Environment. En Windows y macOS, verifica las variables de entorno en la configuración del sistema o con echo $OLLAMA_HOST en el terminal.
¿Qué es Flash Attention?
Una técnica que reduce el consumo de VRAM con contextos largos y aumenta la velocidad. Actívalo con OLLAMA_FLASH_ATTENTION=1. No todos los modelos lo soportan.
¿Puedo cargar varios modelos simultáneamente?
Sí, con OLLAMA_MAX_LOADED_MODELS=2 o superior. Cuesta RAM y VRAM porque ambos modelos se mantienen en memoria.
¿Cuántas solicitudes paralelas soporta Ollama?
Por defecto, una por modelo. Con OLLAMA_NUM_PARALLEL=2 o superior, Ollama procesa varias solicitudes simultáneamente. El consumo de VRAM aumenta porque el cache KV se mantiene para cada solicitud.
¿Cómo depuro Ollama?
Establece OLLAMA_DEBUG=1 para activar logs detallados. En Linux ves los logs con journalctl -u ollama. En Windows y macOS, en la consola desde la que inicias Ollama.
¿Debo reiniciar Ollama después de establecer una variable?
Sí, Ollama lee las variables de entorno solo al inicio. Se requiere reiniciar el servicio o la aplicación.
Fuentes y lecturas recomendadas
- Documentación oficial de Ollama: repositorio de GitHub en
ollama/ollama - FAQ de Ollama e issues en GitHub
- Artículo GPU-Offloading en BotServ.de
- Artículo Longitud de contexto en BotServ.de
- Artículo Cuantización en BotServ.de
- Artículo Ejecutar LLM localmente en BotServ.de


