Skip to content
BotServBotServ
OllamaConfiguraciónVariables de entornoModelfileGPURendimientoIA local

Configuración Ollama: Todas las opciones

Configura Ollama: variables de entorno, Modelfiles, capas GPU, longitud de contexto y optimización de rendimiento.

S

schutzgeist

14 min read
Configuración Ollama: Todas las opciones

Configuración de Ollama: Todas las opciones y ajustes

Qué cubre este artículo sobre configuración de Ollama

  • Qué variables de entorno ofrece Ollama y cómo configurarlas
  • Cómo cambiar la ubicación de almacenamiento de modelos para que tu disco no se llene
  • Cómo permitir acceso de red desde otros dispositivos
  • Cómo crear variantes de modelos personalizadas con Modelfiles
  • Cómo optimizar el rendimiento mediante capas GPU, paralelismo y longitud de contexto

Introducción: configuración de Ollama explicada

Ollama funciona de inmediato después de la instalación. Descargas un modelo, haces una pregunta, obtienes una respuesta. Para experimentos iniciales, eso es suficiente. Pero en cuanto trabajas en serio con modelos locales, surgen preguntas que solo se resuelven mediante configuración: ¿Dónde se guardan los modelos? ¿Cuánta VRAM debe usar Ollama? ¿Pueden otros dispositivos en la red acceder a Ollama? ¿Cómo mantengo un modelo más tiempo en RAM?

Este artículo te guía a través de todos los ajustes importantes. Aprenderás qué variables de entorno existen, cómo escribir Modelfiles y cómo configurar Ollama en Linux, Windows y macOS. Todo paso a paso, con ejemplos que puedes usar directamente.

Si aún no lo has instalado, primero lee la descripción general de Ollama y la guía de instalación.

¿Por qué necesito configuración?

Imagina que instalaste Ollama en Windows y descargas algunos modelos. Un modelo de 7B ocupa alrededor de 4,5 GB, uno de 13B unos 7 GB, y con modelos más grandes se vuelve complicado rápidamente. Por defecto, Ollama guarda todo en la unidad del sistema, normalmente la unidad C. Después de tres o cuatro modelos, tu SSD está llena y Windows te advierte sobre espacio insuficiente.

No es un error, sino la configuración predeterminada. Ollama no sabe que tienes una gran unidad de almacenamiento en D. Debes indicar a Ollama mediante la variable de entorno OLLAMA_MODELS dónde deben ir los modelos.

Otro ejemplo: quieres acceder a Ollama desde una segunda PC o desde tu teléfono en la red inalámbrica. Por defecto, Ollama solo escucha en localhost, es decir, no acepta conexiones externas. Solo con OLLAMA_HOST=0.0.0.0 y los OLLAMA_ORIGINS correctos abres el servicio a tu red. Más información en el artículo Acceso de red.

O trabajas con documentos largos y necesitas un contexto más grande. Por defecto, Ollama usa 2048 tokens como ventana de contexto. Para textos más largos, debes aumentar el valor mediante un Modelfile o un parámetro API. Más sobre longitud de contexto en el artículo básico Longitud de contexto.

La configuración no es un extra opcional, sino el requisito previo para adaptar Ollama a tu hardware y tu forma de uso.

Configuración de Ollama resumida

Ollama se configura principalmente mediante variables de entorno. Son pares clave-valor que Ollama lee al iniciarse. Las estableces en el sistema operativo y Ollama las adopta en el siguiente inicio.

Además existen Modelfiles. Son archivos de texto en los que describes cómo debe comportarse un modelo específico: qué indicación de sistema aplica, qué parámetros rigen la temperatura o la longitud de contexto, y si el modelo se basa en otro modelo.

Las variables de entorno más importantes son OLLAMA_MODELS (ubicación de almacenamiento), OLLAMA_HOST (dirección de red), OLLAMA_ORIGINS (fuentes permitidas), OLLAMA_GPU_LAYERS (capas GPU), OLLAMA_NUM_PARALLEL (solicitudes paralelas) y OLLAMA_MAX_LOADED_MODELS (modelos cargados simultáneamente).

Para quién es esta configuración

Este artículo está dirigido a principiantes que han instalado Ollama y ahora desean más control. No necesitas conocimientos de programación, solo familiaridad básica con tu sistema operativo. Se muestra por separado cómo establecer una variable de entorno en Linux, Windows y macOS.

Si usas Ollama en producción, por ejemplo como backend para una aplicación de chat en LAN, aquí también encontrarás temas avanzados como sintonización de rendimiento y configuración de systemd.

Términos importantes sobre configuración de Ollama

TérminoSignificado
Variable de entornoUn par clave-valor en el sistema operativo que Ollama lee al iniciarse, p. ej. OLLAMA_MODELS=/data/ollama
ModelfileUn archivo de texto que describe cómo se configura un modelo: modelo base, indicación de sistema, parámetros
OLLAMA_MODELSDefine el directorio donde Ollama almacena y carga modelos
OLLAMA_HOSTDetermina la dirección y puerto en los que Ollama escucha, p. ej. 0.0.0.0:11434
OLLAMA_ORIGINSLista de orígenes permitidos para CORS, importante para frontends web
OLLAMA_GPU_LAYERSNúmero de capas del modelo que se descargan a la GPU
OLLAMA_NUM_PARALLELNúmero de solicitudes que Ollama procesa simultáneamente
OLLAMA_MAX_LOADED_MODELSNúmero máximo de modelos que permanecen simultáneamente en memoria
Context WindowNúmero de tokens que el modelo puede considerar como contexto
System PromptUna instrucción que recibe el modelo al inicio y que controla su comportamiento

Variables de entorno en resumen

Ollama conoce varias variables de entorno. Aquí están las más importantes con descripción y valor predeterminado:

VariableDescripciónPredeterminado
OLLAMA_HOSTDirección y puerto en los que Ollama escucha127.0.0.1:11434
OLLAMA_MODELSDirectorio para almacenamiento de modelos~/.ollama/models
OLLAMA_ORIGINSOrígenes permitidos para solicitudes CORS* (en versiones más recientes)
OLLAMA_GPU_LAYERSCapas que se descargan a la GPUAutomático, según VRAM
OLLAMA_NUM_PARALLELNúmero de solicitudes paralelas por modelo1
OLLAMA_MAX_LOADED_MODELSMáximo de modelos cargados simultáneamente1 (con RAM limitada)
OLLAMA_KEEP_ALIVETiempo que un modelo permanece en RAM después de la última solicitud5m
OLLAMA_NUM_CTXLongitud de contexto estándar en tokens2048
OLLAMA_FLASH_ATTENTIONActiva Flash Attention, ahorra VRAM0 (desactivado)
OLLAMA_KV_CACHE_TYPETipo de dato para KV-Cache, p. ej. q8_0 para menos VRAMTipo de dato predeterminado
OLLAMA_DEBUGActiva logs detallados0
OLLAMA_LLM_LIBRARYFuerza una biblioteca backend específicaAutomático

No necesitas establecer cada variable. La mayoría de los valores predeterminados tienen sentido. En las secciones siguientes se muestra cuándo debes ajustar qué variable.

Cambiar ubicación de almacenamiento de modelos (OLLAMA_MODELS)

El ajuste de configuración más común es cambiar la ubicación de almacenamiento de modelos. Por defecto, Ollama coloca los modelos en el directorio de inicio. En Windows suele ser C:\Users\TuNombre\.ollama\models, en Linux ~/.ollama/models, en macOS ~/.ollama/models.

Si tu unidad del sistema es pequeña, querrás mover los modelos a otra unidad de disco.

Linux

Define la variable de forma permanente en tu configuración de shell:

echo 'export OLLAMA_MODELS=/data/ollama/models' >> ~/.bashrc
source ~/.bashrc

Si ejecutas Ollama como servicio systemd, consulta la sección Configuración en Linux más adelante.

Windows

  1. Presiona la tecla Windows y busca “Variables de entorno”
  2. Haz clic en “Editar variables de entorno del sistema”
  3. Haz clic en “Variables de entorno”
  4. En “Variables de usuario”, haz clic en “Nuevo”
  5. Nombre: OLLAMA_MODELS, Valor: D:\ollama\models
  6. Confirma con OK
  7. Reinicia Ollama, preferiblemente desde el Administrador de tareas o reiniciando el sistema

macOS

En macOS, define la variable en tu configuración de shell si inicias Ollama desde la terminal:

echo 'export OLLAMA_MODELS=/Volumes/Data/ollama/models' >> ~/.zshrc
source ~/.zshrc

Si usas la app de Ollama, inicia la app desde la terminal con la variable establecida, o utiliza launchctl setenv:

launchctl setenv OLLAMA_MODELS /Volumes/Data/ollama/models

Luego reinicia la app de Ollama. Mueve los modelos existentes del directorio anterior al nuevo para evitar descargarlos de nuevo.

Configurar la red (OLLAMA_HOST, OLLAMA_ORIGINS)

Por defecto, Ollama escucha en 127.0.0.1:11434, solo en tu máquina local. Si quieres acceder a Ollama desde otro dispositivo en la red, necesitas cambiar la dirección de escucha.

Establece OLLAMA_HOST en 0.0.0.0:11434 para que Ollama escuche en todas las interfaces de red:

export OLLAMA_HOST=0.0.0.0:11434

Después puedes acceder a Ollama desde otro dispositivo usando la dirección IP de tu máquina, por ejemplo http://192.168.1.100:11434.

Si usas un frontend web como Open WebUI que se ejecuta en el navegador y envía solicitudes a Ollama, también necesitas OLLAMA_ORIGINS. Los navegadores envían un encabezado Origin, y Ollama verifica que sea permitido:

export OLLAMA_ORIGINS=http://192.168.1.50:3000,http://localhost:3000

Separa múltiples orígenes con comas. Encontrarás información detallada en el artículo Acceso en red.

Atención: si expones Ollama a Internet, cualquiera puede usar tus modelos. Restringe el acceso a tu red local o coloca un proxy inverso con autenticación.

Controlar capas de GPU

Ollama decide automáticamente cuántas capas de un modelo se descargan en la GPU. Esto depende de tu VRAM disponible. A veces, sin embargo, quieres intervenir manualmente, por ejemplo si Ollama consume demasiado VRAM y afecta otros programas.

Con OLLAMA_GPU_LAYERS especificas cuántas capas van a la GPU. El resto se ejecuta en CPU:

export OLLAMA_GPU_LAYERS=20

Un valor más alto significa más capas en la GPU y respuestas más rápidas, pero también mayor consumo de VRAM. Un valor más bajo conserva VRAM, pero hace las respuestas más lentas.

También puedes establecer el valor por modelo mediante un Modelfile, ver la siguiente sección. Encontrarás más información sobre GPU offloading en el artículo GPU Offloading.

Modelfiles: crear modelos personalizados

Los Modelfiles son archivos de texto donde defines cómo se configura un modelo. Puedes establecer un System Prompt, ajustar parámetros como temperatura y longitud de contexto, y construir sobre un modelo existente.

Estructura de un Modelfile

Un Modelfile consiste en instrucciones, una por línea. Las más importantes son:

  • FROM: el modelo base en el que construyes el tuyo
  • SYSTEM: el System Prompt que controla el comportamiento del modelo
  • PARAMETER: parámetros del modelo como temperatura, longitud de contexto, Top-K
  • TEMPLATE: la plantilla de prompt, cómo se formatean las entradas

Un ejemplo simple

Crea un archivo llamado Modelfile:

FROM llama3.1:8b

SYSTEM "Du bist ein hilfreicher Assistent, der auf Deutsch antwortet. Du erklärst Dinge einfach und verständlich."

PARAMETER temperature 0.7
PARAMETER num_ctx 4096
PARAMETER top_p 0.9

Crea el modelo con:

ollama create mein-assistent -f Modelfile

Después lo ejecutas como cualquier otro modelo:

ollama run mein-assistent

Parámetros a simple vista

ParámetroSignificadoValor típico
temperatureControla la creatividad, menor = más determinístico0.7 a 0.9
num_ctxLongitud de contexto en tokens2048 a 8192
top_pNucleus Sampling, limita la probabilidad de selección0.9
top_kLimita la selección a los k tokens más probables40
repeat_penaltyPenaliza repeticiones1.1
num_gpuNúmero de capas de GPU para este modeloAutomático o p. ej. 20
stopSecuencias donde el modelo se detienep. ej. "\nUser:"

Los Modelfiles son la forma más sencilla de adaptar un modelo a tu caso de uso sin modificar el modelo base. Encontrarás más sobre gestión de modelos en el artículo Gestionar modelos.

Optimización de rendimiento

Si usas Ollama intensamente, por ejemplo como backend para múltiples usuarios o aplicaciones, surgen cuestiones de rendimiento. Estas variables te ayudan.

OLLAMA_NUM_PARALLEL

Por defecto, Ollama procesa una solicitud por modelo a la vez. Si quieres procesar múltiples solicitudes en paralelo, aumenta el valor:

export OLLAMA_NUM_PARALLEL=2

Esto significa que Ollama procesa dos solicitudes simultáneamente. Esto consume más VRAM, porque la caché KV se mantiene para ambas solicitudes. Verifica que tu VRAM sea suficiente.

OLLAMA_MAX_LOADED_MODELS

Esta variable establece cuántos modelos permanecen en memoria simultáneamente. El valor por defecto suele ser 1, lo que significa que Ollama descarga un modelo antes de cargar el siguiente. Si cambias frecuentemente entre modelos, aumenta el valor:

export OLLAMA_MAX_LOADED_MODELS=2

Esto consume RAM y VRAM, porque ambos modelos se mantienen simultáneamente. Úsalo solo si tienes suficiente memoria.

Ajustar la longitud de contexto

La longitud de contexto determina cuántos tokens el modelo considera como historial. Más contexto te permite procesar documentos o conversaciones más largas, pero consume más VRAM. Establece la longitud de contexto mediante un Modelfile con PARAMETER num_ctx 8192, o a través de la API con el parámetro num_ctx.

Encontrarás información sobre longitud de contexto y consumo de VRAM en el artículo Longitud de contexto.

Controlar keep_alive

Con OLLAMA_KEEP_ALIVE especificas cuánto tiempo un modelo permanece en RAM después de la última solicitud. El valor por defecto es 5m, cinco minutos. Si envías solicitudes frecuentes, puedes aumentar el valor para ahorrar tiempo de carga:

export OLLAMA_KEEP_ALIVE=30m

Si quieres ahorrar RAM, establece el valor más bajo o en 0 para descargar el modelo inmediatamente.

Flash Attention

Con OLLAMA_FLASH_ATTENTION=1 activas Flash Attention. Esto puede reducir el consumo de VRAM con contextos largos y aumentar la velocidad. No todos los modelos lo soportan, pruébalo y compara.

Configuración en Linux (systemd)

En Linux, Ollama se ejecuta generalmente como servicio systemd. Las variables de entorno se definen en el archivo de servicio.

  1. Abre el archivo de servicio:
sudo systemctl edit ollama.service
  1. Agrega las variables en la sección override:
[Service]
Environment="OLLAMA_MODELS=/data/ollama/models"
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_ORIGINS=http://192.168.1.50:3000"
Environment="OLLAMA_NUM_PARALLEL=2"
  1. Guarda y recarga systemd:
sudo systemctl daemon-reload
sudo systemctl restart ollama
  1. Verifica que las variables estén activas:
systemctl show ollama --property=Environment

Este método es permanente y persiste después de reinicios. Nunca modifiques directamente el archivo de servicio original. Siempre usa systemctl edit para que tus cambios no se pierdan en las actualizaciones.

Configuración en Windows

En Windows, configuras las variables de entorno a través de la interfaz gráfica.

  1. Presiona la tecla Windows, escribe “variables de entorno”
  2. Selecciona “Editar variables de entorno del sistema”
  3. Haz clic en “Variables de entorno”
  4. En “Variables de usuario”, haz clic en “Nueva”
  5. Ingresa el nombre y valor, por ejemplo:
    • Nombre: OLLAMA_HOST, Valor: 0.0.0.0:11434
    • Nombre: OLLAMA_MODELS, Valor: D:\ollama\models
  6. Confirma con OK
  7. Cierra Ollama desde la bandeja del sistema (abajo a la derecha en la barra de tareas)
  8. Reinicia Ollama

Las variables de entorno entran en vigor cuando reinicas Ollama. Si lo ejecutas como servicio de Windows, define las variables en “Variables del sistema” en lugar de “Variables de usuario” para que el servicio las encuentre.

Configuración en macOS

En macOS, el método depende de cómo inicies Ollama.

Aplicación Ollama

Para la app gráfica, usa launchctl setenv:

launchctl setenv OLLAMA_MODELS /Volumes/Data/ollama/models
launchctl setenv OLLAMA_HOST 0.0.0.0:11434

Reinicia la aplicación Ollama. Estas variables permanecen hasta el siguiente reinicio. Para una solución permanente, crea un archivo plist en ~/Library/LaunchAgents/.

Terminal

Si inicias Ollama desde el terminal, define las variables en tu configuración de shell:

echo 'export OLLAMA_HOST=0.0.0.0:11434' >> ~/.zshrc
source ~/.zshrc

Luego inicia Ollama con ollama serve en el terminal.

Problemas comunes en la configuración

  1. Las variables no se aplican: Debes reiniciar completamente Ollama, no solo recargar un modelo. En Linux con systemd: sudo systemctl restart ollama. En Windows: cierra Ollama desde la bandeja del sistema y reinícialo.

  2. Los modelos desaparecen después de cambiar el directorio: Al cambiar OLLAMA_MODELS, Ollama no reconoce los modelos antiguos. Mueve el contenido del directorio antiguo al nuevo, o descarga los modelos nuevamente.

  3. Errores de CORS en el navegador: Si un frontend web llama a Ollama y recibes errores como “CORS policy”, falta la origen en OLLAMA_ORIGINS. Agrega la dirección del frontend, incluyendo el puerto.

  4. VRAM insuficiente con contexto grande: Una longitud de contexto de 8192 tokens requiere mucha más VRAM que 2048. Si Ollama falla o funciona extremadamente lentamente, reduce num_ctx o habilita Flash Attention.

  5. Conflictos de puerto: Si el puerto 11434 está en uso, Ollama no inicia. Cambia el puerto con OLLAMA_HOST=0.0.0.0:11435 o encuentra y detén la aplicación que lo está bloqueando.

  6. El override de systemd se ignora: Verifica con systemctl show ollama --property=Environment que las variables se cargan realmente. Frecuentemente, olvidar sudo systemctl daemon-reload es la causa.

  7. Seguridad al compartir en la red: OLLAMA_HOST=0.0.0.0 abre Ollama a todos los dispositivos en la red. Sin autenticación, cualquiera puede usar tus modelos. Coloca un proxy inverso con protección de contraseña delante, o restringe el acceso mediante un firewall.

  8. Variables de Windows en el ámbito incorrecto: Si Ollama se ejecuta como servicio, las variables deben estar en “Variables del sistema”, no en “Variables de usuario”. De lo contrario, el servicio no las encontrará.

Encontrarás más ayuda en el artículo Fehlerbehebung.

Hardware, costos y seguridad en la configuración

La configuración depende mucho de tu hardware. Quién tenga mucha VRAM puede descargar más capas a la GPU, usar contextos más grandes y cargar varios modelos simultáneamente. Quién tenga poco VRAM debe hacer concesiones.

VRAM y capas

Un modelo de 8B con cuantización de 4 bits requiere alrededor de 5 GB de VRAM para los pesos. El cache KV del contexto se suma a esto. Con 4096 tokens de contexto, son otros 1 a 2 GB; con 8192 tokens, proporcionalmente más. Encuentra más información sobre cuantización y cómo reduce el uso de memoria en el artículo Quantisierung.

RAM y CPU

Si no todas las capas caben en la GPU, el resto se ejecuta en la CPU. Es más lentamente, pero funciona. Para sistemas solo CPU, elige modelos más pequeños y contextos cortos.

Costos

Ollama en sí es gratuito y de código abierto. Los costos surgen solo del hardware: una GPU con suficiente VRAM, RAM adecuada y espacio de almacenamiento para modelos. Si solo pruebas Ollama, una PC normal es suficiente. Para uso serio con modelos grandes, una GPU dedicada tiene sentido. Más información en el artículo LLM lokal betreiben.

Seguridad

Si usas Ollama solo localmente, no hay preocupaciones de seguridad. Tan pronto como permitas acceso a la red, no expongas Ollama directamente a internet. Usa un proxy inverso con autenticación, como Nginx o Caddy, y restringe el acceso a tu LAN. Configura OLLAMA_ORIGINS lo más restrictivamente posible.

Enlaces adicionales e información sobre configuración

Preguntas frecuentes sobre configuración de Ollama

¿Dónde almacena Ollama los modelos por defecto?

En el directorio principal bajo ~/.ollama/models en Linux y macOS, bajo C:\Users\TuNombre\.ollama\models en Windows. Cambias la ubicación con OLLAMA_MODELS.

¿Cómo cambio el puerto de Ollama?

Establece OLLAMA_HOST=127.0.0.1:11435 para usar el puerto 11435. Reinicia Ollama después.

¿Qué es un Modelfile?

Un archivo de texto donde especificas en qué modelo base se basa el tuyo, qué system prompt se aplica y qué parámetros rigen. Lo creas con ollama create.

¿Cómo permito acceso desde la red?

Establece OLLAMA_HOST=0.0.0.0:11434 para que Ollama escuche en todas las interfaces de red. Agrega OLLAMA_ORIGINS si usas un frontend web.

¿Cómo aumento la longitud del contexto?

O bien mediante un Modelfile con PARAMETER num_ctx 8192, o mediante la API con el parámetro num_ctx en las opciones. Mayor contexto requiere más VRAM.

¿Qué hace OLLAMA_KEEP_ALIVE?

Determina cuánto tiempo un modelo permanece en RAM después de la última solicitud. Por defecto, cinco minutos. Valores más altos ahorran tiempo de carga pero cuestan RAM.

¿Cómo veo qué variables están activas?

En Linux con systemd: systemctl show ollama --property=Environment. En Windows y macOS, verifica las variables de entorno en la configuración del sistema o con echo $OLLAMA_HOST en el terminal.

¿Qué es Flash Attention?

Una técnica que reduce el consumo de VRAM con contextos largos y aumenta la velocidad. Actívalo con OLLAMA_FLASH_ATTENTION=1. No todos los modelos lo soportan.

¿Puedo cargar varios modelos simultáneamente?

Sí, con OLLAMA_MAX_LOADED_MODELS=2 o superior. Cuesta RAM y VRAM porque ambos modelos se mantienen en memoria.

¿Cuántas solicitudes paralelas soporta Ollama?

Por defecto, una por modelo. Con OLLAMA_NUM_PARALLEL=2 o superior, Ollama procesa varias solicitudes simultáneamente. El consumo de VRAM aumenta porque el cache KV se mantiene para cada solicitud.

¿Cómo depuro Ollama?

Establece OLLAMA_DEBUG=1 para activar logs detallados. En Linux ves los logs con journalctl -u ollama. En Windows y macOS, en la consola desde la que inicias Ollama.

¿Debo reiniciar Ollama después de establecer una variable?

Sí, Ollama lee las variables de entorno solo al inicio. Se requiere reiniciar el servicio o la aplicación.

Fuentes y lecturas recomendadas

Volver al blog
Share:

Entradas relacionadas