Ejecutar LLM en local
Qué cubre este artículo
- Qué hardware y software necesitas para ejecutar un LLM localmente
- Cómo instalar Ollama en Linux, macOS y Windows
- Cómo seleccionar e iniciar un modelo adecuado para principiantes
- Cómo consultar la API de Ollama con curl y Python
- Qué alternativas como LM Studio y Docker existen
Introducción: Ejecutar LLM localmente explicado
Un Large Language Model, o LLM, es la base de los chatbots, asistentes de texto y agentes de IA. Normalmente accedes a estos modelos a través de una API, pagas por token y envías tus datos a un proveedor en la nube. Funciona, cuesta dinero y plantea cuestiones de privacidad.
Con el software adecuado y un poco de hardware, puedes ejecutar un LLM en tu propio equipo. El modelo funciona en tu máquina, mantienes el control sobre tus datos y no pagas cuotas de API. Este artículo te muestra cómo hacerlo con Ollama, la solución más sencilla para empezar. Si quieres más contexto, consulta Qué es la IA local.
¿Por qué necesito ejecutar LLM localmente?
Hay cuatro razones prácticas por las que vale la pena:
- Sin costos de API: No pagas nada por cada consulta. Una vez instalado, el modelo funciona sin cuotas continuas. Esto lo hace atractivo para experimentos, prototipos y uso habitual.
- Privacidad: Los documentos sensibles, el código interno o los textos personales permanecen en tu equipo. Nada sale de tu red mientras ejecutes Ollama localmente.
- Sin límites de velocidad: Los proveedores en la nube limitan cuántas consultas puedes enviar por minuto. Localmente no hay tales restricciones. Puedes enviar cientos de prompts uno tras otro.
- Funciona sin conexión: El modelo sigue funcionando sin internet. Útil cuando viajas, en redes protegidas o durante interrupciones de servicio.
Encontrarás una comparación detallada en IA local vs IA en la nube.
Ejecutar LLM localmente en pocas palabras
Ejecutar un LLM localmente significa que el archivo del modelo y el entorno de inferencia se ejecutan en tu máquina. Escribes un prompt, tu ordenador lo procesa y devuelve una respuesta. El proceso requiere tres cosas: hardware adecuado, un entorno de ejecución y un modelo en formato compatible.
Ollama es un punto de entrada popular porque ofrece gestión de modelos, API e interfaz de chat en un solo paquete. Para empezar, basta un comando como ollama run llama3.1. Ollama descarga el modelo, lo descomprime e inicia un servidor local al que puedes acceder desde la terminal, un navegador o tu propia aplicación.
¿Para quién es esto?
La ejecución local de LLM está dirigida a varios grupos:
- Desarrolladores que quieren probar modelos sin claves de API e integrarlos en aplicaciones propias
- Especialistas en privacidad y empresas que procesan documentos sensibles sin enviar datos al exterior
- Entusiastas de IA que quieren experimentar con flujos de trabajo personalizados y entender cómo funcionan los modelos
- Administradores de sistemas que desean controlar su infraestructura y ser independientes de proveedores en la nube
Los conocimientos de línea de comandos son útiles pero no obligatorios. Ollama reduce la curva de aprendizaje a unos pocos comandos.
Conceptos clave
| Término | Significado |
|---|---|
| LLM | Large Language Model, un modelo de lenguaje con muchos parámetros |
| Inferencia | Procesar un prompt para generar una respuesta |
| Ollama | Entorno de ejecución para descargar y ejecutar modelos locales |
| GGUF | Formato común para modelos locales cuantizados |
| Parámetros | Pesos del modelo, típicamente expresados en miles de millones |
| Token | Fragmento de texto que procesa el modelo, como una palabra o parte de una palabra |
| Cuantización | Reducción del tamaño de un modelo disminuyendo la precisión numérica por parámetro |
| Modelfile | Archivo de configuración de Ollama que define el modelo, parámetros y prompt del sistema |
| Context Window | Cantidad máxima de texto que el modelo puede procesar simultáneamente |
Más información sobre cuantización en Cuantización, detalles sobre context window en Longitud del contexto.
Requisitos previos
Hardware
El hardware determina qué modelos puedes ejecutar y qué tan rápidas son las respuestas. Aquí una visión general de configuraciones típicas para principiantes:
| Configuración | RAM / VRAM | Modelos adecuados | Velocidad |
|---|---|---|---|
| Mínimo | 8 GB | phi3 (3.8B), modelos pequeños | Lento, solo CPU |
| Estándar | 16 GB | llama3.1 (8B), qwen2.5 (7B) | Aceptable, más rápido con GPU |
| Cómodo | 32 GB | mistral (7B) cuantizado, llama3.1 (8B) fluido | Rápido con GPU |
| Potente | 64 GB+ | Modelos mayores hasta 70B cuantizados | Muy rápido con GPU potente |
Una GPU acelera significativamente la inferencia. Las tarjetas Nvidia tienen el mejor soporte, y Apple Silicon (M1 a M4) funciona muy bien gracias a su memoria unificada. Sin GPU, todo se ejecuta en CPU, lo que para modelos pequeños es aceptable pero para mayores resulta frustrante.
Requisitos detallados en Requisitos de RAM y VRAM y Fundamentos de hardware de IA.
Software
- Sistema operativo: Linux, macOS o Windows 10/11
- Ollama: El entorno de ejecución, disponible gratuitamente
- Opcional: Docker, si quieres ejecutar Ollama en contenedor
- Opcional: Python 3.8 o superior, si planeas consultar la API mediante scripts
Paso 1: Verificar el hardware
Antes de instalar Ollama, comprueba las capacidades de tu máquina. Evita sorpresas desagradables si un modelo no funciona bien después.
Verificar RAM
En Linux y macOS:
free -h
En macOS también puedes hacerlo desde el menú de Apple: abre “Acerca de este Mac” y allí verás la memoria.
En Windows:
wmic memorychip get capacity
O abre el Administrador de tareas, pestaña “Rendimiento”, donde ves la memoria usada y total.
Verificar VRAM
Si tienes una GPU Nvidia, usa nvidia-smi:
nvidia-smi
Este comando muestra el nombre de la GPU, el VRAM y el uso actual. Para GPUs AMD usa rocm-smi, y en Apple Silicon system_profiler SPDisplaysDataType mostrará los detalles.
Espacio en disco
Los modelos ocupan espacio. Un modelo de 8B cuantizado usa alrededor de 4 a 6 GB. Planifica al menos 20 GB de espacio libre si quieres probar varios modelos.
Paso 2: Instalar Ollama
Ollama está disponible para Linux, macOS y Windows. La instalación varía ligeramente según la plataforma. Encontrarás una guía completa en Instalación de Ollama.
Linux
La forma más rápida es usar el script de instalación oficial:
curl -fsSL https://ollama.com/install.sh | sh
El script descarga la versión más reciente, configura el servicio e lo inicia automáticamente. Verifica que Ollama esté corriendo:
ollama --version
Si prefieres instalar manualmente, descarga el binario de la web de Ollama, colócalo en /usr/local/bin/ y configura un servicio systemd.
macOS
Descarga el instalador desde ollama.com, abre el archivo .dmg y arrastra Ollama a la carpeta Aplicaciones. Inicia Ollama una vez; después se ejecutará en segundo plano. Verifica en la terminal:
ollama --version
macOS con Apple Silicon aprovecha automáticamente la memoria unificada. No necesitas configurar nada adicional.
Windows
Descarga el instalador desde ollama.com y ejecútalo. Ollama se configura como servicio de fondo. Abre después la línea de comandos o PowerShell y verifica:
ollama --version
Si usas WSL2, también puedes instalar Ollama dentro de WSL2, tal como se describe arriba en la sección Linux.
Paso 3: Elige un modelo
La selección depende de tu hardware. Para comenzar, te recomendamos un modelo pequeño que funcione sin problemas y entregue respuestas rápidamente. Una lista completa de todos los modelos disponibles la encontrarás en Gestionar modelos.
Modelos recomendados para principiantes
| Modelo | Parámetros | RAM (cuantizado) | Fortalezas |
|---|---|---|---|
llama3.1 | 8B | aprox. 5 GB | Versátil, buen alemán |
qwen2.5 | 7B | aprox. 4,5 GB | Fuerte en código y lógica |
mistral | 7B | aprox. 4,5 GB | Compacto, rápido, confiable |
phi3 | 3.8B | aprox. 2,5 GB | Muy pequeño, funciona en hardware limitado |
Comienza con llama3.1 o phi3 si tu equipo tiene poca RAM. Siempre puedes instalar varios modelos y compararlos.
Paso 4: Inicia un modelo
Una vez que Ollama está instalado, ejecutas un modelo con un único comando:
ollama run llama3.1
En la primera llamada, Ollama descarga el modelo. Esto tarda algunos minutos dependiendo de tu conexión. Después se abre un chat interactivo en la terminal. Escribe un prompt, presiona Enter y espera la respuesta.
Ejemplo de prompt:
Erkläre mir in drei Sätzen, was ein LLM ist.
Para salir del chat, escribe /bye o presiona Ctrl+D.
Si quieres descargar el modelo sin iniciarlo inmediatamente:
ollama pull llama3.1
Esto es útil cuando deseas cargar varios modelos de antemano.
Paso 5: Usa la API
Ollama inicia automáticamente un servidor local en http://localhost:11434. A través de él puedes acceder al modelo desde tus propias aplicaciones. Más detalles en API de Ollama.
Ejemplo con curl
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1",
"prompt": "Was ist lokale KI?",
"stream": false
}'
Con "stream": false obtienes la respuesta completa de una vez. Sin este parámetro, Ollama transmite la respuesta en pequeños fragmentos JSON, lo cual es útil para salidas en vivo.
Ejemplo con Python
import requests
response = requests.post(
"http://localhost:11434/api/generate",
json={
"model": "llama3.1",
"prompt": "Was ist lokale KI?",
"stream": False
}
)
print(response.json()["response"])
Para un acceso más cómodo existe la biblioteca oficial de Python ollama:
pip install ollama
import ollama
response = ollama.generate(
model="llama3.1",
prompt="Was ist lokale KI?"
)
print(response["response"])
Alternativa: LM Studio
LM Studio es una alternativa gráfica a Ollama. Ofrece una interfaz de escritorio para Windows, macOS y Linux, donde descargas, inicias y pruebas modelos con un simple clic.
Ventajas de LM Studio:
- Interfaz intuitiva sin línea de comandos
- Búsqueda de modelos directamente en la app via Hugging Face
- Chat integrado con soporte Markdown
- Servidor API compatible que puedes usar como con Ollama
Desventajas:
- Código cerrado, a diferencia de Ollama
- Menos control sobre parámetros del modelo
- Más difícil de automatizar
Para principiantes que no quieren trabajar con la terminal, LM Studio es una opción sólida. Si planeas scripts y automatización, Ollama es la mejor opción.
Alternativa: Docker
Si deseas ejecutar Ollama containerizado, por ejemplo en un servidor o NAS, usa la imagen oficial de Docker:
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
Después descargas un modelo en el contenedor:
docker exec -it ollama ollama pull llama3.1
Y lo inicias:
docker exec -it ollama ollama run llama3.1
Para soporte de GPU agrega --gpus all:
docker run -d --gpus all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
Docker es especialmente adecuado si deseas ejecutar Ollama continuamente en un servidor o si ya tienes otros servicios containerizados.
Comandos de Ollama de un vistazo
| Comando | Descripción |
|---|---|
ollama run modelo | Descarga e inicia un modelo de forma interactiva |
ollama pull modelo | Descarga un modelo sin iniciarlo |
ollama list | Muestra todos los modelos instalados |
ollama rm modelo | Elimina un modelo de tu equipo |
ollama show modelo | Muestra detalles de un modelo |
ollama ps | Muestra los modelos en ejecución |
ollama serve | Inicia el servidor API |
ollama create | Crea un modelo personalizado a partir de un Modelfile |
ollama stop modelo | Detiene un modelo en ejecución |
ollama --version | Muestra la versión instalada |
Una vista completa la encuentras en Ollama resumen.
Errores comunes al operar LLMs locales
- RAM insuficiente: Un modelo 8B necesita al menos 5 GB de RAM libre. Si tu sistema ya consume mucha memoria, la inferencia se detiene o se vuelve extremadamente lenta. Cierra otros programas antes de iniciar un modelo.
- Tamaño de modelo incorrecto: Los principiantes a menudo eligen modelos muy grandes como 70B, que no funcionan sin problemas en hardware normal. Comienza pequeño e incrementa.
- Sin soporte GPU en Docker: Sin el parámetro
--gpus all, Ollama en el contenedor solo usa CPU. Verifica que el Nvidia Container Toolkit esté instalado. - Confusión entre pull y run:
ollama pullsolo descarga,ollama runinicia el chat. Si ejecutaspully esperas una respuesta, esperarás en vano. - API no accesible: Si el servidor no está en ejecución, cada llamada API falla. Inicia Ollama con
ollama serveo asegúrate de que el servicio de fondo se está ejecutando. - Disco lleno: Los modelos son grandes. Varios modelos 8B ocupan fácilmente 20 GB o más. Elimina modelos antiguos con
ollama rm. - Streaming confunde a principiantes: La API envía por defecto muchos pequeños fragmentos JSON. Establece
"stream": falsesi necesitas la respuesta completa de una vez.
Hardware, costos y seguridad al operar LLMs locales
Hardware
Para comenzar, a menudo no necesitas hardware nuevo. Muchos equipos comerciales con 16 GB de RAM o una Mac con procesador serie M son ya suficientes. Si usas regularmente modelos más grandes, deberías invertir en una GPU dedicada. Una tarjeta Nvidia con 12 GB VRAM, como una RTX 3060, es un punto medio razonable.
Costos
Los costos se mantienen manejables. Ollama es gratuito, al igual que la mayoría de modelos de código abierto. Los factores de costo principal son la electricidad y posiblemente una compra nueva. Una GPU bajo carga consume significativamente más electricidad, lo cual se suma en operación continua.
Seguridad
Desde el punto de vista de la seguridad, todos tus datos permanecen locales mientras ejecutes Ollama en tu propia red. Ningún prompt, ninguna respuesta abandona tu equipo. Esta es una ventaja significativa frente a los proveedores en la nube. Si ejecutas Ollama en un contenedor Docker y expones el puerto al exterior, protege la conexión con un firewall o un reverse proxy.
Enlaces útiles e información sobre ejecución local de LLM
- ¿Qué es la IA local? - Artículo de fundamentos sobre el tema
- IA local vs. IA en la nube - Comparación directa
- Cuantización - Cómo los modelos se reducen de tamaño
- Longitud de contexto - Qué significa la ventana de contexto
- Requisitos de RAM y VRAM - Hardware en detalle
- Descripción general de Ollama - Todo sobre Ollama
- Instalación de Ollama - Guía de instalación detallada
- API de Ollama - Documentación de la API
- Gestionar modelos - Cargar, cambiar y eliminar modelos
- Fundamentos de hardware para IA - Entender hardware para IA
FAQ - Preguntas frecuentes sobre ejecución local de LLM
¿Puedo tener varios modelos instalados?
Sí. Ollama gestiona tantos modelos como necesites. Cambias entre ellos con ollama run modellname. Con ollama list ves todos los modelos instalados.
¿Tengo que descargar cada vez de nuevo?
No. Un modelo permanece almacenado localmente después de la primera descarga. Solo las actualizaciones o nuevos modelos deben cargarse nuevamente.
¿Funciona Ollama sin tarjeta gráfica?
Sí, en la CPU. La velocidad de respuesta será mucho más lenta que en una GPU. Para modelos pequeños como phi3 aún es aceptable, pero para modelos más grandes se vuelve frustrante.
¿Dónde encuentro modelos adecuados?
Ollama ofrece una biblioteca de modelos en su propio sitio web. También encuentras modelos en Hugging Face, frecuentemente en formato GGUF. Con ollama pull modellname los descargas directamente.
¿Puedo usar Ollama en Docker?
Sí. Existen imágenes Docker oficiales, que son especialmente prácticas para entornos de servidor o NAS. Para soporte de GPU necesitas el Nvidia Container Toolkit y el parámetro —gpus all.
¿Cuánta RAM necesito como mínimo?
Para modelos pequeños como phi3, con 8 GB es suficiente. Para modelos de 8B como llama3.1, deberías tener 16 GB para que el sistema operativo y el modelo funcionen simultáneamente.
¿Cuál es la diferencia entre pull y run?
ollama pull solo descarga el modelo. ollama run lo descarga si aún no existe e inicia directamente el chat interactivo.
¿Puedo acceder a Ollama desde otros dispositivos en la red?
Sí. Por defecto, Ollama escucha en localhost. Puedes establecer la variable de entorno OLLAMA_HOST en 0.0.0.0:11434 para que Ollama sea accesible desde la red. Protege el acceso con un firewall.
¿Cómo actualizo un modelo?
Ejecuta ollama pull modellname nuevamente. Ollama descarga la versión más reciente si está disponible. La versión anterior se sobrescribe.
¿Qué significa cuantización y la necesito?
La cuantización reduce un modelo disminuyendo la profundidad de almacenamiento por parámetro. Ollama utiliza modelos cuantizados por defecto, así que no tienes que preocuparte por ello. Más información en el artículo Cuantización.
¿Puedo crear mis propios modelos?
Sí. Con un Modelfile defines el modelo base, el system prompt y los parámetros. Crea un archivo llamado Modelfile y ejecuta ollama create meinmodell -f Modelfile.
¿Cómo detengo un modelo en ejecución?
Con ollama stop modellname descargas el modelo de la memoria. Permanece almacenado en el disco y puede reiniciarse en cualquier momento.
¿Se envían mis datos a un servidor?
No. Todo el procesamiento ocurre localmente en tu equipo. Ni los prompts ni las respuestas abandonan tu sistema, siempre que no expongas Ollama intencionalmente en la red.
¿Puedo usar Ollama con una GPU AMD?
Sí, con limitaciones. Ollama soporta GPUs AMD a través de ROCm, especialmente en Linux. En Windows el soporte es limitado. Consulta la documentación actual para modelos compatibles.
Fuentes y lecturas adicionales
- Documentación de Ollama: ollama.com
- Modelos GGUF de Hugging Face: huggingface.co
- Página del proyecto llama.cpp: github.com/ggerganov/llama.cpp
- LM Studio: lmstudio.ai


