Skip to content
BotServBotServ
OllamaIA LocalAPIGestión de modelosInstalación

Ollama

Ollama es un entorno de ejecución para modelos de lenguaje abiertos. Descarga, inicia, chatea y utiliza modelos mediante API.

S

schutzgeist

3 min read
Ollama

Ollama

Qué cubre este artículo

  • Qué es Ollama y por qué lo necesitas.
  • Qué alternativas existen para ejecutar modelos de lenguaje localmente.
  • Cómo instalar Ollama e iniciar tu primer modelo.
  • Cómo usar Ollama desde la línea de comandos y mediante la API.
  • Enlaces a guías detalladas.

Introducción

Modelos de lenguaje abiertos como Llama, Qwen o Mistral están disponibles libremente. Aun así, necesitas software que los ejecute. Este software se llama entorno de ejecución o motor de inferencia. Ollama es un entorno de ejecución de este tipo. Descarga los archivos del modelo, los gestiona y proporciona tanto una interfaz de chat como una API. Así puedes interactuar con modelos o integrarlos en tus propias aplicaciones sin usar servicios en la nube.

¿Por qué necesitas Ollama?

Un gran modelo de lenguaje es esencialmente un archivo enorme. Para obtener respuestas de él, debe cargarse en lo que se conoce como inference runner. Este runner recibe el prompt, calcula la respuesta apropiada y la devuelve. Ollama empaqueta exactamente este runner, la gestión de modelos y una API en una herramienta fácil de usar.

Las alternativas incluyen:

  • llama.cpp - Entorno de ejecución rápido en C++, muy flexible, pero más complejo.
  • LM Studio - Aplicación gráfica con interfaz de usuario.
  • vLLM - Entorno de ejecución de alto rendimiento para uso en servidor.
  • Text Generation Inference (TGI) - De Hugging Face, pensado más para entornos de producción.
  • KoboldCpp - Enfocado en juegos de rol y textos creativos.

Ollama destaca principalmente por su simplicidad. Un solo comando es suficiente para tener un modelo en ejecución.

Instalación

En Linux instala Ollama con un script:

curl -fsSL https://ollama.com/install.sh | sh

Para macOS y Windows hay instaladores oficiales en la web de Ollama. Después de la instalación, Ollama se ejecuta como servicio en segundo plano y está disponible desde la línea de comandos.

Primeros pasos

Descarga e inicia un modelo:

ollama pull llama3.1
ollama run llama3.1

pull descarga el modelo del repositorio de Ollama. run inicia la interfaz de chat en la terminal. Puedes empezar a conversar inmediatamente. Para terminar la sesión, presiona Ctrl + D o escribe /bye.

Usar Ollama como API

Ollama proporciona una API que sigue la estructura de la API de OpenAI. Esto facilita la migración. Ejemplo con curl:

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama3.1",
    "messages": [
      {"role": "user", "content": "Explica Ollama en tres oraciones."}
    ]
  }'

La respuesta llega en formato JSON. Tus propias aplicaciones, frameworks de agentes o frontends de chat pueden usar esta API directamente.

¿Qué puede hacer Ollama?

FunciónUtilidad
Gestión de modelosDescargar, listar, eliminar modelos
ChatConversar directamente con modelos en la terminal
APIIntegrar programas o frameworks
ModelfilesCrear configuraciones personalizadas de modelos
AlmacenamientoLos modelos permanecen localmente en tu máquina

Cuándo elegir Ollama

  • Buscas una solución simple para IA local.
  • Quieres conectar programas a modelos locales mediante una API.
  • Trabajas con frameworks de agentes como LangGraph, CrewAI o AutoGen.
  • La privacidad y la independencia de APIs en la nube son importantes.

Contenido y guías detalladas

FAQ - Preguntas frecuentes

¿Es Ollama gratuito?

Sí, Ollama es Open Source y gratuito. Los únicos costos son los de hardware y electricidad.

¿Puedo usar Ollama sin tarjeta gráfica?

Sí, Ollama también funciona en CPU. Los modelos grandes serán más lentos, pero los modelos de 7B pequeños suelen ser suficientemente rápidos.

¿Es la API de Ollama compatible con OpenAI?

Sí, Ollama proporciona un endpoint en /v1 compatible con la API de chat de OpenAI. Muchas herramientas y frameworks pueden usarlo directamente.

¿Qué modelos funcionan con Ollama?

Muchos modelos abiertos como Llama 3.1, Qwen 2.5, Mistral, Code Llama y muchos otros. Puedes encontrar la lista completa en la biblioteca de Ollama.

Fuentes

Volver al blog
Share:

Entradas relacionadas