Skip to content
BotServBotServ
OllamaHardwareVRAMRAMGPURequisitosIA localGuía de compra

Requisitos de Hardware para Ollama: ¿Qué necesitas?

Requisitos de hardware para Ollama: VRAM, RAM, GPU y CPU. Recomendaciones prácticas según presupuesto y tamaño de modelo.

S

schutzgeist

13 min read
Requisitos de Hardware para Ollama: ¿Qué necesitas?

Requisitos de Hardware para Ollama: ¿Qué necesitas realmente?

Qué cubre este artículo sobre requisitos de hardware

  • Cuánta VRAM y RAM necesitan diferentes tamaños de modelo, desde 3B hasta 70B parámetros
  • Cuándo tiene sentido una GPU y cuándo es suficiente solo CPU
  • Setups recomendados para distintos presupuestos, desde menos de 500 hasta más de 2000 euros
  • Cómo verificar con comandos simples si tu hardware es adecuado para un modelo específico
  • Problemas típicos que impiden que un modelo funcione a pesar de tener hardware aparentemente suficiente

Introducción: Requisitos de hardware de Ollama explicados

Ollama facilita ejecutar modelos de lenguaje locales. Descargas un modelo, lo lanzas, y listo. Pero entre tu primer ollama run y una respuesta fluida hay algunas preguntas de hardware que determinan el éxito o la frustración. Un modelo 7B en una laptop sin GPU puede tardar minutos en una sola respuesta. Un modelo 70B en una tarjeta gráfica con VRAM insuficiente se detiene o se arrastra en fallback a CPU.

Este artículo te da números concretos, recomendaciones y valores prácticos para que compres o uses exactamente el hardware que necesitas. Ni más ni menos. Si aún no has instalado Ollama, encontrarás los pasos correspondientes en Instalación de Ollama.

¿Por qué necesito estos requisitos?

Imagina que compras una RTX 4060 con 8 GB VRAM porque un foro recomendó que una tarjeta gráfica es importante para IA local. Instalas Ollama, descargas llama3:70b y lanzas el modelo. La respuesta no llega. La VRAM está llena, Ollama desplaza partes a la RAM del sistema, y la generación de tokens cae a 1 o 2 tokens por segundo. Esperas, cancelas y te preguntas qué salió mal.

El problema: nadie te dijo que un modelo 70B con cuantización de 4 bits necesita aproximadamente 40 GB de memoria. Tus 8 GB VRAM son suficientes para un modelo 7B, no para 70B. Sin conocer los requisitos, compras a ciegas y el modelo no funciona o funciona desesperadamente lento. Exactamente eso es lo que este artículo quiere evitar.

Requisitos de hardware de Ollama explicados brevemente

Ollama necesita tres cosas: memoria suficiente para el modelo, potencia de cálculo suficiente para la inferencia y espacio en disco para los archivos del modelo. El factor más importante es la memoria. Un modelo debe caber en VRAM (con GPU) o en RAM del sistema (con CPU) para ejecutarse con velocidad aceptable. La regla general: un modelo con cuantización de 4 bits necesita aproximadamente 0,7 GB de memoria por cada mil millones de parámetros. Un modelo 7B requiere alrededor de 5 GB, un modelo 13B unos 9 GB.

GPU Offloading acelera masivamente la inferencia, pero solo es posible si el modelo o al menos la mayoría cabe en VRAM. El resto se desplaza a RAM del sistema y se calcula por CPU, lo que es significativamente más lento. Para más detalles teóricos, consulta Requisitos de RAM y VRAM y Cuantización.

Para quién es este artículo

Este artículo está dirigido a principiantes que quieren probar Ollama o expandir su setup. No necesitas ser informático para entender las tablas y recomendaciones. Si quieres profundizar más en los fundamentos, vale la pena echar un vistazo a Fundamentos de Hardware de IA.

Términos importantes relacionados con hardware de Ollama

TérminoSignificado
VRAMMemoria de vídeo en la tarjeta gráfica, crucial para inferencia en GPU
RAMMemoria de acceso aleatorio del sistema, usada en inferencia CPU u offloading de GPU
GPUTarjeta gráfica que acelera el cálculo del modelo
CPUProcesador principal, calcula el modelo cuando no hay GPU disponible o VRAM es insuficiente
SSDUnidad de estado sólido, mucho más rápida que HDD al cargar modelos
NVMeInterfaz SSD muy rápida, recomendada para modelos grandes
CuantizaciónCompresión de un modelo a, por ejemplo, 4 bits, reduce significativamente los requisitos de memoria
GPU OffloadingDescarga de capas del modelo a la GPU, acelera la inferencia
Unified MemoryMemoria compartida en Apple Silicon, comparte RAM y VRAM en un chip
OLLAMA_GPU_LAYERSVariable de entorno que controla cuántas capas del modelo se cargan en GPU

Requisitos mínimos

Para que Ollama funcione en absoluto, no necesitas mucho. Los requisitos mínimos absolutos:

  • CPU: Un procesador x86-64 moderno o Apple Silicon, al menos 4 núcleos
  • RAM: 8 GB, preferiblemente 16 GB, para no alcanzar el límite inmediatamente
  • Disco: 10 GB de espacio libre para Ollama mismo y un modelo pequeño
  • GPU: No es obligatorio, Ollama funciona también puramente en CPU
  • Sistema operativo: Linux, macOS o Windows

Con este mínimo puedes ejecutar modelos pequeños como qwen2.5:3b o phi3. La velocidad es moderada, pero funciona. Un modelo 7B se carga, pero será notablemente lento en un sistema puramente CPU con 8 GB RAM.

Hardware recomendado por tamaño de modelo

La siguiente tabla muestra cuánta VRAM y RAM necesitas para diferentes tamaños de modelo. Los valores se basan en cuantización de 4 bits, que Ollama usa por defecto.

Tamaño del modeloVRAM (GPU)RAM (solo CPU)GPU recomendadaRAM recomendada
3B3 GB6 GBNo obligatorio8 GB
7B5 GB10 GBRTX 3060 12 GB16 GB
8B6 GB12 GBRTX 3060 12 GB16 GB
13B9 GB18 GBRTX 4060 Ti 16 GB32 GB
30B20 GB36 GBRTX 4090 24 GB64 GB
70B40 GB72 GB2x RTX 4090128 GB

Estos valores son orientativos. El consumo real depende de la cuantización específica y la arquitectura. Un Mistral-7B necesita un poco menos que un Llama-3-8B, pero el orden de magnitud es correcto. Para más detalles sobre dimensionamiento, consulta Dimensionar hardware correctamente.

Ollama en CPU: ¿Qué es posible?

Ejecutar Ollama en una CPU es completamente legítimo, especialmente para modelos pequeños y pruebas. La velocidad depende en gran medida del procesador y el tamaño del modelo. Con una CPU moderna de 6 núcleos y 32 GB RAM logras estos valores:

  • Modelo 3B: 15 a 25 tokens por segundo, uso fluido
  • Modelo 7B: 5 a 10 tokens por segundo, aceptable para chat
  • Modelo 13B: 2 a 4 tokens por segundo, solo con paciencia
  • 30B y superiores: Menos de 1 token por segundo, prácticamente inutilizable

Si solo chateas ocasionalmente con un modelo 7B y no tienes GPU, solo CPU es una solución funcional. Para uso regular o modelos más grandes, vale la pena una GPU. Para más comparaciones, consulta CPU vs. GPU.

Ollama con GPU: ¿Qué tarjeta gráfica?

Una GPU acelera la inferencia muchas veces. La métrica más importante es VRAM, no la potencia de cálculo pura. Una RTX 3060 con 12 GB VRAM suele ser mejor para Ollama que una RTX 4060 con 8 GB, porque puede cargar completamente modelos más grandes en VRAM.

RTX 3060 12 GB: Recomendación de entrada. VRAM suficiente para modelos 7B y 8B con algo de margen. Costo alrededor de 300 euros en segunda mano. Logra 40 a 60 tokens por segundo en un modelo 7B.

RTX 4060 Ti 16 GB: Gama media con VRAM grande. Cabe completamente un modelo 13B en VRAM. Costo alrededor de 450 euros. Una buena opción si quieres ejecutar más que solo modelos pequeños.

RTX 4090 24 GB: High-end para usuarios serios. Maneja completamente modelos 30B y modelos 70B con offloading parcial a CPU. Costo desde 1700 euros. Logra más de 100 tokens por segundo en un modelo 7B.

Apple Silicon: Ve la siguiente sección, ya que aquí Unified Memory cambia los cálculos.

Más recomendaciones por presupuesto las encuentras en Asesoría de compra y en PC de IA para principiantes.

Ollama en Apple Silicon

Apple Silicon utiliza Unified Memory, lo que significa que la RAM y la VRAM son físicamente el mismo espacio de almacenamiento. Un Mac con 32 GB de RAM proporciona teóricamente casi 32 GB para modelos, menos el espacio que consume el sistema operativo y otros programas. Esto hace que los Macs sean particularmente atractivos para modelos grandes.

Mac Mini M4 con 24 GB: Ideal para modelos de 7B y 8B, funciona sin problemas a 30 o 50 tokens por segundo. Los modelos de 13B se ejecutan con velocidad reducida. Costo a partir de 700 euros.

Mac Studio M2 Max con 64 GB: Maneja completamente modelos de 30B en Unified Memory. Los modelos de 70B son posibles con algo de offloading. Costo a partir de 2200 euros.

MacBook Pro M4 Pro con 48 GB: Portátil y potente. Bueno para modelos de 13B y 30B. Costo a partir de 2000 euros.

La ventaja de Apple Silicon es que no necesitas comprar una GPU separada. La desventaja es el precio y el hecho de que las GPUs de Nvidia con VRAM comparable suelen ser más rápidas. Encontrarás más información sobre almacenamiento en RAM vs. VRAM.

Espacio en disco para modelos

Los modelos ocupan un espacio considerable. Ollama los almacena por defecto en ~/.ollama/models. El tamaño de un archivo de modelo corresponde aproximadamente a la memoria que necesita en tiempo de ejecución:

  • Modelo 3B: 2 a 3 GB
  • Modelo 7B: 4 a 5 GB
  • Modelo 13B: 7 a 9 GB
  • Modelo 30B: 17 a 20 GB
  • Modelo 70B: 38 a 42 GB

Si instalas varios modelos, la suma crece rápidamente. Se recomienda una SSD NVMe, ya que cargar un modelo de 70B desde un HDD puede tardar varios minutos. Con NVMe tarda segundos. Puedes cambiar la ubicación del almacenamiento mediante la variable de entorno OLLAMA_MODELS, más detalles en Configuración de Ollama.

Configuraciones recomendadas según presupuesto

Menos de 500 euros

Un PC o portátil existente con 16 GB de RAM y una SSD NVMe. Sin GPU separada. Ejecutas modelos de 3B y 7B en la CPU. La velocidad es moderada, pero funcional. Ideal para experimentar y aprender.

500 a 1000 euros

Un PC con 32 GB de RAM y una RTX 3060 de segunda mano con 12 GB. Ejecutas modelos de 7B y 8B completamente en la GPU y alcanzas 40 a 60 tokens por segundo. Los modelos de 13B son posibles con offloading parcial de CPU.

1000 a 2000 euros

Un PC con 64 GB de RAM y una RTX 4060 Ti de 16 GB o una RTX 4090 de segunda mano. Ejecutas modelos de 13B completamente en la GPU y modelos de 30B con offloading parcial. Esta configuración cubre la mayoría de casos de uso.

Más de 2000 euros

Un sistema con 128 GB de RAM y dos RTX 4090 o un Mac Studio con 64 GB de Unified Memory. Ejecutas modelos de 70B, aunque con offloading parcial. Esta configuración es para usuarios serios que utilizan modelos grandes regularmente.

¿Cómo compruebo si mi hardware es suficiente?

Antes de cargar un modelo, puedes verificar tu hardware. En Linux y Windows con GPU Nvidia:

nvidia-smi

Te muestra el consumo de VRAM y la utilización de la GPU. Después de iniciar un modelo, verifica cuánta VRAM ocupa:

ollama ps

Esto lista todos los modelos en ejecución con su consumo de memoria. En Linux, free -h muestra la RAM del sistema:

free -h

En macOS abre el Activity Monitor o usa en la terminal:

vm_stat

Si la VRAM está ocupada al 100% después de cargar un modelo y la producción de tokens sigue siendo lenta, Ollama descarga partes en la RAM. En este caso necesitas más VRAM o un modelo más pequeño.

Obstáculos típicos en los requisitos de hardware

  1. VRAM mal estimada: Muchos compran una GPU con 8 GB de VRAM y se sorprenden de que los modelos de 13B sean lentos. 8 GB son suficientes para 7B, no para 13B.

  2. Cuantización ignorada: Un modelo de 7B sin cuantizar necesita aproximadamente 14 GB, el mismo modelo en 4-bit solo 5 GB. Quién no conoce los valores por defecto, sobrestima o subestima masivamente la necesidad.

  3. RAM insuficiente: Incluso con CPU-only, la RAM del sistema necesita espacio para el sistema operativo. 16 GB de RAM con un modelo de 13B que requiere 9 GB deja solo 7 GB para todo lo demás. Esto puede llevar a swapping y ralentizaciones extremas.

  4. Disco duro lento: Cargar modelos desde un HDD tarda minutos en modelos grandes. No es un problema permanente, pero frustra al probar diferentes modelos.

  5. Faltan controladores de GPU: Ollama reconoce la GPU solo si los controladores están instalados correctamente. Sin controladores, todo se ejecuta en la CPU, aunque haya una GPU cara instalada.

  6. OLLAMA_GPU_LAYERS no establecido: Por defecto, Ollama intenta cargar tantas capas como sea posible en la GPU. Con algunos modelos ayuda limitar manualmente el número para evitar bloqueos con VRAM llena.

  7. Unified Memory en Apple Silicon olvidado: Un Mac con 16 GB de RAM no tiene 16 GB para modelos. El sistema operativo consume parte, realísticamente quedan 10 a 12 GB.

  8. Múltiples modelos simultáneamente: Si ejecutas dos modelos en paralelo, comparten la VRAM. Lo que cabe individualmente puede ser demasiado junto.

Hardware, costos y seguridad en Ollama

La IA local significa que tus datos permanecen en tu máquina. Sin llamadas a API a servidores externos, sin dependencia de la nube. Esta es una ventaja de seguridad, pero trae consigo la responsabilidad del hardware. Un sistema de 2000 euros para modelos de 70B solo vale la pena si los necesitas regularmente. Para uso ocasional, una configuración de 500 euros es suficiente.

Los costos de hardware son únicos, a diferencia de las APIs en la nube donde pagas por token. Con uso intensivo, una configuración local se amortiza rápidamente. La descripción general de Ollama te da un resumen de todas las funciones.

Enlaces y referencias sobre requisitos de hardware

FAQ: Requisitos de hardware de Ollama - Preguntas frecuentes

¿Puedo usar Ollama sin GPU?

Sí, Ollama se ejecuta completamente en la CPU. Los modelos pequeños hasta 7B son utilizables con velocidad moderada. Los modelos más grandes se vuelven muy lentos.

¿Cuánta VRAM necesito para un modelo de 7B?

Aproximadamente 5 GB con cuantización de 4-bit. Una RTX 3060 con 12 GB de VRAM tiene suficiente margen y es una opción sólida.

¿Son suficientes 8 GB de RAM para Ollama?

Para modelos pequeños como 3B sí. Para modelos de 7B es justo, especialmente si el sistema operativo también necesita RAM. 16 GB es el mínimo recomendado.

¿Se ejecuta un modelo de 70B en una sola RTX 4090?

No completamente. Un modelo de 70B necesita aproximadamente 40 GB, la RTX 4090 tiene 24 GB de VRAM. Ollama descarga el resto en la RAM del sistema, lo que reduce significativamente la velocidad.

¿Es Apple Silicon mejor que Nvidia para Ollama?

Con memoria comparable, Nvidia suele ser más rápido. Apple Silicon tiene la ventaja del Unified Memory, que permite modelos muy grandes sin necesidad de comprar varias GPUs.

¿Cuánto espacio en disco necesito?

Para cada modelo calcula 2 a 42 GB según el tamaño. Para varios modelos deberías tener al menos 100 GB de espacio libre en una SSD NVMe.

¿Qué es GPU-Offloading?

GPU-Offloading significa que partes del modelo se cargan en la GPU y el resto permanece en la RAM del sistema. Cuantas más capas quepan en la GPU, más rápido se ejecuta el modelo.

¿Necesito CUDA para Ollama?

En Linux con GPUs Nvidia sí, deben estar instalados los controladores CUDA. Ollama los reconoce automáticamente. En macOS y con CPU-only, CUDA no es necesario.

¿Puedo usar Ollama en un portátil?

Sí, si el portátil tiene suficiente RAM o VRAM. Los portátiles con GPU dedicada como una RTX 4060 son bien adecuados. Sin GPU, los modelos pequeños funcionan en la CPU.

¿Qué significa OLLAMA_GPU_LAYERS?

Es una variable de entorno que controla cuántas capas del modelo se cargan en la GPU. Con problemas de VRAM, puedes reducir el valor para evitar bloqueos.

¿Qué velocidad tiene Ollama en la CPU?

Con un modelo de 7B en una CPU moderna de 6 núcleos alcanzas aproximadamente 5 a 10 tokens por segundo. Es utilizable para chat, pero no fluido como con una GPU.

¿Vale la pena una GPU de segunda mano?

Sí, especialmente una RTX 3060 de 12 GB usada ofrece mucha VRAM por poco dinero. Asegúrate de que la tarjeta funciona y que los controladores están actualizados.

Fuentes y lecturas complementarias

  • Documentación oficial de Ollama
  • Documentación del Nvidia CUDA Toolkit
  • Documentación de Apple para Unified Memory
  • Valores prácticos obtenidos de mediciones propias con distintos modelos y configuraciones de hardware
Volver al blog
Share:

Entradas relacionadas