Skip to content
BotServBotServ
OllamaPC de IAAsesoramiento de compraGPUVRAMRAMAmazonIA local

PC para Ollama: Hardware óptima para modelos locales

¿Qué PC para Ollama? Recomendaciones de VRAM, RAM y GPU para inferencia fluida. De 7B a 70B con builds concretos.

S

schutzgeist

12 min read
PC para Ollama: Hardware óptima para modelos locales

PC para Ollama: Hardware óptima para modelos locales

Qué cubre este artículo sobre hardware para Ollama

  • Qué componentes de hardware realmente importan para una inferencia fluida con Ollama
  • Cuánto VRAM y RAM necesitas para modelos de 3B, 7B, 13B, 30B y 70B
  • Qué GPUs valen la pena para Ollama, desde la RTX 3060 hasta la RTX 4090
  • Cómo se comporta Apple Silicon como plataforma Ollama
  • Tres builds concretos con precios para cada presupuesto

Introducción: PC para Ollama explicado claramente

Ollama ha simplificado enormemente la ejecución local de modelos de lenguaje. Un solo comando basta para cargar e iniciar un modelo. La pregunta es solo: ¿en qué hardware? Quien ejecuta Ollama en una laptop común sin GPU a veces espera segundos por cada palabra. Con la tarjeta gráfica correcta, los mismos modelos funcionan con fluidez como un chatbot.

Este artículo explica qué PC tiene sentido para Ollama, cuánto VRAM y RAM necesitas para cada tamaño de modelo y qué builds se adaptan a diferentes presupuestos. Si te interesa la hardware de IA en general, encontrarás más recomendaciones en la sección Guía de compra.

¿Por qué necesito hardware especial para Ollama?

Ollama puede ejecutarse en cualquier computadora moderna. Pero eso no significa que sea rápido. Ejecutar un modelo de 7B como Llama 3.1 únicamente en CPU típicamente entrega 5 a 15 tokens por segundo. Se siente como escribir muy lentamente.

El mismo modelo en una RTX 3060 con 12 GB de VRAM alcanza 40 a 80 tokens por segundo. Es una diferencia que notas inmediatamente. La GPU realiza los cálculos de las capas del modelo, la CPU pasa a segundo plano. Una vez que el modelo cabe completamente en VRAM, la inferencia se vuelve realmente rápida.

La razón es simple: la inferencia de LLM está limitada por el ancho de banda de memoria. Una GPU como la RTX 4090 ofrece más de 1.000 GB/s de ancho de banda, mientras que la memoria DDR5 típica de workstation alcanza alrededor de 80 a 100 GB/s. Más ancho de banda significa más tokens por segundo. Encontrarás más detalles en el artículo CPU vs. GPU.

PC para Ollama en breve

Para Ollama necesitas principalmente dos cosas: suficiente almacenamiento para el modelo y ancho de banda suficiente para procesarlo rápidamente. Concretamente: una GPU con 12 GB de VRAM ejecuta modelos de 7B y 8B en cuantización Q4-K con fluidez. 24 GB de VRAM permiten modelos de 13B y parcialmente 30B. Quien quiera ejecutar modelos de 70B localmente necesita 48 GB de VRAM o más, o alternativamente una Mac con 64 GB de Unified Memory o superior.

RAM es el segundo factor importante. Si el modelo no cabe completamente en VRAM, Ollama descarga partes en la CPU. Funciona, pero se vuelve más lento. Como regla práctica: al menos la misma cantidad de RAM que de VRAM, mejor el doble. Más información en el artículo Requisitos de RAM y VRAM.

Para quién es este artículo

Este artículo va dirigido a principiantes e intermedio que planean o quieren actualizar un PC para Ollama. No necesitas ser experto en IA. Si sabes qué son RAM y VRAM, eso es suficiente. Quien recién comienza encontrará una visión más amplia en el artículo PC IA principiante.

Términos importantes sobre hardware para Ollama

TérminoSignificado
VRAMMemoria de video de la GPU. Decisivo para cuánto del modelo reside en la tarjeta gráfica.
RAMMemoria del sistema. Se utiliza cuando el modelo no cabe completamente en VRAM.
GPUTarjeta gráfica que acelera la inferencia. En Ollama, típicamente NVIDIA con CUDA.
CPUProcesador principal. Ejecuta capas del modelo que no caben en la GPU.
CuantizaciónReduce la precisión del modelo para ahorrar memoria. Más información en Cuantización.
GPU-OffloadingDesplaza capas del modelo de la CPU a la GPU. Detalles en el artículo GPU-Offloading.
OLLAMA_GPU_LAYERSVariable de entorno que especifica cuántas capas se desplazan a la GPU.
KV-CacheAlmacena valores de atención ya calculados durante la inferencia. Aumenta con el contexto.
Token/sMedida de velocidad: cuántos tokens se generan por segundo.
NVMeAlmacenamiento SSD rápido. Importante para tiempos de carga cortos al iniciar modelos grandes.

Requisitos de hardware de Ollama por modelo

La siguiente tabla muestra requisitos típicos para tamaños de modelo comunes en cuantización Q4-K. Los valores son orientativos, la necesidad concreta depende del modelo y el contexto.

Tamaño de modeloVRAM (Q4)RAM (Mínimo)GPU recomendada
3B3 a 4 GB8 GBRTX 3050, GPU integrada
7B5 a 6 GB16 GBRTX 3060 12 GB
8B6 a 7 GB16 GBRTX 3060 12 GB, RTX 4060
13B9 a 10 GB32 GBRTX 3060 12 GB, RTX 4070
30B20 a 22 GB32 GBRTX 3090 24 GB, RTX 4090
70B40 a 48 GB64 GB2x RTX 3090, Mac con 64 GB+

Quien quiera profundizar en los requisitos encontrará más en el artículo Requisitos de hardware de Ollama.

Ollama en CPU: ¿Qué es posible?

Ollama en CPU funciona, pero es lento. Modelos pequeños hasta 3B son aún utilizables en un procesador moderno, aproximadamente 10 a 20 tokens por segundo. Modelos de 7B alcanzan 5 a 15 tokens por segundo, dependiendo de la CPU y la velocidad de RAM. 13B y superior se vuelven incómodos, esperas varios segundos por cada oración.

Importante: incluso en CPU, RAM rápida ayuda. DDR5 con alta velocidad ofrece notablemente más velocidad que DDR4 más antiguo. Quien no tenga GPU debe planificar al menos 32 GB de RAM, preferiblemente 64 GB, para que incluso modelos más grandes puedan cargarse.

Ollama con GPU: ¿Qué tarjeta gráfica?

Una GPU dedicada es la mayor palanca para Ollama. Tarjetas NVIDIA con CUDA son el estándar, ya que la mayoría de modelos están optimizados para ellas.

  • RTX 3060 12 GB: La entrada en relación precio-rendimiento. 12 GB de VRAM son suficientes para 7B, 8B y 13B en Q4. Frecuentemente disponible de segunda mano a bajo precio.
  • RTX 4070 12 GB: Más rápida que la 3060, mismo VRAM. Buena si quieres más rendimiento por token.
  • RTX 4090 24 GB: High-end para entusiastas. 24 GB de VRAM permiten modelos de 30B completos, 70B solo con offloading a CPU.
  • Apple Silicon: No es una GPU clásica, pero Unified Memory convierte a las Macs en una plataforma Ollama potente. Más en la siguiente sección.

Quien combine múltiples GPUs puede sumar el VRAM. Dos RTX 3090 con 24 GB cada una dan 48 GB de VRAM, suficiente para modelos de 70B en Q4. Esta es una configuración popular en el mercado de segunda mano.

Ollama en Apple Silicon

Apple Silicon es una plataforma muy interesante para Ollama. El enfoque de Unified Memory significa que CPU y GPU comparten la misma memoria. Una Mac con 64 GB de Unified Memory puede usar una gran parte como VRAM. Esto no es posible en PCs clásicos con GPU dedicada.

  • Mac mini M4 con 24 GB: Buena para 7B y 8B, ajustada para 13B.
  • Mac Studio M2 Ultra con 128 GB: Ejecuta modelos de 70B en Q4 fluidamente, una de las soluciones más compactas para modelos grandes.
  • MacBook Pro M4 Pro con 48 GB: Portátil y potente, buena para 13B y 30B.

Desventaja: Apple Silicon es cara y no actualizable. Si posteriormente quieres más memoria, necesitas un dispositivo nuevo. A cambio, las Macs son silenciosas, eficientes y compactas.

Hardware recomendada en Amazon

Hardware para Ollama en Amazon

Bei Amazon ansehen

Affiliate-Link: Bei einem Kauf erhalten wir möglicherweise eine Provision.

Propuestas de configuraciones para Ollama

Configuración 1: Presupuesto, aproximadamente 600 a 800 EUR

  • CPU: AMD Ryzen 5 5600 o Intel Core i5-12400F
  • RAM: 32 GB DDR4
  • GPU: RTX 3060 12 GB (usada o nueva)
  • Almacenamiento: 1 TB NVMe SSD
  • Fuente de alimentación: 550 W, 80+ Bronze

Esta configuración ejecuta modelos de 7B y 8B sin problemas. Los modelos de 13B caben justamente en VRAM con cuantización Q4. Perfecta para comenzar y experimentar con agentes.

Configuración 2: Rango medio, aproximadamente 1.200 a 1.800 EUR

  • CPU: AMD Ryzen 5 7600 o Intel Core i5-13600K
  • RAM: 64 GB DDR5
  • GPU: RTX 4070 12 GB o RTX 3090 24 GB usada
  • Almacenamiento: 2 TB NVMe SSD
  • Fuente de alimentación: 750 W, 80+ Gold

Con 24 GB de VRAM (RTX 3090), los modelos de 13B y 30B funcionan bien. Los 64 GB de RAM te dan margen para offloading y procesos paralelos. Una máquina versátil para trabajar en serio con IA local.

Configuración 3: High-End, aproximadamente 3.000 a 5.000 EUR

  • CPU: AMD Ryzen 9 7950X o Intel Core i9-14900K
  • RAM: 128 GB DDR5
  • GPU: 2x RTX 4090 24 GB o 2x RTX 3090 24 GB
  • Almacenamiento: 4 TB NVMe SSD
  • Fuente de alimentación: 1.200 W, 80+ Platinum

Con 48 GB de VRAM puedes ejecutar modelos de 70B en Q4. Los 128 GB de RAM aseguran que contextos largos y múltiples modelos en paralelo no sean problema. Si quieres exprimir al máximo Ollama, esta es tu opción.

Consejos de rendimiento para Ollama

  • Maximizar capas en GPU: Configura OLLAMA_GPU_LAYERS con un valor alto o -1 para que Ollama traslade tantas capas como sea posible a la GPU. Los detalles de configuración los encuentras en Ollama Konfiguration.
  • Elegir cuantización: Q4_K_M es un estándar sólido. Q8 es más preciso pero consume significativamente más VRAM. Q3 ahorra espacio pero pierde calidad.
  • Limitar longitud de contexto: El KV-cache crece con el contexto. Un contexto de 32k tokens puede consumir varios GB de VRAM adicionales. Reduce el contexto si necesitas más velocidad.
  • NVMe en lugar de SSD SATA: Los modelos grandes cargan más rápido desde una NVMe. Esto ahorra tiempo al iniciar y al cambiar entre modelos.
  • Cerrar otras aplicaciones: Los navegadores con muchas pestañas y otras apps compiten por RAM y VRAM. Ciérralas antes de cargar modelos grandes.

Trampas comunes con hardware para Ollama

  • VRAM insuficiente: Si tienes exactamente 8 GB de VRAM y quieres cargar un modelo de 8B en Q8, te llevarás una decepción. Q4 cabe, Q8 no. Siempre planifica un margen para el KV-cache.
  • Olvidar la RAM: Cuando el modelo no cabe en VRAM, Ollama necesita RAM. Con 16 GB de RAM y una GPU de 12 GB, rápidamente alcanzas el límite con modelos de 13B.
  • Subestimar CPU-offloading: Si solo parte de las capas caben en GPU, la inferencia se vuelve significativamente más lenta. Un modelo de 30B con la mitad en CPU es frustrante.
  • Fuente de alimentación insuficiente: Dos RTX 3090 consumen más de 700 W bajo carga solo ellas. Una fuente débil causa cuelgues o apagones.
  • Carcasa demasiado pequeña: Las GPUs grandes no caben en cualquier carcasa. Mide con anticipación, especialmente con configuraciones de dual-GPU.
  • Refrigeración deficiente: Dos GPUs en una carcasa compacta se calientan mucho. El control de ventiladores y el flujo de aire son críticos, de lo contrario la tarjeta reduce su velocidad.
  • Memoria no actualizable en Apple Silicon: Si compras un Mac con 16 GB, después quedarás atrapado. Planifica con anticipación qué tamaños de modelo quieres ejecutar.
  • GPUs AMD con ROCm: Ollama soporta AMD, pero CUDA está mejor optimizado. Si valoras máxima compatibilidad, elige NVIDIA.

Hardware, costos y seguridad en Ollama

La inferencia local con Ollama significa que tus datos nunca salen de tu computadora. Eso es una gran ventaja frente a servicios en la nube. Chats, prompts y contextos permanecen en tu disco duro.

En términos de costos, el hardware es una inversión única sin costos de API posteriores. Una configuración de 800 EUR se amortiza rápidamente si trabajas regularmente con modelos grandes. Debes considerar el consumo eléctrico: una RTX 4090 consume hasta 450 W bajo carga, y dos consumen significativamente más.

En cuanto a seguridad: los modelos de fuentes desconocidas pueden contener código malicioso. Descarga modelos solo de repositorios confiables como la biblioteca oficial de Ollama o Hugging Face con usuarios verificados.

Enlaces y recursos adicionales sobre hardware de Ollama

FAQ: PC para Ollama - Preguntas frecuentes

¿Qué GPU necesito para Ollama?

Para modelos de 7B y 8B basta una RTX 3060 con 12 GB de VRAM. Para 13B se recomiendan 12 a 24 GB de VRAM, para 30B al menos 24 GB. Los modelos de 70B requieren 48 GB de VRAM o más.

¿Puedo usar Ollama sin GPU?

Sí, Ollama funciona en CPU. Pero la velocidad es considerablemente menor. Los modelos de 7B alcanzan 5 a 15 tokens por segundo, los modelos más grandes se vuelven incómodos.

¿Cuánta RAM necesito para Ollama?

Mínimo 16 GB para modelos pequeños en CPU. Se recomiendan 32 GB para 7B a 13B y 64 GB o más para 30B y 70B. Si el modelo no cabe en VRAM, Ollama usa RAM como almacenamiento temporal.

¿Es suficiente una RTX 3060 para Ollama?

Sí, la RTX 3060 con 12 GB de VRAM es un excelente punto de partida. Ejecuta modelos de 7B, 8B y 13B en cuantización Q4-K sin problemas. Para 30B es ajustado, aquí el offloading a CPU ayuda.

¿Vale la pena una RTX 4090 para Ollama?

Para entusiastas, sí. Los 24 GB de VRAM permiten modelos de 30B completos y 70B con offloading. Si quieres máximo rendimiento, la 4090 es la opción correcta. Para principiantes es excesiva.

¿Es bueno Apple Silicon para Ollama?

Sí, especialmente por su memoria unificada. Un Mac Studio con 128 GB puede ejecutar modelos de 70B, algo difícil con una sola tarjeta gráfica. La desventaja es el precio y la imposibilidad de actualizar.

¿Qué es GPU-offloading en Ollama?

GPU-offloading traslada capas del modelo de CPU a GPU. Cuantas más capas quepan en GPU, más rápida es la inferencia. La variable de entorno OLLAMA_GPU_LAYERS controla cuántas capas se trasladan.

¿Puedo usar múltiples GPUs para Ollama?

Sí, Ollama soporta múltiples GPUs. La VRAM se suma. Dos RTX 3090 con 24 GB cada una dan 48 GB de VRAM, suficiente para modelos de 70B en Q4. Ten cuidado con la fuente y refrigeración.

¿Qué significa cuantización en Ollama?

La cuantización reduce la precisión de los pesos del modelo para ahorrar memoria. Q4_K_M es un buen equilibrio entre tamaño y calidad. Q8 es más preciso pero requiere aproximadamente el doble de VRAM que Q4.

¿Qué tan rápido es Ollama en CPU?

En una CPU moderna, alcanzas aproximadamente 5 a 15 tokens por segundo con modelos de 7B. Los modelos de 3B llegan a 10 a 20 tokens por segundo. Con 13B y mayores se vuelve lento, frecuentemente por debajo de 5 tokens por segundo.

¿Necesito una NVMe SSD para Ollama?

No es obligatorio, pero se recomienda. Los modelos grandes cargan significativamente más rápido desde una NVMe que desde una SSD SATA. Al cambiar entre modelos ahorras tiempo notablemente.

¿Ollama funciona con tarjetas gráficas AMD?

Sí, Ollama soporta AMD a través de ROCm. Pero la compatibilidad no es tan amplia como con NVIDIA y CUDA. Si quieres estar seguro, elige una GPU NVIDIA.

Fuentes y lecturas adicionales

Volver al blog
Share:

Entradas relacionadas