Skip to content
BotServBotServ
RAMVRAMHardware de IATamaño de modeloCuantizaciónRequisitos de hardware

Requisitos de RAM y VRAM

¿Cuánta RAM y VRAM necesitan los modelos de IA locales? Guía por tamaño, cuantización y caso de uso.

S

schutzgeist

20 min read
Requisitos de RAM y VRAM

Requisitos de RAM y VRAM

Qué cubre este artículo

  • Cuánta RAM y VRAM necesitas realmente para los modelos de IA típicos
  • Una fórmula clara que puedes usar para calcular el consumo de memoria por tu cuenta
  • Cálculos concretos de ejemplo para Llama 3.1 8B, Qwen 2.5 14B y Llama 3.1 70B
  • Hardware recomendado según presupuesto, desde menos de 500 EUR hasta más de 2000 EUR
  • Los errores más comunes que impiden que tu modelo se ejecute

Introducción: Requisitos de RAM y VRAM explicados

Antes de ejecutar un modelo de IA de forma local, necesitas saber si tu hardware es suficiente. La pregunta fundamental es: cuánta memoria necesita el modelo durante su ejecución. RAM y VRAM juegan un papel central aquí. Cuanto más grande sea el modelo y más largo el contexto, más memoria se requiere.

¿Por qué es tan importante? Porque la memoria es el cuello de botella número uno en IA local. Puedes tener el procesador más rápido y la tarjeta gráfica más cara; si la memoria no es suficiente, el modelo no arranca o se detiene a mitad de ejecución. A diferencia de los servicios en la nube, donde simplemente pagas más, en IA local estás limitado por los recursos físicos de tu hardware. Exactamente estos límites es lo que queremos entender en este artículo.

Si eres nuevo en este tema, lee primero Qué es IA local. Este artículo se basa en ese contenido y profundiza en los requisitos de hardware.

¿Por qué necesito conocer estos requisitos?

Imagina que compras una computadora por 2000 EUR. Te has asesorado bien, elegiste una CPU potente, instalaste una tarjeta gráfica elegante con 8 GB de VRAM y 32 GB de RAM en el sistema. Cuando llegas a casa, quieres ejecutar Llama 3.1 70B porque leíste en internet que es un modelo excelente. Inicias Ollama, cargas el modelo, y entonces sucede: la salida se detiene, tarda una eternidad, o el modelo no carga en absoluto.

¿Qué pasó? El modelo 70B necesita alrededor de 40 GB de almacenamiento incluso con la cuantización más agresiva. Tu tarjeta gráfica tiene 8 GB de VRAM, de los cuales quizá queden 7 GB después del sistema operativo. El modelo debe recurrir al RAM del sistema, que es mucho más lento. La CPU realiza los cálculos en lugar de la GPU, y en lugar de 30 tokens por segundo, obtienes quizá 1 o 2 tokens por segundo. Los 2000 EUR fueron bien invertidos para gaming, pero no para un modelo 70B.

Si hubieras calculado con anticipación, sabrías que un modelo 70B requiere una tarjeta gráfica con 24 GB de VRAM o más, idealmente dos, o una Mac con Apple Silicon con 64 GB de Unified Memory. Con ese conocimiento, habrías planeado el hardware de otra forma o elegido un modelo más pequeño como Llama 3.1 8B, que funciona sin problemas en tu tarjeta.

Este es el punto: cuando conoces los requisitos, tomas la decisión de compra correcta. Si no los conoces, arriesgas que tu computadora cara sea inútil para tu propósito real.

Requisitos de RAM y VRAM en breve

RAM es la memoria de trabajo de tu computadora, VRAM es la memoria de video en una tarjeta gráfica dedicada. Los modelos de IA pueden ejecutarse en ambas. Las GPUs con VRAM suficiente son significativamente más rápidas porque soportan procesamiento paralelo masivo. Si falta VRAM, el modelo puede ejecutarse en RAM del sistema o en la CPU, pero será notablemente más lento.

Como regla general, un modelo cuantizado de 7B requiere alrededor de 4 a 8 GB de memoria. Un modelo 13B necesita 8 a 16 GB. Un modelo 70B requiere 40 GB o más según la cuantización. Además viene la memoria para el KV-cache, que crece con la longitud del contexto.

El número más importante que debes recordar: toma el tamaño del modelo en miles de millones de parámetros, divídelo entre 2, y tienes el requisito de memoria en GB para FP16. Para Q4_K_M, toma aproximadamente una cuarta parte a un tercio de eso. Es una aproximación tosca, pero te da una orientación inicial antes de profundizar en los detalles.

¿Para quién es este artículo?

Este artículo está dirigido a principiantes que ejecutan un modelo de IA localmente por primera vez y no están seguros de que su hardware sea suficiente. También es interesante si planeas comprar o actualizar una computadora para IA local y quieres saber con anticipación qué realmente necesitas. No requieres conocimiento previo en IA o hardware; explicamos todo paso a paso.

Si ya sabes qué son la cuantización y el KV-cache, puedes ir directamente a las tablas y cálculos de ejemplo. Si no, sin problema; las siguientes secciones te cubren.

Términos importantes sobre requisitos de RAM y VRAM

TérminoSignificado
RAMMemoria de trabajo de la computadora, usada para ejecución basada en CPU
VRAMMemoria en la tarjeta gráfica, mucho más rápida para inferencia de IA
GPUProcesador gráfico, acelera la inferencia de IA mediante núcleos de cálculo paralelos
CPUProcesador principal de la computadora, ejecuta el modelo si no hay GPU disponible o VRAM se llena
Requisito de memoriaRAM o VRAM necesarios durante la ejecución de un modelo
KV-CacheBuffer para valores de attention ya calculados, crece con la longitud del contexto
CuantizaciónReducción de la precisión numérica de los pesos del modelo, disminuye el requisito de memoria
GPU OffloadingPartes del modelo se ejecutan en la GPU, el resto en RAM del sistema
Unified MemoryApple Silicon comparte RAM entre CPU y GPU, no requiere VRAM separado

Más sobre cuantización en el artículo Cuantización, más sobre longitud de contexto y su impacto en el KV-cache en Longitud de contexto.

¿Cómo se calcula el requisito de memoria?

El requisito total de memoria al ejecutar un modelo se compone de tres partes:

  1. Pesos del modelo: Este es el almacenamiento real del modelo. Depende del número de parámetros y de la cuantización.
  2. KV-Cache: Buffer para el cálculo de attention, crece con la longitud del contexto.
  3. Overhead: Espacio para el sistema operativo, otros programas en ejecución e internals del framework.

Fórmula para los pesos del modelo

La fórmula básica para los pesos del modelo es:

Memoria (GB) = Número de parámetros × Bytes por parámetro / 1024^3

En FP16 son 2 bytes por parámetro, en Q8_0 aproximadamente 1 byte, en Q5_K_M aproximadamente 0,7 bytes y en Q4_K_M aproximadamente 0,55 bytes.

Ejemplo FP16, modelo 7B:

7.000.000.000 × 2 / 1024^3 = aprox. 13 GB

Ejemplo Q4_K_M, modelo 7B:

7.000.000.000 × 0,55 / 1024^3 = aprox. 3,6 GB

Fórmula para el KV-Cache

El KV-Cache crece con la longitud del contexto. Una aproximación tosca para un modelo típico:

KV-Cache (GB) = 2 × Número de capas × Dimensión × Longitud de contexto × 2 bytes / 1024^3

Para Llama 3.1 8B con 32 capas, dimensión 4096 y contexto de 4096 tokens:

2 × 32 × 4096 × 4096 × 2 / 1024^3 = aprox. 2 GB

Con un contexto de 32.768 tokens, el mismo cache crece a aproximadamente 16 GB. Esto muestra cuán importante es la longitud del contexto para el requisito de memoria.

Overhead

Planifica aproximadamente 2 a 4 GB para el sistema operativo e internals del framework. En Windows con navegador y otras aplicaciones, puede ser 4 a 6 GB. Si no estás seguro, usa 4 GB como buffer.

Fórmula general

Requerimiento total = Pesos del modelo + KV-Cache + Overhead

Esta fórmula es simplificada, pero ofrece una estimación práctica. En la realidad hay variaciones menores según el framework, pero para decidir una compra es suficiente.

Requisitos de memoria según el tamaño del modelo

La siguiente tabla muestra el consumo de memoria solo para los pesos del modelo, sin KV-Cache ni overhead. Los valores están redondeados y se refieren a cuantizaciones GGUF típicas.

Tamaño del modeloQ4_K_MQ5_K_MQ8_0FP16
7Bca. 4 GBca. 5 GBca. 7 GBca. 14 GB
8Bca. 5 GBca. 6 GBca. 8 GBca. 16 GB
13Bca. 8 GBca. 9 GBca. 13 GBca. 26 GB
30Bca. 18 GBca. 21 GBca. 31 GBca. 60 GB
70Bca. 40 GBca. 45 GBca. 70 GBca. 140 GB

Estos valores corresponden solo al modelo en sí. Para el KV-Cache y el sistema operativo debes reservar un colchón adicional, consulta la siguiente sección.

¿Qué más se suma al modelo?

Los pesos del modelo son solo una parte. Otros tres factores determinan cuánta memoria se consume realmente.

KV-Cache

El KV-Cache almacena los valores de atención ya calculados, para que el modelo no tenga que recalcular todo el contexto en cada token nuevo. Crece de forma lineal con la longitud del contexto. Con contextos cortos de 2048 tokens es negligible, pero con 32.768 tokens puede ocupar varios gigabytes en modelos grandes.

Para un uso típico con contexto de 8192 tokens, reserva entre 1 y 4 GB adicionales según el tamaño del modelo. Con 32.768 tokens, el KV-Cache de un modelo 70B puede crecer a 20 GB o más.

Sistema operativo y otras aplicaciones

Tu sistema operativo consume memoria por sí solo. En Windows, con navegador y procesos de fondo fácilmente llegan a 4 o 6 GB. En Linux necesitas entre 1 y 2 GB. Si programas, editas documentos u otros programas están abiertos simultáneamente, eso se suma.

¿Cuánto colchón debes reservar?

Como regla práctica: suma el requerimiento de los pesos del modelo, añade el KV-Cache para tu longitud de contexto deseada y reserva un 20 por ciento adicional de buffer. Así te aseguras de que el modelo no funcione al límite y tengas espacio para otras aplicaciones.

Ejemplo: un modelo 8B en Q4_K_M necesita 5 GB. KV-Cache para 8192 tokens aproximadamente 2 GB. Overhead 4 GB. Total: 11 GB. Con un 20 por ciento de buffer llegas a unos 13 GB. Una tarjeta gráfica de 12 GB VRAM será justa, una de 16 GB es cómoda.

Ejemplos de cálculo

Tres casos concretos que responden preguntas típicas.

Ejemplo 1: Quiero ejecutar Llama 3.1 8B

Llama 3.1 8B en Q4_K_M necesita aproximadamente 5 GB para los pesos del modelo. Para una longitud de contexto de 8192 tokens, se suma aproximadamente 2 GB de KV-Cache. El overhead del sistema operativo y framework es de unos 4 GB.

5 GB (modelo) + 2 GB (KV-Cache) + 4 GB (overhead) = 11 GB

Con un 20 por ciento de buffer: aproximadamente 13 GB. Necesitas una tarjeta gráfica de al menos 12 GB VRAM, preferentemente 16 GB, o un equipo con al menos 16 GB RAM para ejecución en CPU. Con 16 GB RAM funciona, con 32 GB RAM estás tranquilo.

Hardware recomendado: RTX 3060 de 12 GB para ejecución en GPU, o un equipo con 32 GB RAM para ejecución en CPU. Un Mac Mini M4 con 24 GB de Unified Memory lo maneja sin problemas.

Ejemplo 2: Quiero ejecutar Qwen 2.5 14B

Qwen 2.5 14B en Q4_K_M necesita aproximadamente 9 GB para los pesos del modelo. KV-Cache para 8192 tokens aproximadamente 3 GB. Overhead 4 GB.

9 GB (modelo) + 3 GB (KV-Cache) + 4 GB (overhead) = 16 GB

Con un 20 por ciento de buffer: aproximadamente 19 GB. Necesitas una tarjeta gráfica con al menos 24 GB VRAM para ejecución pura en GPU, o utiliza GPU offloading con una tarjeta de 16 GB y descarga el resto en la RAM del sistema. Para esto necesitas al menos 32 GB RAM en el sistema.

Hardware recomendado: RTX 4090 de 24 GB para ejecución pura en GPU, o RTX 4060 Ti de 16 GB con 32 GB de RAM del sistema para GPU offloading. Un Mac Studio con 64 GB de Unified Memory lo maneja cómodamente.

Ejemplo 3: Quiero ejecutar Llama 3.1 70B

Llama 3.1 70B en Q4_K_M necesita aproximadamente 40 GB para los pesos del modelo. KV-Cache para 8192 tokens aproximadamente 8 GB. Overhead 4 GB.

40 GB (modelo) + 8 GB (KV-Cache) + 4 GB (overhead) = 52 GB

Con un 20 por ciento de buffer: aproximadamente 62 GB. Esto ya no es posible con una sola GPU para consumidor. Necesitas dos RTX 4090 con 24 GB VRAM cada una, o un Mac Apple Silicon con al menos 64 GB de Unified Memory, preferentemente 128 GB.

Hardware recomendado: Mac Studio M2 Ultra con 128 GB de Unified Memory, o dos RTX 4090 en una carcasa workstation. Alternativamente, un setup en la nube, pero eso sale del alcance de la IA local.

Hardware recomendado según presupuesto

PresupuestoQué es posibleModelos recomendados
menos de 500 EUREjecución en CPU con equipo existente, 16 GB RAM7B a 8B en Q4_K_M, lento pero usable
500 a 1000 EUREquipo con 32 GB RAM o GPU usada con 8 a 12 GB VRAM7B a 13B en Q4_K_M, ejecución en GPU posible
1000 a 2000 EUREquipo con RTX 3060 de 12 GB o RTX 4060 Ti de 16 GB, 32 GB RAM8B a 14B en Q4_K_M, salida fluida
más de 2000 EURRTX 4090 de 24 GB o Mac Studio con 64 GB de Unified Memory30B en Q4_K_M, 70B con offloading posible

Esta tabla es orientativa. La selección exacta depende de si compras nuevo o actualizas, y qué modelos usarás principalmente. Encontrarás más detalles en la Guía de compra y en el artículo PC IA para principiantes.

Recomendaciones Apple Silicon

Apple Silicon tiene una gran ventaja para IA local: Unified Memory. CPU y GPU comparten el mismo memoria, no hay VRAM separada. Eso significa que un Mac con 64 GB RAM tiene efectivamente 64 GB de almacenamiento para modelos de IA, restando el sistema operativo. Con GPUs para consumidor de Nvidia no se logra esto, ya que la GPU para consumidor más grande tiene 24 GB VRAM.

Mac Mini M4

El Mac Mini M4 es la entrada más económica a Apple Silicon para IA local. Con 24 GB de Unified Memory ejecuta sin problemas modelos 7B y 8B en Q4_K_M, también Q8_0 es posible. Los modelos 13B en Q4_K_M también funcionan. Los modelos más grandes se vuelven ajustados.

Con 32 GB de Unified Memory ejecutas modelos 14B en Q4_K_M cómodamente y modelos 30B con algo de offloading. El Mac Mini M4 es la mejor opción para principiantes si no quieres gastar mucho pero aun así trabajar fluidamente.

Mac Studio

El Mac Studio M2 Max con 64 GB de Unified Memory ejecuta sin problemas modelos 30B en Q4_K_M y modelos 70B en Q4_K_M con algo de paciencia. El Mac Studio M2 Ultra con 128 GB de Unified Memory ejecuta modelos 70B en Q5_K_M o Q8_0, siendo la solución para consumidor más potente para IA local que existe actualmente.

La desventaja de Apple Silicon es la velocidad comparada con GPUs Nvidia. En modelos que caben completamente en el VRAM de una RTX 4090, la 4090 es considerablemente más rápida. Solo con modelos que no caben en 24 GB VRAM, Apple Silicon muestra su fortaleza.

Recomendaciones de GPU

RTX 3060 12 GB

La RTX 3060 con 12 GB VRAM es la ganadora en relación precio-rendimiento para principiantes. Cuesta menos de 300 EUR usada y ejecuta sin problemas modelos 7B y 8B en Q4_K_M y Q5_K_M. Los modelos 13B en Q4_K_M también caben, Q8_0 se vuelve ajustado. Para 30B y superiores no es suficiente.

RTX 4060 Ti 16 GB

La RTX 4060 Ti con 16 GB de VRAM es el siguiente escalón. Cuesta alrededor de 450 EUR nuevas y ofrece suficiente espacio para modelos de 13B y 14B en Q4_K_M y Q5_K_M. Los modelos de 8B funcionan también en Q8_0 o FP16. Para modelos de 30B te basta con descarga a RAM del sistema, pero será lento.

RTX 4090 24 GB

La RTX 4090 con 24 GB de VRAM es la GPU consumer más potente de Nvidia. Cuesta alrededor de 1800 EUR nuevas y ejecuta modelos de 30B en Q4_K_M completamente en VRAM, lo que permite una salida muy fluida. Los modelos de 70B en Q4_K_M requieren descarga a RAM del sistema, se vuelven más lentos, pero siguen siendo utilizables. Para usar 70B sin compromisos necesitas dos 4090 o Apple Silicon con 128 GB.

Más información sobre selección de GPU y conceptos básicos de hardware la encontrarás en KI-Hardware Grundlagen y en el artículo RAM vs. VRAM.

¿Cómo compruebo mi memoria actual?

Antes de cargar un modelo, deberías saber cuánta memoria tienes disponible. Tres comandos te ayudarán.

Verificar VRAM en GPUs Nvidia

Abre una terminal e introduce:

nvidia-smi

Esto te muestra una tabla con todas tus GPUs Nvidia, su VRAM total y la memoria actualmente ocupada. Fíjate en la columna Memory-Usage. Lo que esté libre allí es lo que tu modelo puede usar.

Verificar modelos en ejecución en Ollama

Si usas Ollama, puedes ver qué modelos están cargados y cuánta memoria ocupan:

ollama ps

Esto muestra una tabla con el nombre del modelo, tamaño, porción de VRAM y estado. Así ves de inmediato si un modelo está completamente en VRAM o parcialmente en RAM del sistema.

Verificar RAM del sistema

En Linux:

free -h

En Windows abre el Administrador de tareas con Strg+Shift+Esc y consulta la memoria bajo la pestaña Rendimiento. En macOS abre el Monitor de Actividad y revisa la sección Memoria.

Así siempre sabes dónde estás antes de iniciar un modelo.

Errores comunes en requisitos de RAM y VRAM

  1. VRAM calculada muy ajustado: Planeas exactamente el consumo de memoria del modelo pero olvidas el KV-cache y el overhead. El modelo inicia pero falla con contextos más largos. Siempre prevé un búfer del 20 por ciento.

  2. Longitud de contexto subestimada: Un modelo con 8192 tokens de contexto necesita mucho menos KV-cache que el mismo modelo con 32.768 tokens. Si procesas documentos largos, el KV-cache puede duplicar el consumo de memoria.

  3. Sistema operativo no considerado: En Windows, el sistema con navegador y procesos de fondo consume rápidamente 4 a 6 GB. Si tu tarjeta gráfica tiene 12 GB de VRAM, efectivamente te quedan solo 6 a 8 GB para el modelo.

  4. Cuantización incorrecta elegida: Q8_0 consume el doble de memoria que Q4_K_M, a menudo con solo una calidad mínimamente mejor. Si la memoria es escasa, elige Q4_K_M en lugar de Q8_0.

  5. Descarga a GPU no entendida: Si el modelo no cabe completamente en VRAM, Ollama descarga partes a RAM del sistema. Funciona, pero es más lento. Necesitas suficiente RAM del sistema para alojar el resto.

  6. FP16 usado en el día a día: FP16 consume cuatro veces más memoria que Q4_K_M, sin que la calidad mejore notablemente en la práctica. FP16 es relevante para entrenamiento y fine-tuning, para pura inferencia Q4_K_M o Q5_K_M es la mejor opción.

  7. Memoria de Apple Silicon mal evaluada: En Apple Silicon, CPU y GPU comparten memoria. Un Mac con 32 GB Unified Memory no tiene 32 GB de VRAM, sino 32 GB menos sistema operativo menos otras aplicaciones. Prevé búfer aquí también.

Hardware, costos y seguridad en requisitos de RAM y VRAM

El inicio más sencillo es con hardware existente. Si ya tienes un ordenador con 16 GB de RAM o más, puedes empezar a probar directamente con modelos cuantizados pequeños. Si quieres invertir deliberadamente en hardware, deberías tener clara la tamaño de modelo deseado y longitud de contexto.

Los costos escalan con la GPU. Las GPUs consumer con 12 o 24 GB de VRAM son baratas comparadas con estaciones de trabajo. Las estaciones de trabajo GPU high-end o servidores con múltiples GPUs se vuelven rápidamente caros. Apple Silicon ofrece una buena relación precio-rendimiento si quieres ejecutar modelos que requieren más de 24 GB de memoria, porque Unified Memory es significativamente más barato que múltiples GPUs Nvidia.

Desde la perspectiva de seguridad, la gran ventaja de la IA local es que no necesitan salir datos de casa, sin importar cuánto hardware haya en tu ordenador. Tus prompts, tus documentos, tus resultados permanecen en tu máquina. Esto es especialmente relevante para datos sensibles de trabajo o investigación. Más sobre operación segura de IA local lo encuentras en el artículo LLM lokal betreiben.

Enlaces adicionales e información sobre requisitos de RAM y VRAM

FAQ - Preguntas típicas sobre RAM y VRAM

¿Puedo usar un modelo si tengo menos memoria de la recomendada?

Sí, a menudo funciona, solo que más lentamente. Ollama y otras herramientas descargan partes del modelo a RAM del sistema si VRAM no es suficiente. Para uso fluido deberías seguir las recomendaciones, sino la salida será notablemente lenta.

¿Cuánto VRAM necesito para Llama 3.1 8B?

Para la variante Q4_K_M bastan aproximadamente 6 a 8 GB de VRAM incluyendo KV-cache y búfer. Para Q5_K_M deberían ser 8 a 10 GB, para Q8_0 más bien 12 GB. Con 16 GB de VRAM estás seguro para todas las cuantizaciones.

¿Funciona Ollama en Apple Silicon?

Sí. Apple Silicon con Unified Memory es muy popular para IA local porque RAM y memoria GPU se comparten. Un Mac con 16 o 24 GB de RAM es adecuado para modelos pequeños a medianos, un Mac Studio con 64 GB o más puede con modelos grandes.

¿Qué es mejor: más RAM o más VRAM?

Para operación rápida, VRAM en una GPU dedicada es mejor porque la GPU procesa el modelo en paralelo. Más RAM ayuda cuando la GPU no es suficiente y partes del modelo se descargan a RAM del sistema. Ideal es tener ambos, suficiente VRAM para el modelo y suficiente RAM como búfer.

¿Necesito dos GPUs para modelos grandes?

No necesariamente. Con cuantizaciones fuertes, modelos grandes caben en una sola GPU consumer si tiene 24 GB de VRAM. Para FP16 o Q8_0 con 70B o más necesitas más VRAM, es decir múltiples GPUs o Apple Silicon con Unified Memory grande.

¿Qué pasa cuando VRAM está lleno?

El framework descarga las partes sobrantes del modelo a RAM del sistema. El modelo sigue ejecutándose, pero las partes en RAM del sistema se calculan por CPU, lo que es significativamente más lento. Lo notarás en una tasa más baja de tokens por segundo.

¿Cuánto RAM necesito mínimo para IA local?

Para modelos pequeños como 7B en Q4_K_M bastan 16 GB de RAM en operación CPU. Para trabajo fluido con descarga a GPU deberías tener 32 GB de RAM. Para modelos grandes a partir de 30B se recomiendan 64 GB de RAM o más.

¿Basta una tarjeta gráfica integrada para IA local?

Para modelos muy pequeños y experimentos sí, pero el rendimiento es notablemente peor que con una GPU dedicada. Las tarjetas gráficas integradas comparten memoria con RAM del sistema y tienen pocos núcleos de cálculo propios. Para uso serio se recomienda una GPU dedicada.

¿Cómo influye la longitud de contexto en el consumo de memoria?

El KV-cache crece linealmente con la longitud de contexto. Un modelo con 2048 tokens de contexto necesita poco almacenamiento adicional, con 32.768 tokens el KV-cache puede ser de varios gigabytes. Si procesas documentos largos, planifica más memoria en consecuencia.

¿Debo elegir Q4_K_M o Q5_K_M?

Q4_K_M es el mejor punto de partida para memoria limitada, la calidad es suficiente para la mayoría de aplicaciones. Q5_K_M consume aproximadamente 25 por ciento más memoria, la calidad es mínimamente mejor. Si tienes suficiente memoria, elige Q5_K_M, si es escasa, elige Q4_K_M.

¿Puedo ejecutar múltiples modelos simultáneamente?

Sí, pero cada modelo se carga por separado en memoria. Dos modelos de 8B en Q4_K_M necesitan juntos aproximadamente 10 GB solo para los pesos del modelo, más KV-cache y overhead. Planifica suficiente memoria si usas múltiples modelos en paralelo.

¿Cuánta memoria consume el sistema operativo por sí solo?

En Linux necesitas 1 a 2 GB. En Windows son rápidamente 4 a 6 GB con navegador y procesos de fondo. En macOS planifica aproximadamente 3 a 4 GB. Si no estás seguro, toma 4 GB como búfer para el sistema operativo.

¿Vale la pena FP16 para mejor calidad?

Para pura inferencia en el día a día la diferencia de calidad entre Q4_K_M y FP16 es generalmente pequeña, pero el consumo de memoria es cuatro veces mayor. FP16 vale para entrenamiento y fine-tuning. Para ejecutar modelos Q4_K_M o Q5_K_M es la mejor opción.

¿Qué es Unified Memory en Apple Silicon?

Unified Memory significa que CPU y GPU comparten la misma memoria. No hay VRAM separado. Es una ventaja para IA local porque un Mac con 64 GB de RAM efectivamente tiene 64 GB de memoria disponible para modelos, menos el sistema operativo. En GPUs Nvidia el VRAM está limitado a 24 GB en modelos consumer.

Fuentes y lecturas complementarias

  • Ollama Modell-Dokumentation
  • Nvidia GPU-Spezifikationen
  • Hugging Face Model Cards
  • llama.cpp Quantisierungs-Dokumentation
  • Apple Silicon Spezifikationen
Volver al blog
Share:

Entradas relacionadas