Skip to content
BotServBotServ
RAMVRAMGPUCPUHardware de IAMemoria

RAM vs. VRAM

Diferencias entre RAM y VRAM para IA local. Dónde ejecutar modelos y cuál es más rápido.

S

schutzgeist

16 min read
RAM vs. VRAM

RAM vs. VRAM

Qué cubre este artículo sobre RAM vs. VRAM

  • La diferencia entre RAM y VRAM y por qué ambos importan para la IA local
  • Cómo un modelo se desplaza desde el almacenamiento hasta la RAM y luego al VRAM
  • Qué sucede cuando el VRAM es insuficiente y cómo funciona la descarga de GPU
  • Cómo Apple Silicon y las APUs con memoria unificada cambian el juego
  • Recomendaciones concretas sobre qué configuración necesitas para cada tamaño de modelo

Introducción: RAM vs. VRAM explicado

Cuando comienzas a ejecutar modelos de IA localmente en tu computadora, rápidamente te encuentras con dos tipos de memoria que a menudo se confunden: RAM y VRAM. Ambos son memoria de acceso aleatorio, ambos mantienen datos disponibles para el procesador, pero residen en ubicaciones diferentes y tienen velocidades muy distintas. Precisamente esta diferencia determina si un modelo funciona sin problemas o si esperas segundos entre cada palabra.

Si trabajas con IA local, no hay forma de evitarlo. Herramientas como Ollama te permiten iniciar modelos con un solo comando, pero que el resultado sea rápido o dolorosamente lento depende de dónde aterrice el modelo en la memoria. Comprender las diferencias entre RAM y VRAM te ayuda a elegir el hardware correcto, seleccionar los modelos adecuados y evitar frustraciones.

Por qué necesito este conocimiento

Imagina que compras una computadora nueva. 32 GB de RAM, una CPU decente, una tarjeta gráfica con 4 GB de VRAM. El vendedor te dice que la máquina es perfecta para IA. Instalas Ollama, descargas un modelo con 13 mil millones de parámetros y lo inicias. Luego esperas. Cada respuesta tarda diez segundos o más. La computadora no es lenta, el modelo no está roto, pero el VRAM es simplemente demasiado pequeño para este modelo.

Este es un error clásico que muchos cometen. RAM y VRAM a menudo se tratan como lo mismo porque ambos se expresan en gigabytes. Pero 32 GB de RAM no te sirven de mucho si tu GPU tiene solo 4 GB de VRAM. El modelo se ejecutará parcialmente en la RAM, lo que es significativamente más lento. Si comprendes cómo funcionan juntos RAM y VRAM antes de comprar, obtendrás el hardware correcto y evitarás la frustración.

RAM vs. VRAM - En pocas palabras

RAM es la memoria de trabajo de tu computadora. Está disponible para la CPU y todos los programas en ejecución. VRAM es la memoria en una tarjeta gráfica dedicada y está disponible exclusivamente para la GPU. Para cálculos de IA, el VRAM es generalmente mucho más rápido porque la GPU tiene miles de núcleos de procesamiento paralelo y el VRAM ofrece un ancho de banda de memoria mucho mayor.

Una analogía simple: imagina tu computadora como un taller. La RAM es el escritorio donde tienes todos los documentos en los que estás trabajando. Cuanto más grande sea el escritorio, más documentos caben. El VRAM es la estación de trabajo junto a la máquina. La máquina es la GPU y solo puede procesar lo que está en la estación. Si la estación es demasiado pequeña, la máquina constantemente necesita traer documentos del escritorio, y eso cuesta tiempo.

Un modelo que se ejecuta en la GPU debe caber completamente en el VRAM. Si no cabe, partes se quedan en la RAM. Entonces el modelo se ralentiza porque la CPU tiene menos núcleos de procesamiento paralelo que una GPU y la transferencia de datos entre RAM y VRAM consume tiempo adicional.

Para quién está dirigida esta comparación

Este artículo es para principiantes que quieren experimentar con IA local y se preguntan qué hardware necesitan. Si nunca has oído hablar de VRAM o no sabes por qué un modelo con 7 mil millones de parámetros funciona rápido en una GPU pero no en una CPU, este es tu lugar. No necesitas conocimientos previos. Recorremos paso a paso qué son RAM y VRAM, cómo trabajan juntos y qué debes considerar al comprar.

Si ya has hecho algunos experimentos con Ollama y te preguntas por qué algunos modelos son rápidos y otros no, este artículo también te ayudará. Los fundamentos que aquí presentamos son la base para temas más avanzados como requisitos de RAM y VRAM y cuantización.

Términos clave sobre RAM y VRAM

TérminoSignificado
RAMMemoria de trabajo del sistema, utilizada por la CPU y todos los programas
VRAMMemoria en una tarjeta gráfica dedicada, exclusiva para la GPU
GPUProcesador en la tarjeta gráfica con muchos núcleos paralelos, ideal para IA
CPUProcesador principal con menos núcleos pero más flexibles
GPU-OffloadingPartes del modelo se descargan de la CPU a la GPU
Unified MemoryMemoria compartida para CPU y GPU, por ejemplo en Apple Silicon
Shared MemoryGPU utiliza parte de la RAM, por ejemplo en APUs sin VRAM dedicado
Ancho de banda de memoriaCantidad de datos que pueden fluir entre la memoria y el procesador por segundo
APUProcesador con GPU integrada, generalmente comparte la RAM
Apple SiliconChips de Apple como M1, M2, M3, M4 que unifican RAM y memoria de GPU

Comparación directa: RAM vs. VRAM

CriterioRAMVRAM
UbicaciónEn la placa base, dentro de la computadoraEn la tarjeta gráfica, directamente junto a la GPU
AccesoCPU y todos los programasSolo la GPU
Velocidad para IAModerada, limitada por núcleos de CPUMuy alta, gracias a miles de núcleos de GPU
Ancho de bandaTípicamente 50 a 100 GB/sTípicamente 500 a 1000 GB/s y más
LatenciaMayorMenor, debido a la proximidad con la GPU
DisponibilidadPresente en todas las computadorasSolo con tarjeta gráfica dedicada
Precio por GBEconómico, típicamente 3 a 5 eurosCaro, típicamente 15 a 30 euros y más
ActualizaciónFácil, puedes agregar módulos de RAMDifícil, el VRAM está soldado a la GPU
Tamaños típicos16, 32, 64 GB8, 12, 16, 24 GB en GPUs de consumidor
Usuario principalCPUGPU
Impacto cuando es insuficienteLos programas se ralentizan o fallanEl modelo se ejecuta en CPU, muy lento

Cómo se relacionan RAM y VRAM

Cuando inicias un modelo de IA con Ollama, ocurre lo siguiente en segundo plano. El modelo está almacenado como archivo en tu SSD o disco duro. Al iniciar, Ollama carga el archivo primero en la RAM. La RAM es la memoria de trabajo general donde el sistema mantiene disponible lo que se necesita en el momento.

Si tienes una tarjeta gráfica dedicada, Ollama intenta copiar el modelo del RAM al VRAM. La GPU calcula mucho más rápido que la CPU porque tiene miles de núcleos paralelos. Cuanto más del modelo resida en el VRAM, más rápida será la inferencia, es decir, la generación de respuestas.

El proceso simplificado es así:

  1. El modelo está almacenado como archivo en la SSD
  2. Ollama carga el archivo en la RAM
  3. Si hay una GPU disponible, Ollama copia el modelo del RAM al VRAM
  4. La GPU ejecuta los cálculos y genera la respuesta
  5. El resultado regresa al programa que muestra la respuesta

Si el modelo cabe completamente en el VRAM, es ideal. La GPU tiene todo lo que necesita directamente a su lado, y la transferencia de datos entre RAM y VRAM durante la inferencia es mínima. El modelo funciona al máximo rendimiento.

¿Qué ocurre cuando el VRAM es insuficiente?

Cuando el modelo no cabe completamente en el VRAM, entra en juego el GPU Offloading. Ollama intenta cargar la mayor cantidad posible del modelo en el VRAM y mantiene el resto en la RAM. La GPU procesa las partes que están en el VRAM, mientras que la CPU procesa las partes que están en la RAM. Funciona, pero tiene un costo: constantemente hay que transferir datos entre la RAM y el VRAM.

Cuanta menos cantidad del modelo quepa en el VRAM, más trabajo debe asumir la CPU, y más lento se vuelve el modelo. En el caso extremo, si no hay GPU disponible o el VRAM es extremadamente pequeño, el modelo se ejecuta completamente en la RAM de la CPU. Para modelos pequeños es aceptable, pero para modelos más grandes resulta muy lento.

Una solución es la cuantización. El modelo se comprime reduciendo la precisión de los números con los que calcula. Un modelo que originalmente requiere 16 GB de VRAM podría reducirse a 5 GB con cuantización de 4 bits. Así cabe en una tarjeta gráfica más pequeña. El precio es una ligera pérdida de calidad, pero para la mayoría de aplicaciones es imperceptible.

Otra solución es adquirir una tarjeta gráfica con más VRAM. Las GPUs de consumo de Nvidia vienen con 8, 12, 16 o 24 GB de VRAM. La guía de compra te ayuda a elegir.

Apple Silicon y Unified Memory

Apple Silicon, es decir, los chips M1, M2, M3, M4 y sus variantes Pro y Max, funcionan fundamentalmente diferente que las computadoras con CPU y GPU separadas. En Apple Silicon no hay VRAM separado. En su lugar, la CPU y la GPU comparten una memoria común llamada Unified Memory.

Esto significa que la GPU puede acceder a toda la RAM del sistema. Un Mac Studio con 128 GB de Unified Memory puede poner teóricamente casi todo el almacenamiento a disposición de la GPU. Esta es una enorme ventaja para la IA local, porque modelos grandes que no cabrían en una tarjeta gráfica de consumo con 24 GB de VRAM pueden ejecutarse sin problemas en un Mac con suficiente Unified Memory.

La desventaja es el ancho de banda de memoria. Apple Silicon tiene un ancho de banda alto, pero es menor que el de tarjetas gráficas dedicadas de alto rendimiento como la Nvidia H100. Para IA local en casa, Apple Silicon sigue siendo una excelente opción, porque la cantidad de memoria es el criterio más importante y el ancho de banda es suficiente para la mayoría de aplicaciones.

Si consideras Apple Silicon, pon atención a la variante. Los chips estándar M1, M2, M3, M4 tienen un ancho de banda de memoria menor que las variantes Pro, Max y Ultra. Para IA al menos las variantes Pro valen la pena, preferiblemente Max o Ultra.

APU y Shared Memory

Además de Apple Silicon, existe otro enfoque en el que la CPU y la GPU comparten memoria: las APU. Una APU es un procesador que integra una GPU. Ejemplos conocidos son AMD Ryzen AI Max o la serie Intel Core Ultra. En estos chips no hay VRAM separado, la GPU utiliza en su lugar una parte de la RAM. Esto se llama Shared Memory.

La ventaja es que no necesitas una tarjeta gráfica separada y aun así puedes beneficiarte de la GPU. La desventaja es que el ancho de banda de la RAM es significativamente menor que el del VRAM dedicado. La GPU es más rápida que una solución pura de CPU, pero más lenta que una tarjeta gráfica dedicada con su propio VRAM.

Particularmente interesante es el AMD Ryzen AI Max, que soporta hasta 128 GB de RAM y puede poner una gran parte a disposición de la GPU. Esta es una alternativa a Apple Silicon si quieres construir una computadora con Windows o Linux y ejecutar modelos grandes localmente sin comprar una tarjeta gráfica dedicada costosa.

Ejemplo: ¿Qué configuración para qué modelo?

Aquí hay ejemplos concretos para que tengas una idea de las magnitudes involucradas. Los datos se refieren a modelos cuantizados, como típicamente se cargan con Ollama. Encontrarás más información sobre los números exactos en Requisitos de RAM y VRAM.

Modelo de 7B (7 mil millones de parámetros): Un modelo 7B cuantizado necesita aproximadamente 4 a 5 GB de almacenamiento. Cabe en cualquier tarjeta gráfica moderna con 8 GB de VRAM. En una GPU se ejecuta rápido y fluido. En una CPU con 16 GB de RAM también funciona, pero notablemente más lento.

Modelo de 13B (13 mil millones de parámetros): Un modelo 13B cuantizado necesita aproximadamente 8 a 9 GB de almacenamiento. Aún cabe en una tarjeta gráfica con 12 GB de VRAM, como una Nvidia RTX 3060. Con 8 GB de VRAM es ajustado, y necesitarás GPU Offloading o cuantización más agresiva.

Modelo de 70B (70 mil millones de parámetros): Un modelo 70B cuantizado necesita aproximadamente 40 a 45 GB de almacenamiento. No cabe en ninguna tarjeta gráfica de consumo, porque la más grande, la RTX 4090, tiene 24 GB de VRAM. Aquí necesitas varias tarjetas gráficas, Apple Silicon con al menos 64 GB de Unified Memory, o una APU como el Ryzen AI Max con suficiente RAM.

Modelos aún más grandes: Los modelos con 100 mil millones de parámetros y más necesitan 60 GB de almacenamiento en adelante. Para uso local, aquí solo entran en consideración Macs con 128 GB de Unified Memory o configuraciones multi-GPU.

Errores típicos con RAM y VRAM

  • Confundir RAM y VRAM: 32 GB de RAM no ayudan si la GPU solo tiene 4 GB de VRAM. El modelo será lento porque no cabe en el VRAM.
  • Comprar una tarjeta gráfica demasiado pequeña: Quien compra una GPU con 8 GB de VRAM y luego quiere ejecutar un modelo 13B, debe vivir con GPU Offloading o cuantización más agresiva.
  • Equiparar Shared Memory con VRAM dedicado: Una APU utiliza la RAM como VRAM, pero es más lenta que una tarjeta gráfica dedicada con su propio VRAM, porque el ancho de banda es menor.
  • Subestimar el ancho de banda de Apple Silicon: Un M3 estándar es menos adecuado para IA que un M3 Max, porque el ancho de banda de memoria es significativamente menor.
  • Ignorar la cuantización: Quien carga modelos sin cuantización necesita mucho más VRAM. Con cuantización de 4 bits, modelos mucho más grandes caben en el VRAM.
  • Pasar por alto la latencia: Incluso si hay suficiente almacenamiento, un ancho de banda de memoria bajo puede ralentizar el modelo. Esto se aplica especialmente a Shared Memory.
  • Esperar actualización de VRAM: El VRAM no se puede actualizar. Si quieres más VRAM, tienes que comprar una nueva tarjeta gráfica. La RAM, en cambio, generalmente se puede expandir sin problemas.

Hardware, costos y seguridad con RAM y VRAM

Hardware: Para empezar con IA local, una tarjeta gráfica con 8 GB de VRAM es suficiente si usas principalmente modelos de 7B. Para modelos de 13B se recomienda 12 GB de VRAM, para modelos más grandes 24 GB de VRAM o Apple Silicon con suficiente Unified Memory. La CPU juega un papel secundario mientras sea moderna. Lo más importante es la GPU y su VRAM.

Costos: La RAM es barata, típicamente 3 a 5 euros por GB. El VRAM es caro porque está integrado permanentemente en la tarjeta gráfica y compras toda la tarjeta. Una Nvidia RTX 4060 con 8 GB de VRAM cuesta aproximadamente 300 euros, una RTX 4090 con 24 GB de VRAM alrededor de 2000 euros. Apple Silicon es un caso especial, porque no compras el almacenamiento por separado, sino que configuras el Mac con el Unified Memory deseado. Un Mac Studio con 128 GB de Unified Memory es caro, pero comparado con una configuración multi-GPU a menudo es más barato.

Seguridad: En los modelos ejecutados localmente, tus datos permanecen en tu computadora. Ninguna consulta va a un servidor, ningún dato sale de tu sistema. Esta es una gran ventaja frente a la IA en la nube. RAM y VRAM no juegan un papel aquí, lo importante es solo que el modelo se ejecute localmente y no llame a APIs externas. Más información en ¿Qué es IA local?.

Enlaces y recursos complementarios sobre RAM y VRAM

Preguntas frecuentes sobre RAM y VRAM

¿Puedo ampliar VRAM con RAM?

No. El VRAM está integrado en la tarjeta gráfica y no se puede ampliar. Si necesitas más VRAM, debes comprar una tarjeta gráfica nueva. La RAM, en cambio, suele ser fácil de ampliar instalando módulos adicionales en la placa base.

¿Vale la pena una GPU con 8 GB de VRAM?

Sí, para empezar. 8 GB de VRAM son suficientes para modelos de 7B cuantizados sin problemas. Con modelos de 13B se ajusta, necesitarás GPU-Offloading o cuantización más agresiva. Si quieres ejecutar modelos más grandes, una tarjeta con 12 o 16 GB de VRAM es más recomendable.

¿Por qué Apple Silicon es tan popular para IA local?

Apple Silicon utiliza Unified Memory, donde la CPU y GPU comparten un espacio de memoria común. La GPU puede acceder a toda la memoria RAM sin las limitaciones típicas de VRAM en tarjetas gráficas dedicadas. Una Mac con 64 o 128 GB de Unified Memory puede cargar modelos que no caben en ninguna tarjeta gráfica de consumo.

¿Qué es más rápido: CPU con mucha RAM o GPU con poco VRAM?

Para inferencia de IA, la GPU casi siempre es más rápida, incluso con poco VRAM, mientras el modelo quepa. La GPU tiene miles de núcleos paralelos y mucho mayor ancho de banda de memoria. Una CPU con mucha RAM solo es mejor cuando el modelo es demasiado grande para el VRAM y tiene que ejecutarse en CPU de todas formas.

¿Qué significa exactamente GPU-Offloading?

GPU-Offloading significa trasladar partes de un modelo a la GPU mientras el resto se ejecuta en RAM en la CPU. Ocurre cuando el modelo no cabe completamente en VRAM. Cuanta más parte del modelo quepa en VRAM, más rápido se ejecutará.

¿Ayuda más RAM si el VRAM es muy pequeño?

Parcialmente. Más RAM te permite cargar modelos más grandes y ejecutarlos en la CPU. Pero la velocidad seguirá siendo baja porque la CPU y RAM son más lentas que la GPU y VRAM. Más RAM no resuelve el problema de velocidad, solo hace posible que el modelo se ejecute.

¿Cuál es la diferencia entre Unified Memory y Shared Memory?

Unified Memory en Apple Silicon es un espacio de memoria común optimizado desde el inicio para CPU y GPU con alto ancho de banda. Shared Memory en APUs significa que la GPU integrada utiliza parte de la RAM normal. El ancho de banda es menor que con VRAM dedicado o Unified Memory.

¿Necesito una GPU Nvidia para IA local?

No, pero Nvidia es la opción más sencilla porque la mayoría de herramientas y frameworks están optimizados para Nvidia. Las GPUs de AMD también funcionan, aunque a veces requieren más configuración. Apple Silicon y APUs son alternativas que prescindem de tarjeta gráfica dedicada.

¿Cuánto VRAM necesito para un modelo de 7B?

Un modelo de 7B cuantizado necesita aproximadamente 4 a 5 GB de VRAM. Con 8 GB de VRAM estás seguro. Sin cuantización, el modelo necesita unos 14 GB, lo que requiere una tarjeta gráfica considerablemente más potente.

¿Puedo usar varias tarjetas gráficas para más VRAM?

Sí, es posible. Herramientas como Ollama soportan configuraciones Multi-GPU donde el modelo se distribuye entre el VRAM de varias tarjetas. Es una forma de ejecutar modelos grandes localmente sin Apple Silicon o APU. La desventaja es el alto consumo de energía y los costos.

¿Qué pasa cuando el VRAM se llena completamente?

Si el VRAM se llena y el modelo no se ha cargado completamente, el programa se bloquea o muestra un error. Ollama intenta en estos casos recurrir automáticamente a GPU-Offloading y dejar el resto en RAM. Si tampoco hay RAM suficiente, el modelo no inicia.

¿Es suficiente el VRAM de una GPU integrada?

En la mayoría de casos, no. Las GPUs integradas usan Shared Memory de la RAM y tienen bajo ancho de banda. Para modelos pequeños de 7B puede funcionar, pero lentamente. Para IA local seria, una tarjeta gráfica dedicada o Apple Silicon es más recomendable.

¿Debo actualizar RAM o VRAM si mi modelo es lento?

Si el modelo es lento porque no cabe en VRAM, más RAM no ayuda con la velocidad. En este caso necesitas una tarjeta gráfica con más VRAM o cuantización más agresiva. Más RAM solo ayuda si el modelo ni siquiera inicia porque la RAM también es insuficiente.

Fuentes y referencias

  • Arquitectura de memoria Nvidia y especificaciones de VRAM
  • Documentación AMD Ryzen AI Max
  • Descripción general de Unified Memory en Apple Silicon
  • Ollama documentación sobre GPU-Offloading
  • Experiencias de la comunidad de IA local
Volver al blog
Share:

Nächster Artikel in Hardware de IA

Weiterlesen
PC para Principiantes en IA

Entradas relacionadas