Ancho de banda de memoria: El cuello de botella en IA local
Qué cubre este artículo
- Qué es realmente el ancho de banda de memoria y por qué se mide en GB/s
- Por qué en la inferencia de IA el memoria determina la velocidad, no el procesador
- Cuánto ancho de banda ofrecen diferentes tipos de memoria como DDR5, GDDR6, GDDR6X y HBM
- Por qué Apple Silicon funciona sorprendentemente bien para IA local
- Consejos prácticos para sacar el máximo provecho del ancho de banda de tu hardware
Introducción: Entender el ancho de banda de memoria
Cuando trabajas con IA local, rápidamente te encuentras con términos como VRAM, parámetros o cuantización. Hay un concepto que se subestima frecuentemente, aunque define la velocidad real de tu IA: el ancho de banda de memoria. En este artículo descubrirás qué significa el ancho de banda de memoria, por qué es el factor más importante en la inferencia de IA y cómo tomar las decisiones correctas sobre hardware.
La mayoría de tutoriales se enfoca en una pregunta: cuánto VRAM necesitas para cargar un modelo. Eso es importante, pero insuficiente. Un modelo que apenas cabe en el VRAM puede ejecutarse dolorosamente lento si el ancho de banda no es suficiente para transportar los pesos al procesador con rapidez. Aquí radica la clave de la IA local de alto rendimiento.
¿Por qué necesito entender el ancho de banda de memoria?
Imagina que tienes dos tarjetas gráficas frente a ti. Ambas tienen 12 GB de VRAM. Ambas pueden cargar un modelo de 7B. En el papel se ven idénticas. En la práctica, una genera 40 tokens por segundo y la otra solo 13. ¿La diferencia? Ancho de banda de memoria.
La primera tarjeta entrega 360 GB/s, la segunda solo 120 GB/s. Tres veces más ancho de banda significa tres veces más tokens por segundo. Ningún otro factor, ni el número de unidades de shader ni la frecuencia, tiene un impacto tan directo en la velocidad de la inferencia de IA. Quien solo presta atención al tamaño de VRAM al comprar hardware está comprando a ciegas.
Este conocimiento te ayuda en varias situaciones: al comprar una tarjeta gráfica nueva, al comparar Mac y PC, al decidir entre inferencia en CPU y GPU, y al entender por qué un chip aparentemente débil procesa un modelo grande de forma asombrosamente rápida.
Ancho de banda de memoria explicado brevemente
El ancho de banda de memoria describe cuántos datos por segundo se pueden mover entre la memoria y el procesador. La unidad es gigabytes por segundo, abreviado GB/s. Un ancho de banda mayor significa que más datos viajan del almacenamiento al procesador en el mismo tiempo.
La analogía más simple es una autopista. Cuantos más carriles tiene una autopista, más autos pueden circular simultáneamente. La velocidad de los autos corresponde a la frecuencia de la memoria, el número de carriles al interface de memoria. Ambos juntos crean el ancho de banda. Una autopista ancha con muchos carriles transporta más autos por segundo que una carretera estrecha, aunque ambas tengan el mismo límite de velocidad.
En la inferencia de IA, por cada token que el modelo genera, todos sus pesos deben leerse desde la memoria. Un modelo de 7B en 16 bits tiene aproximadamente 14 GB. Para cada token, se deben mover 14 GB. Con 100 GB/s de ancho de banda, la memoria puede entregar teóricamente unos 7 tokens por segundo. Con 400 GB/s, son 28. Las matemáticas son simples, las implicaciones enormes.
Para quién está pensado este conocimiento
Este artículo va dirigido a principiantes que quieren probar IA local y entender por qué su hardware es rápido o lento. Si te estás preguntando si deberías comprar una tarjeta gráfica o mejor usar un Mac con Apple Silicon, este conocimiento te ayudará a decidir. Si ya ejecutas modelos y te preguntas por qué un modelo funciona lentamente en tu sistema, aquí encontrarás la explicación.
No necesitas conocimientos previos. Si entiendes los fundamentos de hardware de IA y tienes una comprensión general de la diferencia entre CPU y GPU, eso es útil pero no obligatorio.
Términos importantes sobre ancho de banda de memoria
| Término | Significado |
|---|---|
| Ancho de banda de memoria | Volumen de datos por segundo entre memoria y procesador, medido en GB/s |
| GB/s | Gigabytes por segundo, la unidad estándar para ancho de banda de memoria |
| TB/s | Terabytes por segundo, 1000 GB/s, en GPUs de alto rendimiento y memoria HBM |
| Interface de memoria | El ancho de ruta de datos en bits, por ejemplo 128-bit, 256-bit o 384-bit |
| GDDR6 | Estándar de memoria gráfica, común en GPUs de consumidor, hasta aproximadamente 768 GB/s |
| GDDR6X | Evolución de GDDR6, utilizada por Nvidia, hasta aproximadamente 1008 GB/s |
| HBM | High Bandwidth Memory, memoria apilada para GPUs profesionales, más de 3 TB/s |
| LPDDR | Memoria DDR de bajo consumo, integrada en Apple Silicon y laptops |
| DDR5 | Generación actual de memoria RAM para PCs y servidores |
| Ancho de banda por vatio | Métrica de eficiencia, importante para dispositivos móviles y laptops |
¿Por qué el ancho de banda de memoria es tan importante para IA?
La mayoría cree que en la inferencia de IA la potencia de cálculo es el cuello de botella. Eso es cierto para entrenar modelos, pero no para la inferencia, es decir, ejecutar un modelo ya entrenado. En la inferencia, el problema no es calcular, sino mover datos.
La razón está en la arquitectura de los modelos. Un modelo de lenguaje consiste en miles de millones de parámetros, los pesos. Para cada token que el modelo predice como la siguiente palabra, todos los pesos deben leerse desde la memoria. En un modelo de 7B en precisión de 16 bits, eso son aproximadamente 14 GB por token. Las operaciones de cálculo en sí son relativamente rápidas, pero la memoria debe entregar los pesos antes de que pueda empezar el cálculo.
Esto significa: la velocidad de la inferencia está determinada casi exclusivamente por la rapidez con que la memoria transporta los pesos al procesador. Una GPU con enorme potencia de cálculo pero bajo ancho de banda está constantemente esperando nuevos datos. Las unidades de shader permanecen inactivas mientras la memoria entrega. Por eso el ancho de banda de memoria es el cuello de botella, no los TFLOPS.
Para saber más sobre el papel de VRAM en detalle, encuentra información adicional en el artículo RAM vs. VRAM.
Anchos de banda en comparación
Para tener una idea de las magnitudes, vale la pena observar los anchos de banda típicos de tipos de memoria comunes.
| Tipo de memoria | Ejemplo de hardware | Ancho de banda (aproximado) |
|---|---|---|
| DDR4 RAM | PC de escritorio estándar | 25 a 50 GB/s |
| DDR5 RAM | PC moderno, servidor | 60 a 90 GB/s |
| GDDR6 | RTX 3060, RTX 4060 | 360 a 448 GB/s |
| GDDR6X | RTX 4090 | 1008 GB/s |
| HBM3 | Nvidia H100 | más de 3000 GB/s |
| LPDDR5 | Apple M2 (unified) | 100 GB/s |
| LPDDR5 | Apple M2 Pro | 200 GB/s |
| LPDDR5 | Apple M2 Ultra | 800 GB/s |
| LPDDR5X | Apple M3 Max | 400 GB/s |
| LPDDR5X | Apple M4 Max | 546 GB/s |
La tabla muestra por qué una tarjeta gráfica, incluso con relativamente poco VRAM, procesa un modelo más rápido que un PC con mucha memoria RAM normal. GDDR6 ofrece cuatro a diez veces el ancho de banda de DDR5. HBM3 supera toda imaginación y entrega más de 3 TB/s, pero también cuesta muchas veces más.
Lo interesante es la posición de Apple Silicon. El M2 Ultra alcanza 800 GB/s, el M4 Max más de 500 GB/s. Eso es significativamente más que lo que ofrecen tarjetas gráficas de consumidor como la RTX 3060, y es suficiente para ejecutar modelos grandes de forma sorprendentemente fluida. Más sobre esto en la sección dedicada a Apple Silicon.
¿Qué significa esto en la práctica?
Veamos un ejemplo concreto. Quieres ejecutar un modelo de 7B en precisión de 16 bits. El modelo ocupa unos 14 GB en memoria. Para cada token, esos 14 GB deben ser leídos. La tasa de tokens teórica resulta del ancho de banda dividido entre el tamaño del modelo.
| Hardware | Ancho de banda | Tokens/s teóricos |
|---|---|---|
| DDR4-PC | 40 GB/s | aprox. 2,8 |
| DDR5-PC | 80 GB/s | aprox. 5,7 |
| RTX 3060 | 360 GB/s | aprox. 25,7 |
| RTX 4090 | 1008 GB/s | aprox. 72 |
| Apple M2 Ultra | 800 GB/s | aprox. 57 |
| Nvidia H100 | 3000 GB/s | aprox. 214 |
En la práctica no alcanzarás estos valores teóricos completamente, ya que el overhead, la KV-Cache y otros factores consumen rendimiento. Sin embargo, los órdenes de magnitud son correctos. En un PC con DDR4 esperarás varios segundos por una oración, mientras que una RTX 4090 genera texto de forma fluida.
Con cuantización puedes reducir el tamaño del modelo. Un modelo de 7B en 4 bits ocupa solo unos 3,5 GB. Con 360 GB/s de ancho de banda, la tasa teórica sube a más de 100 tokens por segundo. La cuantización no es solo una herramienta para ahorrar VRAM, sino también para utilizar el ancho de banda de manera más eficiente.
Apple Silicon y ancho de banda
Apple Silicon ocupa una posición especial. Los Macs con chips M, Pro, Max y Ultra utilizan un enfoque de memoria unificada, donde la CPU y la GPU comparten el mismo memoria. La memoria es LPDDR5 o LPDDR5X, y los anchos de banda son notablemente altos para hardware de consumidor.
Un M2 Ultra ofrece 800 GB/s, un M3 Max 400 GB/s, un M4 Max 546 GB/s. Esto se debe a la conexión de memoria muy amplia que Apple ha integrado directamente en el chip. Mientras que una RTX 4060 con interfaz de 128 bits alcanza 272 GB/s, Apple utiliza interfaces mucho más anchas para conectar los chips LPDDR.
Para IA local, esto significa que un Mac Studio con M2 Ultra y 192 GB de memoria unificada puede cargar un modelo de 70B y ejecutarlo a una velocidad aceptable. Ninguna tarjeta gráfica de consumidor ofrece 192 GB de VRAM. La combinación de memoria unificada grande y ancho de banda alto hace que los Macs sean una plataforma atractiva para modelos grandes, si lo que te importa no es el rendimiento máximo de una RTX 4090, sino la capacidad de ejecutar modelos grandes en general.
Encontrarás más detalles sobre el concepto en el artículo sobre Unified Memory.
¿Cómo mejoro mi ancho de banda?
No puedes duplicar el ancho de banda de tu hardware mediante optimizaciones de software. Es una propiedad física de la memoria y de la interfaz de memoria. Lo que puedes hacer es utilizar el ancho de banda disponible de manera óptima y tomar las decisiones correctas cuando compres hardware nuevo.
Utiliza la GPU en lugar de la CPU. La inferencia en CPU con RAM normal es lenta porque DDR5 solo ofrece 60 a 90 GB/s. Incluso una tarjeta gráfica económica con GDDR6 es tres a cinco veces más rápida. Si usas GPU Offloading, cargas los pesos del modelo en VRAM y aprovechas el ancho de banda más alto.
Elige memoria RAM rápida. Si dependes de inferencia en CPU, usa DDR5 en lugar de DDR4. El funcionamiento dual-channel es obligatorio, ya que duplica el ancho de banda en comparación con el single-channel. Con DDR5-5600 en dual-channel alcanzas alrededor de 90 GB/s.
Apunta a Apple Silicon para modelos grandes. Si quieres ejecutar modelos de más de 24 GB, un Mac con M-Pro, M-Max o M-Ultra es frecuentemente la solución más económica. El ancho de banda alto de la memoria unificada garantiza que incluso los modelos grandes logren velocidades útiles.
Evita APUs con memoria compartida para modelos grandes. Las soluciones gráficas integradas comparten RAM con la CPU y no ofrecen ancho de banda propio. Para modelos pequeños es aceptable, pero para cualquier cosa de 7B en adelante se vuelve incómodo. Una tarjeta gráfica dedicada es la opción mejor.
Cuantiza en lugar de actualizar. Si tu ancho de banda es limitado, reduce el tamaño del modelo mediante cuantización. Un modelo de 4 bits requiere una cuarta parte del ancho de banda de un modelo de 16 bits. A menudo este es el camino más simple hacia más tokens por segundo.
Presta atención a la interfaz de memoria al comprar una GPU. Una tarjeta de 128 bits ofrece menos ancho de banda que una tarjeta de 256 bits del mismo tipo de memoria. La RTX 4060 con 128 bits alcanza 272 GB/s, la RTX 4070 Ti con 192 bits llega a 504 GB/s. La interfaz es un indicador mejor que el tamaño puro de VRAM.
Encontrarás más ayuda para tomar decisiones en la guía de compra y en el artículo sobre requisitos de RAM y VRAM.
Trampas típicas con ancho de banda de memoria
-
Confundir tamaño de VRAM con velocidad. 16 GB de VRAM no dicen nada sobre el ancho de banda. Una tarjeta de 16 GB con interfaz de 128 bits es mucho más lenta que una tarjeta de 12 GB con interfaz de 192 bits.
-
TFLOPS como criterio de compra. La potencia de cálculo es importante en entrenamiento, casi irrelevante en inferencia. Una tarjeta con menos TFLOPS pero mayor ancho de banda es más rápida para IA local.
-
Ignorar RAM en single-channel. Muchas PCs se venden con solo un módulo de RAM. Esto reduce el ancho de banda a la mitad. Un segundo módulo cuesta poco y duplica el rendimiento en inferencia con CPU.
-
Creer que el software puede reemplazar el ancho de banda. Optimizaciones como Flash-Attention ayudan, pero no pueden aumentar el ancho de banda físico. Si la memoria es lenta, la inferencia sigue siendo lenta.
-
Sobrestimar APUs como reemplazo de GPU. La gráfica integrada utiliza RAM del sistema con ancho de banda DDR. Para inferencia de IA seria, esto no es suficiente.
-
Comparar Apple Silicon y GPUs Nvidia solo por VRAM. Un Mac con 64 GB y 400 GB/s no es directamente comparable con una RTX 4090 con 24 GB y 1008 GB/s. Ambos tienen fortalezas diferentes: el Mac acomoda modelos más grandes, la tarjeta Nvidia procesa los más pequeños más rápidamente.
-
Descartar la cuantización como pérdida de calidad. La cuantización de 4 bits y 8 bits reduce drásticamente la carga del ancho de banda con pérdida mínima de calidad. Quien la ignora, desperdicia rendimiento.
-
Olvidar la KV-Cache. Con contextos largos, la KV-Cache crece en VRAM y consume ancho de banda. Esto puede reducir notablemente la tasa de tokens, especialmente con tarjetas gráficas pequeñas.
Hardware, costos y seguridad en el ancho de banda de memoria
El ancho de banda se correlaciona directamente con los costos. Los módulos DDR5 son baratos pero ofrecen poco ancho de banda. Las tarjetas GDDR6 cuestan varios cientos de euros, las tarjetas GDDR6X como la RTX 4090 más de 1500 euros. La memoria HBM, como en la H100, se mueve en rango de cinco dígitos y es irrelevante para el consumidor.
Apple Silicon se posiciona en el medio. Un Mac Studio con M2 Max y 64 GB cuesta significativamente menos que un PC de estación de trabajo con una configuración de VRAM comparable, pero ofrece ancho de banda alto. Para usuarios que quieren ejecutar modelos grandes localmente sin adquirir una GPU profesional, esta es una alternativa económica.
En cuanto a seguridad, el ancho de banda no cambia nada. La inferencia de IA local ya es amigable con los datos de privacidad, ya que ningún dato se envía a servidores externos. Un ancho de banda más alto significa simplemente que la inferencia se ejecuta más rápidamente. Tus datos permanecen en tu dispositivo, independientemente de si tienes 40 GB/s o 1000 GB/s disponibles.
Enlaces y recursos adicionales sobre ancho de banda de memoria
- Fundamentos de hardware de IA para una visión general de todos los temas de hardware
- CPU vs. GPU comparando tipos de procesadores
- RAM vs. VRAM para entender los tipos de memoria
- GPU-Offloading en la práctica del uso de GPU
- Unified Memory detalles de Apple Silicon
- Requisitos de RAM y VRAM para la selección de modelos
- Cuantización como herramienta para optimizar ancho de banda
- Guía de compra para decisiones de hardware
FAQ: Ancho de banda de memoria, preguntas frecuentes
¿Qué es el ancho de banda de memoria explicado de forma simple? El ancho de banda de memoria es la cantidad de datos que pueden moverse entre la memoria y el procesador por segundo, medida en GB/s. Cuanto mayor sea, más datos transporta la memoria en el mismo tiempo.
¿Por qué es tan importante el ancho de banda de memoria en IA? Durante la inferencia, todos los pesos del modelo deben leerse desde la memoria para cada token. El ancho de banda determina la velocidad de esta operación. Es el factor más importante para la velocidad de tokens.
¿Es más importante tener más VRAM que más ancho de banda? No, ambos son importantes de diferentes formas. VRAM determina si un modelo puede cargarse en primer lugar. El ancho de banda determina la velocidad de ejecución. Juntos definen el rendimiento general.
¿Cuál es la diferencia entre GDDR6 y GDDR6X? GDDR6X es una evolución de GDDR6 con velocidades de datos más altas. GDDR6 alcanza hasta aproximadamente 768 GB/s, mientras que GDDR6X llega a unos 1008 GB/s. GDDR6X lo usa exclusivamente Nvidia.
¿Por qué Apple Silicon es tan bueno para IA local? Apple Silicon utiliza memoria LPDDR5 con una interfaz amplia que proporciona entre 100 y 800 GB/s. Combinado con memoria unificada de gran tamaño, las máquinas Mac pueden cargar modelos grandes y ejecutarlos a velocidades útiles.
¿Puedo aumentar el ancho de banda a través de software? No, el ancho de banda es una propiedad determinada por el hardware. Las optimizaciones de software pueden mejorar el uso del ancho de banda existente, pero no pueden aumentar el ancho de banda en sí.
¿Qué ventajas tiene la operación Dual-Channel en RAM? El funcionamiento Dual-Channel utiliza dos módulos de memoria en paralelo, duplicando el ancho de banda. Con DDR5-5600, el ancho de banda aumenta de aproximadamente 45 GB/s a aproximadamente 90 GB/s.
¿Cuánto ancho de banda necesito para un modelo de 7B? Un modelo de 7B en 16-bit requiere 14 GB por token. Para 20 tokens por segundo, necesitas al menos 280 GB/s. Con cuantización de 4-bit es suficiente un tercio de eso.
¿Qué significa la interfaz de memoria en bits? La interfaz de memoria es el ancho de la ruta de datos entre la memoria y la GPU. 128-bit, 256-bit y 384-bit son configuraciones típicas. Una interfaz más ancha permite más datos por ciclo e incrementa el ancho de banda.
¿Son importantes los TFLOPS en la inferencia de IA? Durante la inferencia, los TFLOPS juegan un papel secundario. El ancho de banda es el factor decisivo. Los TFLOPS resultan más importantes en el entrenamiento de modelos.
¿Qué es HBM y por qué es tan rápido? HBM, High Bandwidth Memory, es una memoria apilada ubicada directamente adyacente al procesador. Las distancias cortas y la conexión amplia permiten alcanzar más de 3 TB/s. HBM se utiliza en GPUs profesionales y servidores.
Fuentes y lecturas adicionales
- Hojas técnicas de Nvidia, AMD y Apple sobre los respectivos tipos de memoria y anchos de banda
- Especificaciones de estándares JEDEC para DDR5, GDDR6 y LPDDR5
- Documentación de arquitectura para Apple Silicon y GPUs Nvidia
- Pruebas prácticas y benchmarks de velocidad de tokens en diferentes configuraciones de hardware


