Fundamentos de Hardware para IA
Qué cubre este artículo
- Qué componentes de hardware son importantes para IA local y por qué.
- Cómo trabajan juntos CPU, GPU, RAM, VRAM y SSD.
- Qué significan TOPS, APU y Unified Memory.
- Referencias a todos los artículos de fundamentos y la guía de compra.
Introducción
Si quieres ejecutar modelos de IA localmente, necesitas hardware adecuado. Un modelo de lenguaje es un archivo grande que se carga en memoria y se procesa allí. La velocidad depende de CPU, GPU, RAM, VRAM y almacenamiento. Esta sección reúne conocimientos fundamentales que te ayudarán a entender, armar o comprar un PC para IA.
¿Por qué necesito fundamentos de hardware para IA?
Sin este conocimiento, compras a ciegas. Corres el riesgo de elegir un equipo demasiado débil para tus modelos o demasiado caro para lo que realmente necesitas. Un ejemplo: para ejecutar Llama 3.1 8B necesitas unos 8 GB de memoria para el modelo cuantizado. En una GPU con 8 GB de VRAM funciona sin problemas. En un equipo con solo 16 GB de RAM e inferencia por CPU, cada respuesta tarda varios segundos. Si lo sabes de antemano, ahorras dinero y frustración.
Los fundamentos también te ayudan a evaluar las promesas de marketing. Un mini PC con 128 GB de RAM suena impresionante, pero si el ancho de banda de memoria es bajo, un modelo grande seguirá siendo lento. Los valores TOPS en la ficha técnica no lo dicen todo, porque solo miden el rendimiento máximo en condiciones ideales.
Hardware para IA explicado brevemente
La IA local carga un modelo en memoria y calcula respuestas a partir de él. Hay dos formas de hacerlo:
- Inferencia por CPU: El modelo reside en la memoria de acceso aleatorio normal (RAM). La CPU calcula las respuestas. Lento, pero flexible y económico.
- Inferencia por GPU: El modelo reside en la memoria de gráficos (VRAM). La GPU calcula las respuestas en paralelo y mucho más rápido.
La memoria determina qué modelo cabe. La potencia de cálculo determina qué tan rápido vienen las respuestas. Una SSD se encarga de cargar el modelo rápidamente. Una APU como Apple Silicon o Ryzen AI Max combina CPU y GPU en un solo chip y comparte la memoria.
¿Para quién es esta sección?
- Quieres ejecutar IA localmente y saber qué puede hacer tu equipo.
- Estás considerando comprar un PC o mini PC nuevo.
- Eres principiante y quieres entender mejor las promesas de marketing.
- No necesitas conocimientos previos profundos. Los términos técnicos se explican aquí de forma clara.
Componentes importantes
| Componente | Función | Qué considerar |
|---|---|---|
| CPU | Ejecuta inferencia y el sistema operativo | Núcleos modernos, mucha caché |
| RAM | Almacena modelos en inferencia por CPU | 16 GB mínimo, 32 GB mejor, 64-128 GB ideal |
| GPU/VRAM | Cálculo paralelo rápido | 8 GB mínimo, 16 GB o más mejor |
| APU | CPU y GPU en un solo chip | Unified o Shared Memory utiliza RAM compartida |
| SSD | Almacenamiento rápido para modelos | 500 GB o más, preferiblemente NVMe |
Términos importantes
- TOPS/NTOPS - Tera Operations Per Second. La unidad de medida para potencia de cálculo de IA. Cuanto mayor sea el valor, más rápido puede un chip ejecutar modelos.
- APU - Accelerated Processing Unit: CPU y GPU en un solo chip, como en Apple Silicon o Ryzen AI Max.
- Unified/Shared Memory - La memoria de acceso aleatorio se comparte entre CPU y GPU. Importante para Apple Silicon y Ryzen AI Max.
- Quantización - Reduce la precisión de un modelo para ejecutarlo con menos memoria. Permite ejecutar modelos más grandes en hardware más pequeño.
- VRAM - Memoria de la tarjeta gráfica dedicada. Crucial para inferencia por GPU.
- LLM - Large Language Model, un gran modelo de lenguaje.
Contenido y artículos
- RAM vs. VRAM - Cuál es la diferencia, dónde residen los modelos y por qué ambos son importantes para IA local.
- CPU vs. GPU - Qué procesador es más rápido para IA local y cuándo la CPU es suficiente.
- GPU-Offloading - Cuando el VRAM no es suficiente: modelos parcialmente en GPU, parcialmente en RAM.
- Ancho de banda de memoria - El factor más importante para la velocidad de inferencia de IA.
- Unified Memory - Cómo Apple Silicon y Ryzen AI Max combinan RAM y VRAM.
- Tamaño del modelo y requisitos de memoria - Cuán grandes son realmente los modelos de IA y cuánta memoria necesitan.
- Dimensionar hardware correctamente - Paso a paso hacia el PC para IA adecuado.
- Glosario de fundamentos de IA - Todos los términos importantes de la A a la Z explicados claramente.
Artículos relacionados adicionales:
- Requisitos de RAM y VRAM - ¿Qué necesita realmente tu equipo para modelos locales?
- Cuantización - Cómo encajan modelos grandes en hardware más pequeño.
- PC para IA principiantes - Recomendaciones concretas de compra y rangos de precios.
- Descripción general de guía de compra - En qué prestar atención al comprar.
Trampas típicas
- RAM no es VRAM - 32 GB de RAM ayudan poco si la GPU solo tiene 4 GB de VRAM. Para inferencia por GPU cuenta la memoria de gráficos.
- TOPS no lo dicen todo - Un valor TOPS alto no significa automáticamente que tu modelo se ejecute rápido. El ancho de banda de memoria y la arquitectura son igualmente importantes.
- Los mini PCs no son actualizables - Si después quieres más memoria, a menudo tienes que comprar un dispositivo nuevo. Elige suficiente RAM desde el principio.
- Apple Silicon es eficiente, pero no todo se ejecuta nativamente - Algunos modelos de código abierto se optimizan primero para CUDA y funcionan mejor en Linux o Windows con GPU Nvidia.
Enlaces relacionados
Preguntas frecuentes
¿Cuál es la diferencia entre RAM y VRAM?
RAM es la memoria de acceso aleatorio de tu equipo, VRAM es la memoria de la tarjeta gráfica. En inferencia por CPU el modelo reside en RAM, en inferencia por GPU en VRAM. La inferencia por GPU es mucho más rápida, pero necesita suficiente VRAM. Más detalles en el artículo RAM vs. VRAM.
¿Qué es más importante: RAM o VRAM?
Ambos. La inferencia basada en CPU necesita mucha RAM, la basada en GPU principalmente VRAM. Para modelos más grandes, una tarjeta gráfica con suficiente VRAM generalmente es más rápida.
¿Qué significa TOPS?
TOPS significa Tera Operations Per Second. Mide cuántas operaciones de cálculo puede realizar un chip para tareas de IA por segundo. Valores más altos significan potencialmente inferencia de IA más rápida, pero el ancho de banda de memoria y la arquitectura son igualmente importantes.
¿Necesito una tarjeta gráfica para IA local?
No necesariamente. Modelos pequeños como Llama 3.1 8B también se ejecutan en la CPU. Para respuestas más rápidas y modelos más grandes, se recomienda una GPU con suficiente VRAM.
¿Qué es una APU?
Una APU combina CPU y GPU en un solo chip. Ejemplos son Apple Silicon y AMD Ryzen AI Max. La ventaja es que ambos procesadores pueden acceder a la misma memoria, lo cual es muy útil para IA local.
¿Qué es Unified Memory?
Con Unified Memory, CPU y GPU comparten la misma memoria de acceso aleatorio. Esto significa que una Mac con 32 GB de RAM puede usar esos 32 GB también para la GPU. Con una tarjeta gráfica clásica, el VRAM es separado y limitado.
¿Cuánta RAM necesito para IA local?
Para modelos de 7B mínimo 16 GB de RAM, mejor 32 GB. Modelos más grandes como 70B requieren 64 GB o más. Con APIs en la nube es suficiente la memoria para el framework en sí.
¿Cuánto VRAM necesito para IA local?
Para modelos de 7B cuantizados mínimo 8 GB de VRAM. Para modelos de 13B 12 GB o más. Modelos de 70B necesitan 24 GB o más, a menudo múltiples GPUs.
¿Por qué es importante una SSD?
Un modelo de lenguaje puede tener varios gigabytes. Una SSD NVMe carga el modelo mucho más rápido que una HDD. Esto reduce el tiempo de inicio y proporciona un flujo de trabajo más fluido.
¿Vale la pena un mini PC para IA local?
Sí, si buscas hardware compacto y eficiente en energía. Los mini PCs con Ryzen AI Max o Apple Silicon ofrecen mucha memoria en poco espacio. Asegúrate de elegir suficiente RAM desde el inicio, ya que los mini PCs a menudo no son actualizables.
¿Dónde encuentro guía de compra?
En la sección Guía de compra de hardware para IA encontrarás recomendaciones para sistemas principiantes. El artículo PC para IA principiantes ofrece modelos concretos y rangos de precios.
¿Qué es cuantización y qué relación tiene con el hardware?
La cuantización reduce la precisión de un modelo para ejecutarlo con menos memoria. Esto permite que modelos más grandes se ejecuten en hardware más pequeño. Más detalles en el artículo Cuantización.


