Skip to content
BotServBotServ
Hardware para IAFundamentosRAMVRAMGPUCPUSSDTOPS

Fundamentos de Hardware para IA

Fundamentos de Hardware para IA: CPU, GPU, RAM, VRAM, SSD, APU y TOPS explicados. Qué necesitas para IA local.

S

schutzgeist

7 min read
Fundamentos de Hardware para IA

Fundamentos de Hardware para IA

Qué cubre este artículo

  • Qué componentes de hardware son importantes para IA local y por qué.
  • Cómo trabajan juntos CPU, GPU, RAM, VRAM y SSD.
  • Qué significan TOPS, APU y Unified Memory.
  • Referencias a todos los artículos de fundamentos y la guía de compra.

Introducción

Si quieres ejecutar modelos de IA localmente, necesitas hardware adecuado. Un modelo de lenguaje es un archivo grande que se carga en memoria y se procesa allí. La velocidad depende de CPU, GPU, RAM, VRAM y almacenamiento. Esta sección reúne conocimientos fundamentales que te ayudarán a entender, armar o comprar un PC para IA.

¿Por qué necesito fundamentos de hardware para IA?

Sin este conocimiento, compras a ciegas. Corres el riesgo de elegir un equipo demasiado débil para tus modelos o demasiado caro para lo que realmente necesitas. Un ejemplo: para ejecutar Llama 3.1 8B necesitas unos 8 GB de memoria para el modelo cuantizado. En una GPU con 8 GB de VRAM funciona sin problemas. En un equipo con solo 16 GB de RAM e inferencia por CPU, cada respuesta tarda varios segundos. Si lo sabes de antemano, ahorras dinero y frustración.

Los fundamentos también te ayudan a evaluar las promesas de marketing. Un mini PC con 128 GB de RAM suena impresionante, pero si el ancho de banda de memoria es bajo, un modelo grande seguirá siendo lento. Los valores TOPS en la ficha técnica no lo dicen todo, porque solo miden el rendimiento máximo en condiciones ideales.

Hardware para IA explicado brevemente

La IA local carga un modelo en memoria y calcula respuestas a partir de él. Hay dos formas de hacerlo:

  • Inferencia por CPU: El modelo reside en la memoria de acceso aleatorio normal (RAM). La CPU calcula las respuestas. Lento, pero flexible y económico.
  • Inferencia por GPU: El modelo reside en la memoria de gráficos (VRAM). La GPU calcula las respuestas en paralelo y mucho más rápido.

La memoria determina qué modelo cabe. La potencia de cálculo determina qué tan rápido vienen las respuestas. Una SSD se encarga de cargar el modelo rápidamente. Una APU como Apple Silicon o Ryzen AI Max combina CPU y GPU en un solo chip y comparte la memoria.

¿Para quién es esta sección?

  • Quieres ejecutar IA localmente y saber qué puede hacer tu equipo.
  • Estás considerando comprar un PC o mini PC nuevo.
  • Eres principiante y quieres entender mejor las promesas de marketing.
  • No necesitas conocimientos previos profundos. Los términos técnicos se explican aquí de forma clara.

Componentes importantes

ComponenteFunciónQué considerar
CPUEjecuta inferencia y el sistema operativoNúcleos modernos, mucha caché
RAMAlmacena modelos en inferencia por CPU16 GB mínimo, 32 GB mejor, 64-128 GB ideal
GPU/VRAMCálculo paralelo rápido8 GB mínimo, 16 GB o más mejor
APUCPU y GPU en un solo chipUnified o Shared Memory utiliza RAM compartida
SSDAlmacenamiento rápido para modelos500 GB o más, preferiblemente NVMe

Términos importantes

  • TOPS/NTOPS - Tera Operations Per Second. La unidad de medida para potencia de cálculo de IA. Cuanto mayor sea el valor, más rápido puede un chip ejecutar modelos.
  • APU - Accelerated Processing Unit: CPU y GPU en un solo chip, como en Apple Silicon o Ryzen AI Max.
  • Unified/Shared Memory - La memoria de acceso aleatorio se comparte entre CPU y GPU. Importante para Apple Silicon y Ryzen AI Max.
  • Quantización - Reduce la precisión de un modelo para ejecutarlo con menos memoria. Permite ejecutar modelos más grandes en hardware más pequeño.
  • VRAM - Memoria de la tarjeta gráfica dedicada. Crucial para inferencia por GPU.
  • LLM - Large Language Model, un gran modelo de lenguaje.

Contenido y artículos

Artículos relacionados adicionales:

Trampas típicas

  • RAM no es VRAM - 32 GB de RAM ayudan poco si la GPU solo tiene 4 GB de VRAM. Para inferencia por GPU cuenta la memoria de gráficos.
  • TOPS no lo dicen todo - Un valor TOPS alto no significa automáticamente que tu modelo se ejecute rápido. El ancho de banda de memoria y la arquitectura son igualmente importantes.
  • Los mini PCs no son actualizables - Si después quieres más memoria, a menudo tienes que comprar un dispositivo nuevo. Elige suficiente RAM desde el principio.
  • Apple Silicon es eficiente, pero no todo se ejecuta nativamente - Algunos modelos de código abierto se optimizan primero para CUDA y funcionan mejor en Linux o Windows con GPU Nvidia.

Enlaces relacionados

Preguntas frecuentes

¿Cuál es la diferencia entre RAM y VRAM?

RAM es la memoria de acceso aleatorio de tu equipo, VRAM es la memoria de la tarjeta gráfica. En inferencia por CPU el modelo reside en RAM, en inferencia por GPU en VRAM. La inferencia por GPU es mucho más rápida, pero necesita suficiente VRAM. Más detalles en el artículo RAM vs. VRAM.

¿Qué es más importante: RAM o VRAM?

Ambos. La inferencia basada en CPU necesita mucha RAM, la basada en GPU principalmente VRAM. Para modelos más grandes, una tarjeta gráfica con suficiente VRAM generalmente es más rápida.

¿Qué significa TOPS?

TOPS significa Tera Operations Per Second. Mide cuántas operaciones de cálculo puede realizar un chip para tareas de IA por segundo. Valores más altos significan potencialmente inferencia de IA más rápida, pero el ancho de banda de memoria y la arquitectura son igualmente importantes.

¿Necesito una tarjeta gráfica para IA local?

No necesariamente. Modelos pequeños como Llama 3.1 8B también se ejecutan en la CPU. Para respuestas más rápidas y modelos más grandes, se recomienda una GPU con suficiente VRAM.

¿Qué es una APU?

Una APU combina CPU y GPU en un solo chip. Ejemplos son Apple Silicon y AMD Ryzen AI Max. La ventaja es que ambos procesadores pueden acceder a la misma memoria, lo cual es muy útil para IA local.

¿Qué es Unified Memory?

Con Unified Memory, CPU y GPU comparten la misma memoria de acceso aleatorio. Esto significa que una Mac con 32 GB de RAM puede usar esos 32 GB también para la GPU. Con una tarjeta gráfica clásica, el VRAM es separado y limitado.

¿Cuánta RAM necesito para IA local?

Para modelos de 7B mínimo 16 GB de RAM, mejor 32 GB. Modelos más grandes como 70B requieren 64 GB o más. Con APIs en la nube es suficiente la memoria para el framework en sí.

¿Cuánto VRAM necesito para IA local?

Para modelos de 7B cuantizados mínimo 8 GB de VRAM. Para modelos de 13B 12 GB o más. Modelos de 70B necesitan 24 GB o más, a menudo múltiples GPUs.

¿Por qué es importante una SSD?

Un modelo de lenguaje puede tener varios gigabytes. Una SSD NVMe carga el modelo mucho más rápido que una HDD. Esto reduce el tiempo de inicio y proporciona un flujo de trabajo más fluido.

¿Vale la pena un mini PC para IA local?

Sí, si buscas hardware compacto y eficiente en energía. Los mini PCs con Ryzen AI Max o Apple Silicon ofrecen mucha memoria en poco espacio. Asegúrate de elegir suficiente RAM desde el inicio, ya que los mini PCs a menudo no son actualizables.

¿Dónde encuentro guía de compra?

En la sección Guía de compra de hardware para IA encontrarás recomendaciones para sistemas principiantes. El artículo PC para IA principiantes ofrece modelos concretos y rangos de precios.

¿Qué es cuantización y qué relación tiene con el hardware?

La cuantización reduce la precisión de un modelo para ejecutarlo con menos memoria. Esto permite que modelos más grandes se ejecuten en hardware más pequeño. Más detalles en el artículo Cuantización.

Volver al blog
Share:

Entradas relacionadas