Comprar GPU para IA local
Qué cubre este artículo sobre la compra de GPUs para IA local
- El papel de la VRAM en la decisión de compra.
- Cómo difieren las generaciones y arquitecturas de GPU.
- Qué GPUs son adecuadas para diferentes tamaños de modelos.
- Qué considerar al comprar GPUs usadas o de consumo.
- Criterios típicos de compra y errores comunes.
Introducción: Comprar GPU para IA local
La GPU es el componente más importante cuando necesitas ejecutar modelos de IA locales rápidamente. Acelera la carga e inferencia de modelos de lenguaje, imagen e embedding. La elección de la GPU correcta depende principalmente del tamaño del modelo, la velocidad deseada y el presupuesto. La VRAM suele ser el factor más decisivo.
Este artículo te ayuda a encontrar la GPU adecuada para proyectos de IA local sin invertir en hardware costoso o inadecuado.
Conceptos clave
- VRAM: Memoria de video de la GPU, determina qué tamaños de modelo caben.
- CUDA: Plataforma de programación de Nvidia, compatible con la mayoría de herramientas de IA.
- ROCm: Equivalente de código abierto de AMD a CUDA.
- Tensor-Cores: Unidades de cálculo especializadas para IA en GPUs RTX y datacenter de Nvidia.
- Memory-Bandbreite: Determina qué tan rápido se cargan los datos en la GPU.
- FP16: Cálculo de precisión media, ahorra VRAM y suele ser suficiente para IA.
- Cuantificación: Reducción de la precisión del modelo para cargar modelos más grandes en menos VRAM.
¿Por qué es tan importante la VRAM?
Un modelo debe caber completamente en la VRAM. Con cuantificación de 4 bits, hay una regla general aproximada:
- Modelo 7B: aproximadamente 4 a 6 GB de VRAM.
- Modelo 13B: aproximadamente 8 a 10 GB de VRAM.
- Modelo 30B: aproximadamente 20 GB de VRAM.
- Modelo 70B: aproximadamente 40 GB de VRAM.
Si quieres usar un modelo 13B en 4 bits, necesitas al menos 8 GB de VRAM. Para 30B, 12 GB no son suficientes.
GPUs de consumo para IA local
Nvidia GeForce RTX 3060 12 GB
- Entrada económica.
- 12 GB de VRAM permiten modelos 7B y modelos 13B más pequeños.
- Más lenta que generaciones más recientes.
Nvidia GeForce RTX 4060 Ti 16 GB
- Moderna y eficiente en energía.
- 16 GB de VRAM caben para modelos 13B y modelos 30B más pequeños.
- Ancho de banda inferior al de 4070 Ti o 3090.
Nvidia GeForce RTX 4070 Ti Super 16 GB
- Buen rendimiento a precios moderados.
- 16 GB de VRAM y alto ancho de banda.
- Ideal para modelos 13B y 30B con cuantificación.
Nvidia GeForce RTX 3090 / 3090 Ti 24 GB
- Mucha VRAM por el precio.
- Popular entre entusiastas de IA.
- Alto consumo de energía, frecuentemente disponible usada.
Nvidia GeForce RTX 4090 24 GB
- Actualmente la GPU de consumo más rápida.
- 24 GB de VRAM caben para modelos 30B y mayores.
- Cara, pero extremadamente rápida.
AMD Radeon RX 7900 XTX 24 GB
- Mucha VRAM a un precio competitivo.
- El soporte de ROCm mejora, pero no tan maduro como CUDA.
- Experimental en muchas herramientas.
GPUs usadas
- RTX 2080 Ti con 11 GB: Económica, pero sin Tensor-Cores de generación más reciente.
- RTX 3090 con 24 GB: Muy popular usada, cuidado con antecedentes de minería.
- Titan X Pascal con 12 GB: Anticuada, pero aún útil para modelos 7B.
- Quadro P6000 con 24 GB: Tarjeta profesional, frecuentemente barata usada, pero lenta.
Con dispositivos usados, revisa polvo, estado del ventilador e historial potencial de minería.
GPUs de servidor y datacenter
- Nvidia A100 40/80 GB: Perfecta para modelos grandes, muy cara.
- Nvidia A40 48 GB: Buena alternativa a la A100.
- Nvidia L40S 48 GB: Tarjeta de inferencia moderna.
- Nvidia RTX A6000 48 GB: Variante profesional con mucha VRAM.
- AMD Instinct MI100/MI210: Usable con ROCm, pero ecosistema más limitado.
Criterios de compra importantes
- Tamaño de VRAM: Cuello de botella principal.
- Memory-Bandbreite: Afecta la velocidad de inferencia.
- Número de CUDA-Cores o Stream Processors: Más es más rápido.
- Consumo de energía: Considera la fuente de alimentación y refrigeración.
- Soporte de controladores: Nvidia generalmente mejor, AMD varía.
- Espacio en la carcasa: Las GPUs largas o gruesas no caben en todas partes.
- PCIe-Lanes: x16 ideal, x8 también funciona a menudo.
- Precio por GB de VRAM: Ayuda en la comparación.
Qué tener en cuenta con Nvidia
- Instala controladores y CUDA Toolkit.
nvidia-smimuestra utilización y VRAM.- Para contenedores activa
--gpus all. - Ollama, llama.cpp y vLLM soportan Nvidia muy bien.
Qué tener en cuenta con AMD
- ROCm debe ser compatible, no todas las GPUs son soportadas.
- Las GPUs antiguas GCN como HD 7870 XT no son soportadas por ROCm.
- llama.cpp con Vulkan puede servir como alternativa, pero es más lento.
- Generalmente mejor soporte en Linux que en Windows.
Apple Silicon
- No se necesita GPU dedicada, la memoria unificada funciona como VRAM.
- 16 GB de RAM son suficientes para modelos 7B pequeños.
- 32 a 64 GB de memoria unificada permiten modelos más grandes.
- El backend Metal de llama.cpp y Ollama está bien optimizado.
Recomendaciones de relación precio-rendimiento
| Presupuesto | GPU recomendada |
|---|---|
| Hasta 300 euros | RTX 3060 12 GB usada |
| 300 a 600 euros | RTX 4060 Ti 16 GB |
| 600 a 1000 euros | RTX 4070 Ti Super 16 GB |
| 1000 a 1500 euros | RTX 3090 24 GB usada o RX 7900 XTX |
| Más de 1500 euros | RTX 4090 24 GB o A6000 |
Errores típicos de compra
- VRAM insuficiente: 8 GB apenas alcanzan para modelos 13B.
- GPU antigua sin Tensor-Cores: Falta potencia de cálculo para IA.
- AMD sin verificar ROCm: Podría no funcionar en absoluto.
- GPU de servidor sin refrigeración: Las tarjetas con refrigeración pasiva necesitan ventiladores de carcasa.
- Mucha VRAM pero ancho de banda estrecho: El modelo grande cabe pero se ejecuta lentamente.
- Comprar GPU de minería: Alta utilización y desgaste.
Enlaces e información adicional
- Comparador GPU en BotServ.de
- Hardware de servidor usado en BotServ.de
- Proxmox en Mac Pro Trashcan en BotServ.de
- Requisitos de hardware para IA local en BotServ.de
FAQ: GPU para IA local
¿Necesito una GPU para Ollama? No, Ollama funciona también en CPU. Pero con GPU es notablemente más rápido.
¿Qué GPU para modelos 7B? Mínimo 6 GB de VRAM, mejor 8 a 12 GB.
¿Qué GPU para modelos 70B? Mínimo 40 GB de VRAM, la RTX 3090 funciona con 4 bits apenas, lo ideal es A100 o A6000.
¿Tiene sentido comprar una GPU usada? Sí, especialmente la RTX 3090 ofrece mucha VRAM por relativamente poco dinero.
¿Son las GPUs AMD adecuadas para IA? Con mucha VRAM y soporte ROCm adecuado sí, pero el ecosistema no es tan maduro como el de Nvidia.
Fuentes y lecturas adicionales
- Nvidia CUDA GPUs: https://developer.nvidia.com/cuda-gpus
- AMD ROCm: https://rocm.docs.amd.com/
- Hardware de Ollama: https://ollama.com/library
Resumen: Comprar GPU para IA local
La GPU correcta para IA local se selecciona principalmente por el tamaño de VRAM. Las tarjetas de consumo de Nvidia ofrecen el mejor ecosistema, pero AMD y Apple Silicon también son opciones según presupuesto y aplicación. Las tarjetas usadas con mucha VRAM como la RTX 3090 son populares, pero deben revisarse para detectar desgaste. Si prestas atención a VRAM, ancho de banda, consumo de energía y soporte de controladores, encontrarás la GPU adecuada para Ollama, llama.cpp y otras herramientas de IA local.


