Requisitos de Hardware para Agentes de IA
Qué cubre este artículo
- Qué hardware necesitas para agentes de IA.
- Requisitos de GPU, VRAM, RAM y CPU.
- Recomendaciones para diferentes configuraciones, desde básicas hasta de alto rendimiento.
- Cómo dimensionar hardware para tus agentes.
- Buenas prácticas para optimizar costos y escalar.
Introducción: requisitos de hardware explicados
Los agentes de IA requieren potencia de cálculo: GPU para ejecutar el modelo, RAM para el código del agente, CPU para herramientas y orquestación. Los requisitos dependen del tamaño del modelo, la cantidad de agentes y la complejidad de las tareas.
Este artículo está dirigido a usuarios que planean hardware para agentes de IA. Encontrarás conceptos básicos en Hardware y Calculadora de VRAM.
¿Por qué necesito saber sobre requisitos de hardware?
Imagina que compras una GPU para tu agente. Si es demasiado pequeña, el agente será lento y frustrante. Si es demasiado grande, gastarás dinero innecesariamente. La elección correcta depende del modelo (¿7B? ¿70B?), del número de agentes (¿1? ¿10?) y del volumen de uso.
Requisitos de hardware en resumen
GPU más VRAM para ejecutar el modelo (el factor más importante). RAM para el código del agente y las herramientas. CPU para orquestación. Para 1 agente: RTX 3060. Para 10 agentes: RTX 4090 o varias GPUs.
La idea central es que la GPU es el cuello de botella, así que dimensionémosla correctamente.
Para quién es este artículo
- Compradores que planean hardware para agentes.
- Usuarios de self-hosting que equipan servidores para agentes.
- Tomadores de decisiones que presupuestan para hardware.
- Entusiastas que quieren aprovechar hardware existente.
Términos clave
- GPU - Tarjeta gráfica para inferencia. Cuándo es útil: para LLMs.
- VRAM - Memoria de GPU. Cuándo es útil: para el tamaño del modelo.
- RAM - Memoria del sistema. Cuándo es útil: para el código del agente.
- CPU - Procesador. Cuándo es útil: para herramientas y orquestación.
- Calculadora de VRAM - Calcula necesidades de memoria. Cuándo es útil: para dimensionamiento.
- Ollama - Servidor de modelos. Cuándo es útil: para servir modelos.
Requisitos de hardware por tamaño de modelo
| Modelo | VRAM (Q4) | VRAM (Q8) | RAM | CPU | GPU Recomendada |
|---|---|---|---|---|---|
| 3B | 2 GB | 3 GB | 4 GB | 4 Cores | GTX 1650 |
| 7B | 4-5 GB | 7 GB | 8 GB | 4 Cores | RTX 3060 |
| 8B | 5 GB | 8 GB | 8 GB | 4 Cores | RTX 3060 |
| 13B | 8 GB | 13 GB | 16 GB | 6 Cores | RTX 4070 |
| 14B | 9 GB | 14 GB | 16 GB | 6 Cores | RTX 4070 |
| 32B | 20 GB | 32 GB | 32 GB | 8 Cores | RTX 4090 |
| 70B | 40 GB | 70 GB | 64 GB | 16 Cores | 2x RTX 4090 |
Recomendaciones de configuración
Básico: 1 agente, modelo pequeño
CPU: 4 Cores (Intel i5 / AMD Ryzen 5)
RAM: 16 GB
GPU: RTX 3060 12GB
VRAM: 12 GB
Modelo: llama3.1:8b (Q4)
Costo: ~800-1.000 €
Intermedio: 2-3 agentes, modelo mediano
CPU: 8 Cores (Intel i7 / AMD Ryzen 7)
RAM: 32 GB
GPU: RTX 4070 12GB
VRAM: 12 GB
Modelo: llama3.1:8b (Q4) o 13B (Q4)
Costo: ~1.500-2.000 €
Alto rendimiento: 5-10 agentes, modelo grande
CPU: 16 Cores (Intel i9 / AMD Ryzen 9)
RAM: 64 GB
GPU: RTX 4090 24GB
VRAM: 24 GB
Modelo: llama3.1:70b (Q4) o múltiples modelos 8B
Costo: ~3.000-4.000 €
Enterprise: muchos agentes, escalado horizontal
CPU: 32 Cores (AMD EPYC / Intel Xeon)
RAM: 128 GB
GPU: 2x RTX 4090 o A100
VRAM: 48 GB
Modelo: Múltiples modelos o 70B
Costo: ~10.000+ €
CPU vs. GPU para agentes
| Componente | Función | Importancia |
|---|---|---|
| GPU | Inferencia de LLM | ⭐⭐⭐⭐⭐ Crítica |
| VRAM | Almacenamiento del modelo | ⭐⭐⭐⭐⭐ Crítica |
| RAM | Código del agente, herramientas | ⭐⭐⭐⭐ Importante |
| CPU | Orquestación, herramientas | ⭐⭐⭐ Media |
| SSD | Carga de modelos, logs | ⭐⭐ Deseable |
Ejemplo práctico: planificación de hardware
def plan_hardware(agents, model_size, parallel_requests):
"""Planificar hardware"""
# VRAM por agente
vram_per_agent = {
"7b": 5,
"8b": 5,
"13b": 8,
"32b": 20,
"70b": 40
}
# VRAM total
total_vram = agents * vram_per_agent[model_size]
# RAM para código de agentes
ram_per_agent = 2 # GB
total_ram = agents * ram_per_agent + 8 # +8 para sistema
# CPU para orquestación
cpu_cores = max(4, agents)
# Recomendación de GPU
if total_vram <= 12:
gpu = "RTX 3060/4070 (12GB)"
elif total_vram <= 24:
gpu = "RTX 4090 (24GB)"
elif total_vram <= 48:
gpu = "2x RTX 4090 o A100"
else:
gpu = "Múltiples servidores o nube"
return {
"gpu": gpu,
"vram_needed": total_vram,
"ram_needed": total_ram,
"cpu_cores": cpu_cores
}
# Ejemplo: 5 agentes, modelo 8B
result = plan_hardware(agents=5, model_size="8b", parallel_requests=5)
# Output: GPU: RTX 4090, VRAM: 25 GB, RAM: 18 GB, CPU: 8 Cores
Consideraciones de seguridad
- Fallo de hardware: GPU o servidor puede fallar. Se necesita estrategia de respaldo.
- Costos de energía: GPU en funcionamiento continuo cuesta 50-100 €/mes en electricidad.
- Refrigeración: GPU necesita buena ventilación. El sobrecalentamiento reduce la vida útil.
- Espacio: El servidor necesita espacio y buena circulación de aire.
Errores comunes
- GPU demasiado pequeña: VRAM insuficiente significa que el modelo no se carga o es muy lento.
- RAM insuficiente: El código del agente y las herramientas requieren RAM. Mínimo 16 GB.
- CPU subestimada: Muchos agentes necesitan CPU para orquestación.
- Costos de energía olvidados: GPU en funcionamiento continuo es costosa.
- Sin margen de crecimiento: Planifica reserva para expansión futura.
Enlaces relacionados
- Hardware - Descripción general de hardware.
- Calculadora de VRAM - Calcula necesidades de memoria.
- Recomendaciones de GPU - Guía de compra de GPU.
- Ejecutar agentes de IA localmente - Descripción general.
- vLLM - Para optimizar rendimiento.
- Múltiples agentes - Para escalado.
Puntos clave:
- GPU y VRAM son los factores más importantes para agentes de IA.
- Modelo 8B: ~5 GB VRAM. Modelo 70B: ~40 GB VRAM.
- RAM para código de agentes: 2 GB por agente + 8 GB para el sistema.
- CPU para orquestación: 4-16 cores según la cantidad de agentes.
- Para 1 agente: RTX 3060. Para 10 agentes: RTX 4090 o varias GPUs.
Preguntas frecuentes
¿Qué hardware necesito?
¿Cuánta VRAM necesito?
¿Qué GPU recomiendan?
¿Cuán importante es la CPU?
¿Cuánta RAM necesito?
¿Cuántos agentes puedo ejecutar?
¿Cuánto cuesta el hardware?
¿Cómo escalo el hardware?
Fuentes y lecturas adicionales
- Ollama - Servidor de modelos.
- NVIDIA - GPUs.
- Calculadora de VRAM - Calcula necesidades de memoria.


