Skip to content
BotServBotServ
HardwareGPUVRAMRequisitosSetup

Requisitos de Hardware para Agentes IA

Requisitos de hardware para agentes IA. GPU, VRAM, RAM, CPU y recomendaciones para diferentes configuraciones.

S

schutzgeist

5 min read
Requisitos de Hardware para Agentes IA

Requisitos de Hardware para Agentes de IA

Qué cubre este artículo

  • Qué hardware necesitas para agentes de IA.
  • Requisitos de GPU, VRAM, RAM y CPU.
  • Recomendaciones para diferentes configuraciones, desde básicas hasta de alto rendimiento.
  • Cómo dimensionar hardware para tus agentes.
  • Buenas prácticas para optimizar costos y escalar.

Introducción: requisitos de hardware explicados

Los agentes de IA requieren potencia de cálculo: GPU para ejecutar el modelo, RAM para el código del agente, CPU para herramientas y orquestación. Los requisitos dependen del tamaño del modelo, la cantidad de agentes y la complejidad de las tareas.

Este artículo está dirigido a usuarios que planean hardware para agentes de IA. Encontrarás conceptos básicos en Hardware y Calculadora de VRAM.

¿Por qué necesito saber sobre requisitos de hardware?

Imagina que compras una GPU para tu agente. Si es demasiado pequeña, el agente será lento y frustrante. Si es demasiado grande, gastarás dinero innecesariamente. La elección correcta depende del modelo (¿7B? ¿70B?), del número de agentes (¿1? ¿10?) y del volumen de uso.

Requisitos de hardware en resumen

GPU más VRAM para ejecutar el modelo (el factor más importante). RAM para el código del agente y las herramientas. CPU para orquestación. Para 1 agente: RTX 3060. Para 10 agentes: RTX 4090 o varias GPUs.

La idea central es que la GPU es el cuello de botella, así que dimensionémosla correctamente.

Para quién es este artículo

  • Compradores que planean hardware para agentes.
  • Usuarios de self-hosting que equipan servidores para agentes.
  • Tomadores de decisiones que presupuestan para hardware.
  • Entusiastas que quieren aprovechar hardware existente.

Términos clave

  • GPU - Tarjeta gráfica para inferencia. Cuándo es útil: para LLMs.
  • VRAM - Memoria de GPU. Cuándo es útil: para el tamaño del modelo.
  • RAM - Memoria del sistema. Cuándo es útil: para el código del agente.
  • CPU - Procesador. Cuándo es útil: para herramientas y orquestación.
  • Calculadora de VRAM - Calcula necesidades de memoria. Cuándo es útil: para dimensionamiento.
  • Ollama - Servidor de modelos. Cuándo es útil: para servir modelos.

Requisitos de hardware por tamaño de modelo

ModeloVRAM (Q4)VRAM (Q8)RAMCPUGPU Recomendada
3B2 GB3 GB4 GB4 CoresGTX 1650
7B4-5 GB7 GB8 GB4 CoresRTX 3060
8B5 GB8 GB8 GB4 CoresRTX 3060
13B8 GB13 GB16 GB6 CoresRTX 4070
14B9 GB14 GB16 GB6 CoresRTX 4070
32B20 GB32 GB32 GB8 CoresRTX 4090
70B40 GB70 GB64 GB16 Cores2x RTX 4090

Recomendaciones de configuración

Básico: 1 agente, modelo pequeño

CPU: 4 Cores (Intel i5 / AMD Ryzen 5)
RAM: 16 GB
GPU: RTX 3060 12GB
VRAM: 12 GB
Modelo: llama3.1:8b (Q4)
Costo: ~800-1.000 €

Intermedio: 2-3 agentes, modelo mediano

CPU: 8 Cores (Intel i7 / AMD Ryzen 7)
RAM: 32 GB
GPU: RTX 4070 12GB
VRAM: 12 GB
Modelo: llama3.1:8b (Q4) o 13B (Q4)
Costo: ~1.500-2.000 €

Alto rendimiento: 5-10 agentes, modelo grande

CPU: 16 Cores (Intel i9 / AMD Ryzen 9)
RAM: 64 GB
GPU: RTX 4090 24GB
VRAM: 24 GB
Modelo: llama3.1:70b (Q4) o múltiples modelos 8B
Costo: ~3.000-4.000 €

Enterprise: muchos agentes, escalado horizontal

CPU: 32 Cores (AMD EPYC / Intel Xeon)
RAM: 128 GB
GPU: 2x RTX 4090 o A100
VRAM: 48 GB
Modelo: Múltiples modelos o 70B
Costo: ~10.000+ €

CPU vs. GPU para agentes

ComponenteFunciónImportancia
GPUInferencia de LLM⭐⭐⭐⭐⭐ Crítica
VRAMAlmacenamiento del modelo⭐⭐⭐⭐⭐ Crítica
RAMCódigo del agente, herramientas⭐⭐⭐⭐ Importante
CPUOrquestación, herramientas⭐⭐⭐ Media
SSDCarga de modelos, logs⭐⭐ Deseable

Ejemplo práctico: planificación de hardware

def plan_hardware(agents, model_size, parallel_requests):
    """Planificar hardware"""

    # VRAM por agente
    vram_per_agent = {
        "7b": 5,
        "8b": 5,
        "13b": 8,
        "32b": 20,
        "70b": 40
    }

    # VRAM total
    total_vram = agents * vram_per_agent[model_size]

    # RAM para código de agentes
    ram_per_agent = 2  # GB
    total_ram = agents * ram_per_agent + 8  # +8 para sistema

    # CPU para orquestación
    cpu_cores = max(4, agents)

    # Recomendación de GPU
    if total_vram <= 12:
        gpu = "RTX 3060/4070 (12GB)"
    elif total_vram <= 24:
        gpu = "RTX 4090 (24GB)"
    elif total_vram <= 48:
        gpu = "2x RTX 4090 o A100"
    else:
        gpu = "Múltiples servidores o nube"

    return {
        "gpu": gpu,
        "vram_needed": total_vram,
        "ram_needed": total_ram,
        "cpu_cores": cpu_cores
    }

# Ejemplo: 5 agentes, modelo 8B
result = plan_hardware(agents=5, model_size="8b", parallel_requests=5)
# Output: GPU: RTX 4090, VRAM: 25 GB, RAM: 18 GB, CPU: 8 Cores

Consideraciones de seguridad

  • Fallo de hardware: GPU o servidor puede fallar. Se necesita estrategia de respaldo.
  • Costos de energía: GPU en funcionamiento continuo cuesta 50-100 €/mes en electricidad.
  • Refrigeración: GPU necesita buena ventilación. El sobrecalentamiento reduce la vida útil.
  • Espacio: El servidor necesita espacio y buena circulación de aire.

Errores comunes

  • GPU demasiado pequeña: VRAM insuficiente significa que el modelo no se carga o es muy lento.
  • RAM insuficiente: El código del agente y las herramientas requieren RAM. Mínimo 16 GB.
  • CPU subestimada: Muchos agentes necesitan CPU para orquestación.
  • Costos de energía olvidados: GPU en funcionamiento continuo es costosa.
  • Sin margen de crecimiento: Planifica reserva para expansión futura.

Enlaces relacionados

Puntos clave:

  • GPU y VRAM son los factores más importantes para agentes de IA.
  • Modelo 8B: ~5 GB VRAM. Modelo 70B: ~40 GB VRAM.
  • RAM para código de agentes: 2 GB por agente + 8 GB para el sistema.
  • CPU para orquestación: 4-16 cores según la cantidad de agentes.
  • Para 1 agente: RTX 3060. Para 10 agentes: RTX 4090 o varias GPUs.

Preguntas frecuentes

¿Qué hardware necesito?

GPU con suficiente VRAM para el modelo (8B: 5 GB, 70B: 40 GB). RAM para código de agentes (16 GB+). CPU para orquestación (4-16 cores).

¿Cuánta VRAM necesito?

Modelo 8B Q4: ~5 GB. 13B: ~8 GB. 32B: ~20 GB. 70B: ~40 GB. Un modelo por agente, aunque los modelos pueden compartirse.

¿Qué GPU recomiendan?

RTX 3060 (12GB) para 1-2 agentes con modelo 8B. RTX 4090 (24GB) para varios agentes o modelos más grandes. Para Enterprise: A100 o múltiples GPUs.

¿Cuán importante es la CPU?

Moderadamente importante. Se usa para orquestación y herramientas. 4 cores para 1-2 agentes, 8-16 cores para varios agentes.

¿Cuánta RAM necesito?

Mínimo 16 GB para 1-2 agentes. 32 GB para 3-5 agentes. 64 GB+ para muchos agentes o modelos grandes.

¿Cuántos agentes puedo ejecutar?

Con RTX 4090: 4-5 agentes con modelo 8B (VRAM compartida) o 1 agente con 70B. Para más: varias GPUs o vLLM para procesamiento por lotes.

¿Cuánto cuesta el hardware?

Básico: ~1.000 € (RTX 3060). Intermedio: ~2.000 € (RTX 4070). Alto rendimiento: ~4.000 € (RTX 4090). Enterprise: 10.000+ €.

¿Cómo escalo el hardware?

Verticalmente: GPU más grande (más VRAM). Horizontalmente: varias GPUs o servidores. Para muchos agentes: vLLM para mejor utilización de GPU.

Fuentes y lecturas adicionales

Volver al blog
Share:

Entradas relacionadas