Skip to content
BotServBotServ
HardwareGPUVRAMAnforderungenSetup

Hardware-Anforderungen für KI-Agenten

Hardware-Anforderungen für KI-Agenten. GPU, VRAM, RAM, CPU und Empfehlungen für verschiedene Setups.

S

schutzgeist

4 min read
Hardware-Anforderungen für KI-Agenten

Hardware-Anforderungen für KI-Agenten

Was dieser Artikel über Hardware-Anforderungen behandelt

  • Welche Hardware Du für KI-Agenten brauchst.
  • GPU, VRAM, RAM und CPU-Anforderungen.
  • Empfehlungen für verschiedene Setups (Einstieg bis High-End).
  • Wie Du Hardware für Deine Agenten dimensionierst.
  • Best Practices für Kosten-Nutzen und Skalierung.

Einleitung: Hardware-Anforderungen verständlich erklärt

KI-Agenten brauchen Rechenleistung: GPU für das Modell, RAM für den Agenten-Code, CPU für Tools und Orchestrierung. Die Anforderungen hängen vom Modell, der Anzahl Agenten und der Komplexität ab.

Dieser Artikel richtet sich an Anwender, die Hardware für KI-Agenten planen. Grundlagen findest Du in Hardware und VRAM-Rechner.

Warum brauche ich Hardware-Anforderungen?

Stell Dir vor, Du kaufst eine GPU für Deinen Agenten. Zu klein: Agent ist langsam, frustriert. Zu groß: Überteuert, unnötig. Die richtige Hardware hängt vom Modell (7B? 70B?), der Anzahl Agenten (1? 10?) und der Nutzung (wenig? viel?) ab.

Hardware-Anforderungen kurz erklärt

GPU + VRAM für das Modell (wichtigster Faktor). RAM für Agent-Code und Tools. CPU für Orchestrierung. Für 1 Agent: RTX 3060. Für 10 Agenten: RTX 4090 oder mehrere GPUs.

Der Kerngedanke lautet: GPU ist der Bottleneck, richtig dimensionieren.

Für wen ist dieser Artikel gedacht?

  • Käufer, die Hardware für Agenten planen.
  • Self-Hoster, die Server für Agenten ausstatten.
  • Entscheider, die Budget für Hardware planen.
  • Tinkerer, die bestehende Hardware nutzen wollen.

Wichtige Begriffe

  • GPU - Grafikkarte für Inference. Wann nützlich: für LLMs.
  • VRAM - GPU-Speicher. Wann nützlich: für Modellgröße.
  • RAM - Arbeitsspeicher. Wann nützlich: für Agent-Code.
  • CPU - Prozessor. Wann nützlich: für Tools/Orchestrierung.
  • VRAM-Rechner - Speicherbedarf. Wann nützlich: für Berechnung.
  • Ollama - Modellserver. Wann nützlich: für Modelle.

Hardware-Anforderungen nach Modellgröße

ModellVRAM (Q4)VRAM (Q8)RAMCPUGPU-Empfehlung
3B2 GB3 GB4 GB4 CoresGTX 1650
7B4-5 GB7 GB8 GB4 CoresRTX 3060
8B5 GB8 GB8 GB4 CoresRTX 3060
13B8 GB13 GB16 GB6 CoresRTX 4070
14B9 GB14 GB16 GB6 CoresRTX 4070
32B20 GB32 GB32 GB8 CoresRTX 4090
70B40 GB70 GB64 GB16 Cores2x RTX 4090

Setup-Empfehlungen

Einstieg: 1 Agent, kleines Modell

CPU: 4 Cores (Intel i5 / AMD Ryzen 5)
RAM: 16 GB
GPU: RTX 3060 12GB
VRAM: 12 GB
Modell: llama3.1:8b (Q4)
Kosten: ~800-1.000 €

Mittel: 2-3 Agenten, mittleres Modell

CPU: 8 Cores (Intel i7 / AMD Ryzen 7)
RAM: 32 GB
GPU: RTX 4070 12GB
VRAM: 12 GB
Modell: llama3.1:8b (Q4) oder 13B (Q4)
Kosten: ~1.500-2.000 €

High-End: 5-10 Agenten, großes Modell

CPU: 16 Cores (Intel i9 / AMD Ryzen 9)
RAM: 64 GB
GPU: RTX 4090 24GB
VRAM: 24 GB
Modell: llama3.1:70b (Q4) oder mehrere 8B
Kosten: ~3.000-4.000 €

Enterprise: Viele Agenten, horizontale Skalierung

CPU: 32 Cores (AMD EPYC / Intel Xeon)
RAM: 128 GB
GPU: 2x RTX 4090 oder A100
VRAM: 48 GB
Modell: Mehrere Modelle oder 70B
Kosten: ~10.000+ €

CPU vs. GPU für Agenten

KomponenteFunktionWichtigkeit
GPULLM-Inference⭐⭐⭐⭐⭐ Kritisch
VRAMModell-Speicher⭐⭐⭐⭐⭐ Kritisch
RAMAgent-Code, Tools⭐⭐⭐⭐ Wichtig
CPUOrchestrierung, Tools⭐⭐⭐ Mittel
SSDModell-Loading, Logs⭐⭐ Nice to have

Praxisbeispiel: Hardware-Planung

def plan_hardware(agents, model_size, parallel_requests):
    """Hardware planen"""

    # VRAM pro Agent
    vram_per_agent = {
        "7b": 5,
        "8b": 5,
        "13b": 8,
        "32b": 20,
        "70b": 40
    }

    # Gesamt-VRAM
    total_vram = agents * vram_per_agent[model_size]

    # RAM für Agenten-Code
    ram_per_agent = 2  # GB
    total_ram = agents * ram_per_agent + 8  # +8 für System

    # CPU für Orchestrierung
    cpu_cores = max(4, agents)

    # GPU-Empfehlung
    if total_vram <= 12:
        gpu = "RTX 3060/4070 (12GB)"
    elif total_vram <= 24:
        gpu = "RTX 4090 (24GB)"
    elif total_vram <= 48:
        gpu = "2x RTX 4090 oder A100"
    else:
        gpu = "Mehrere Server oder Cloud"

    return {
        "gpu": gpu,
        "vram_needed": total_vram,
        "ram_needed": total_ram,
        "cpu_cores": cpu_cores
    }

# Beispiel: 5 Agenten, 8B-Modell
result = plan_hardware(agents=5, model_size="8b", parallel_requests=5)
# Output: GPU: RTX 4090, VRAM: 25 GB, RAM: 18 GB, CPU: 8 Cores

Sicherheitshinweise

  • Hardware-Ausfall: GPU/Server kann ausfallen. Backup-Strategie nötig.
  • Stromkosten: GPU bei Dauerbetrieb = 50-100 €/Monat Strom.
  • Kühlung: GPU braucht gute Kühlung. Überhitzung reduziert Lebensdauer.
  • Platz: Server braucht Platz, gute Belüftung.

Typische Stolpersteine

  • Zu kleine GPU: Zu wenig VRAM = Modell lädt nicht oder sehr langsam.
  • Zu wenig RAM: Agent-Code + Tools brauchen RAM. 16 GB Minimum.
  • CPU unterschätzt: Viele Agenten brauchen CPU für Orchestrierung.
  • Stromkosten vergessen: GPU bei Dauerbetrieb ist teuer.
  • Keine Reserve: Für Wachstum Reserven einplanen.

Key Takeaways:

  • GPU/VRAM ist der wichtigste Faktor für KI-Agenten.
  • 8B-Modell: ~5 GB VRAM. 70B: ~40 GB VRAM.
  • RAM für Agent-Code: 2 GB pro Agent + 8 GB System.
  • CPU für Orchestrierung: 4-16 Cores je nach Anzahl Agenten.
  • Für 1 Agent: RTX 3060. Für 10 Agenten: RTX 4090 oder mehrere GPUs.

FAQ

Welche Hardware brauche ich?

GPU mit genug VRAM für das Modell (8B: 5 GB, 70B: 40 GB). RAM für Agent-Code (16 GB+). CPU für Orchestrierung (4-16 Cores).

Wie viel VRAM brauche ich?

8B-Modell Q4: ~5 GB. 13B: ~8 GB. 32B: ~20 GB. 70B: ~40 GB. Pro Agent 1 Modell, Modelle können geteilt werden.

Welche GPU empfehlt ihr?

RTX 3060 (12GB) für 1-2 Agenten mit 8B. RTX 4090 (24GB) für mehrere Agenten oder größere Modelle. Für Enterprise: A100 oder mehrere GPUs.

Wie wichtig ist die CPU?

Mittel wichtig. Für Orchestrierung und Tools. 4 Cores für 1-2 Agenten, 8-16 Cores für mehrere Agenten.

Wie viel RAM brauche ich?

16 GB Minimum für 1-2 Agenten. 32 GB für 3-5 Agenten. 64 GB+ für viele Agenten oder große Modelle.

Wie viele Agenten kann ich betreiben?

Mit RTX 4090: 4-5 Agenten mit 8B-Modell (VRAM geteilt) oder 1 Agent mit 70B. Für mehr: Mehrere GPUs oder vLLM für Batch-Processing.

Was kostet die Hardware?

Einstieg: ~1.000 € (RTX 3060). Mittel: ~2.000 € (RTX 4070). High-End: ~4.000 € (RTX 4090). Enterprise: 10.000+ €.

Wie skaliere ich Hardware?

Vertikal: Größere GPU (mehr VRAM). Horizontal: Mehrere GPUs oder Server. Für viele Agenten: vLLM für bessere GPU-Nutzung.

Quellen und weiterführende Literatur

Zurück zum KI Blog
Share:

Ähnliche Beiträge