Hardware-Anforderungen für KI-Agenten
Was dieser Artikel über Hardware-Anforderungen behandelt
- Welche Hardware Du für KI-Agenten brauchst.
- GPU, VRAM, RAM und CPU-Anforderungen.
- Empfehlungen für verschiedene Setups (Einstieg bis High-End).
- Wie Du Hardware für Deine Agenten dimensionierst.
- Best Practices für Kosten-Nutzen und Skalierung.
Einleitung: Hardware-Anforderungen verständlich erklärt
KI-Agenten brauchen Rechenleistung: GPU für das Modell, RAM für den Agenten-Code, CPU für Tools und Orchestrierung. Die Anforderungen hängen vom Modell, der Anzahl Agenten und der Komplexität ab.
Dieser Artikel richtet sich an Anwender, die Hardware für KI-Agenten planen. Grundlagen findest Du in Hardware und VRAM-Rechner.
Warum brauche ich Hardware-Anforderungen?
Stell Dir vor, Du kaufst eine GPU für Deinen Agenten. Zu klein: Agent ist langsam, frustriert. Zu groß: Überteuert, unnötig. Die richtige Hardware hängt vom Modell (7B? 70B?), der Anzahl Agenten (1? 10?) und der Nutzung (wenig? viel?) ab.
Hardware-Anforderungen kurz erklärt
GPU + VRAM für das Modell (wichtigster Faktor). RAM für Agent-Code und Tools. CPU für Orchestrierung. Für 1 Agent: RTX 3060. Für 10 Agenten: RTX 4090 oder mehrere GPUs.
Der Kerngedanke lautet: GPU ist der Bottleneck, richtig dimensionieren.
Für wen ist dieser Artikel gedacht?
- Käufer, die Hardware für Agenten planen.
- Self-Hoster, die Server für Agenten ausstatten.
- Entscheider, die Budget für Hardware planen.
- Tinkerer, die bestehende Hardware nutzen wollen.
Wichtige Begriffe
- GPU - Grafikkarte für Inference. Wann nützlich: für LLMs.
- VRAM - GPU-Speicher. Wann nützlich: für Modellgröße.
- RAM - Arbeitsspeicher. Wann nützlich: für Agent-Code.
- CPU - Prozessor. Wann nützlich: für Tools/Orchestrierung.
- VRAM-Rechner - Speicherbedarf. Wann nützlich: für Berechnung.
- Ollama - Modellserver. Wann nützlich: für Modelle.
Hardware-Anforderungen nach Modellgröße
| Modell | VRAM (Q4) | VRAM (Q8) | RAM | CPU | GPU-Empfehlung |
|---|---|---|---|---|---|
| 3B | 2 GB | 3 GB | 4 GB | 4 Cores | GTX 1650 |
| 7B | 4-5 GB | 7 GB | 8 GB | 4 Cores | RTX 3060 |
| 8B | 5 GB | 8 GB | 8 GB | 4 Cores | RTX 3060 |
| 13B | 8 GB | 13 GB | 16 GB | 6 Cores | RTX 4070 |
| 14B | 9 GB | 14 GB | 16 GB | 6 Cores | RTX 4070 |
| 32B | 20 GB | 32 GB | 32 GB | 8 Cores | RTX 4090 |
| 70B | 40 GB | 70 GB | 64 GB | 16 Cores | 2x RTX 4090 |
Setup-Empfehlungen
Einstieg: 1 Agent, kleines Modell
CPU: 4 Cores (Intel i5 / AMD Ryzen 5)
RAM: 16 GB
GPU: RTX 3060 12GB
VRAM: 12 GB
Modell: llama3.1:8b (Q4)
Kosten: ~800-1.000 €
Mittel: 2-3 Agenten, mittleres Modell
CPU: 8 Cores (Intel i7 / AMD Ryzen 7)
RAM: 32 GB
GPU: RTX 4070 12GB
VRAM: 12 GB
Modell: llama3.1:8b (Q4) oder 13B (Q4)
Kosten: ~1.500-2.000 €
High-End: 5-10 Agenten, großes Modell
CPU: 16 Cores (Intel i9 / AMD Ryzen 9)
RAM: 64 GB
GPU: RTX 4090 24GB
VRAM: 24 GB
Modell: llama3.1:70b (Q4) oder mehrere 8B
Kosten: ~3.000-4.000 €
Enterprise: Viele Agenten, horizontale Skalierung
CPU: 32 Cores (AMD EPYC / Intel Xeon)
RAM: 128 GB
GPU: 2x RTX 4090 oder A100
VRAM: 48 GB
Modell: Mehrere Modelle oder 70B
Kosten: ~10.000+ €
CPU vs. GPU für Agenten
| Komponente | Funktion | Wichtigkeit |
|---|---|---|
| GPU | LLM-Inference | ⭐⭐⭐⭐⭐ Kritisch |
| VRAM | Modell-Speicher | ⭐⭐⭐⭐⭐ Kritisch |
| RAM | Agent-Code, Tools | ⭐⭐⭐⭐ Wichtig |
| CPU | Orchestrierung, Tools | ⭐⭐⭐ Mittel |
| SSD | Modell-Loading, Logs | ⭐⭐ Nice to have |
Praxisbeispiel: Hardware-Planung
def plan_hardware(agents, model_size, parallel_requests):
"""Hardware planen"""
# VRAM pro Agent
vram_per_agent = {
"7b": 5,
"8b": 5,
"13b": 8,
"32b": 20,
"70b": 40
}
# Gesamt-VRAM
total_vram = agents * vram_per_agent[model_size]
# RAM für Agenten-Code
ram_per_agent = 2 # GB
total_ram = agents * ram_per_agent + 8 # +8 für System
# CPU für Orchestrierung
cpu_cores = max(4, agents)
# GPU-Empfehlung
if total_vram <= 12:
gpu = "RTX 3060/4070 (12GB)"
elif total_vram <= 24:
gpu = "RTX 4090 (24GB)"
elif total_vram <= 48:
gpu = "2x RTX 4090 oder A100"
else:
gpu = "Mehrere Server oder Cloud"
return {
"gpu": gpu,
"vram_needed": total_vram,
"ram_needed": total_ram,
"cpu_cores": cpu_cores
}
# Beispiel: 5 Agenten, 8B-Modell
result = plan_hardware(agents=5, model_size="8b", parallel_requests=5)
# Output: GPU: RTX 4090, VRAM: 25 GB, RAM: 18 GB, CPU: 8 Cores
Sicherheitshinweise
- Hardware-Ausfall: GPU/Server kann ausfallen. Backup-Strategie nötig.
- Stromkosten: GPU bei Dauerbetrieb = 50-100 €/Monat Strom.
- Kühlung: GPU braucht gute Kühlung. Überhitzung reduziert Lebensdauer.
- Platz: Server braucht Platz, gute Belüftung.
Typische Stolpersteine
- Zu kleine GPU: Zu wenig VRAM = Modell lädt nicht oder sehr langsam.
- Zu wenig RAM: Agent-Code + Tools brauchen RAM. 16 GB Minimum.
- CPU unterschätzt: Viele Agenten brauchen CPU für Orchestrierung.
- Stromkosten vergessen: GPU bei Dauerbetrieb ist teuer.
- Keine Reserve: Für Wachstum Reserven einplanen.
Weiterführende Links
- Hardware - Hardware-Übersicht.
- VRAM-Rechner - Speicherbedarf berechnen.
- GPU-Empfehlungen - GPU-Kauf.
- KI-Agenten lokal betreiben - Übersicht.
- vLLM - Für Performance.
- Mehrere Agenten - Für Skalierung.
Key Takeaways:
- GPU/VRAM ist der wichtigste Faktor für KI-Agenten.
- 8B-Modell: ~5 GB VRAM. 70B: ~40 GB VRAM.
- RAM für Agent-Code: 2 GB pro Agent + 8 GB System.
- CPU für Orchestrierung: 4-16 Cores je nach Anzahl Agenten.
- Für 1 Agent: RTX 3060. Für 10 Agenten: RTX 4090 oder mehrere GPUs.
FAQ
Welche Hardware brauche ich?
Wie viel VRAM brauche ich?
Welche GPU empfehlt ihr?
Wie wichtig ist die CPU?
Wie viel RAM brauche ich?
Wie viele Agenten kann ich betreiben?
Was kostet die Hardware?
Wie skaliere ich Hardware?
Quellen und weiterführende Literatur
- Ollama - Modellserver.
- NVIDIA - GPUs.
- VRAM-Rechner - Speicherbedarf berechnen.


