Skip to content
BotServBotServ
KI-AgentenKI-PCKaufberatungMulti-AgentLangGraphCrewAIVRAMAmazon

PC für KI-Agenten: Hardware für autonome Systeme

Welcher PC für KI-Agenten? Hardware für LangGraph, CrewAI, AutoGen und Multi-Agent-Systeme. VRAM, RAM und parallele Modelle.

S

schutzgeist

10 min read
PC für KI-Agenten und Multi-Agent-Systeme

PC für KI-Agenten: Hardware für autonome Systeme

Was dieser Artikel über Hardware für KI-Agenten behandelt

  • Welche Hardware-Anforderungen sich aus parallelen Agenten und Tool-Calling ergeben
  • Wie viel VRAM Du für Single-Agent und Multi-Agent-Systeme brauchst
  • Warum Agenten mehr RAM und CPU-Reserven benötigen als reine Chat-Anwendungen
  • Welche GPUs sich für LangGraph, CrewAI und AutoGen eignen
  • Konkrete Build-Vorschläge für Agenten-PCs in verschiedenen Preisklassen

Einleitung: PC für KI-Agenten verständlich erklärt

Ein einzelnes LLM auf dem lokalen Rechner auszuführen ist mittlerweile straightforward. Du startest Ollama, lädst ein quantisiertes Modell und kannst loslegen. KI-Agenten stellen jedoch andere Anforderungen an Deine Hardware. Sie rufen Tools auf, durchsuchen das Web, führen Code aus und kommunizieren untereinander. Statt einer einzelnen Inferenz pro Anfrage entstehen Dutzende Aufrufe, teils parallel, teils nacheinander.

Wer sich für die Grundlagen von Agenten interessiert, findet mehr in den KI-Agenten Grundlagen und im Überblick zu Agentensystemen. Dieser Artikel konzentriert sich auf die Hardware-Seite: Welcher PC eignet sich für Agenten-Frameworks wie LangGraph, CrewAI und AutoGen, und worauf musst Du beim Kauf achten?

Warum brauche ich spezielle Hardware für Agenten?

Ein einfaches Chat-Szenario lädt ein Modell in den VRAM und wartet auf Anfragen. Die Inferenz ist der einzige Rechenschritt. Ein Agent hingegen arbeitet in Schleifen: Er plant, ruft Tools auf, wertet Ergebnisse aus und plant neu. Jeder dieser Schritte kann eine oder mehrere Inferenzen auslösen.

Ein konkretes Beispiel: Du betreibst ein Multi-Agent-System mit drei Agenten. Agent A ist ein Planner, Agent B führt Websuchen durch, Agent C schreibt Code und führt ihn aus. Wenn Du alle drei Agenten gleichzeitig aktiv hast, laufen drei separate Inferenzen. Entweder Du hast genug VRAM, um drei Modelle parallel im Speicher zu halten, oder Dein System muss Modelle aus dem VRAM entfernen und neu laden. Das nennt sich Model Swapping und kostet wertvolle Zeit.

Bei Multi-Agent-Systemen kommt noch hinzu, dass Agenten miteinander kommunizieren. Jede Nachricht erzeugt Kontext, der im KV-Cache gehalten wird. Mit jedem Tool-Call wächst der Kontext, und der Speicherbedarf steigt.

PC für KI-Agenten kurz erklärt

Für KI-Agenten brauchst Du mehr VRAM und RAM als für reines Chatten. Ein Single-Agent-Setup mit einem 8B-Modell kommt mit 12 bis 16 GB VRAM aus. Multi-Agent-Systeme mit drei oder mehr Agenten benötigen 24 GB VRAM oder mehr, wenn Du Modelle parallel halten willst. Zusätzlich solltest Du 32 GB RAM für Tool-Ausführung, Browser-Automation und Code-Execution einplanen, besser 64 GB.

Für wen ist dieser Artikel gedacht?

Dieser Artikel richtet sich an Entwickler und Technik-Interessierte, die lokal mit Agenten-Frameworks arbeiten wollen. Du hast vermutlich schon Erfahrung mit Ollama oder LM Studio und möchtest jetzt den nächsten Schritt gehen. Du planst, LangGraph, CrewAI oder AutoGen lokal einzusetzen, und suchst eine fundierte Hardware-Empfehlung. Wenn Du gerade erst anfängst, schau Dir zuerst die allgemeine Kaufberatung an.

Wichtige Begriffe rund um Agenten-Hardware

BegriffBedeutung
VRAMGrafikkartenspeicher, in dem Modelle und KV-Cache liegen. Entscheidend für parallele Inferenz.
RAMArbeitsspeicher des Systems. Wichtig für Tool-Execution, Browser-Automation und Code-Ausführung.
Multi-ModelMehrere Modelle gleichzeitig im VRAM, z.B. ein LLM plus ein Embedding-Modell.
Model SwappingModelle werden aus dem VRAM entladen und bei Bedarf neu geladen. Kostet Zeit.
Parallel InferenceMehrere Inferenzen laufen gleichzeitig auf derselben GPU. Erhöht den VRAM-Bedarf.
OLLAMA_NUM_PARALLELUmgebungsvariable in Ollama, die steuert, wie viele Anfragen parallel verarbeitet werden.
KV-CacheSpeichert bereits berechnete Attention-Werte. Wächst mit dem Kontext und verbraucht VRAM.
Tool-CallingAgent ruft externe Werkzeuge auf, z.B. Web-Suche, API-Abfragen oder Code-Execution.
EmbeddingUmwandlung von Text in Vektorrepräsentationen für Vektordatenbanken. Braucht eigenes Modell.
VektordatenbankSpeichert Embeddings für Retrieval-Augmented Generation, z.B. Chroma oder Qdrant.

Was machen KI-Agenten anders?

Ein normales LLM-Setup beantwortet eine Frage und ist fertig. Ein Agent arbeitet in Iterationen. Er plant einen Schritt, führt ihn aus, wertet das Ergebnis aus und entscheidet, was als Nächstes passiert. Das bedeutet:

  • Viele API-Aufrufe: Jeder Agenten-Schritt erzeugt mindestens eine Inferenz. Bei komplexen Aufgaben kommen schnell 20 bis 50 Aufrufe zusammen.
  • Tool-Execution: Agenten rufen Tools auf, die CPU und RAM belasten. Browser-Automation mit Playwright braucht RAM, Code-Execution braucht eine Sandbox.
  • Wachsender Kontext: Jeder Tool-Call erweitert den Kontext. Der KV-Cache wächst und verbraucht mehr VRAM.
  • Parallele Agenten: In Multi-Agent-Systemen laufen mehrere Agenten gleichzeitig. Das multipliziert den VRAM-Bedarf.

Die Latenz pro Schritt ist kritisch. Wenn ein Agent fünf Schritte braucht und jeder Schritt 3 Sekunden dauert, bist Du bei 15 Sekunden. Bei parallelen Agenten kannst Du die Gesamtdauer reduzieren, brauchst aber die Hardware dafür.

Hardware-Anforderungen für Agenten

SzenarioVRAMRAMTypische Modelle
Single-Agent, 8B-Modell12 bis 16 GB32 GBLlama 3.1 8B, Qwen 2.5 7B
Single-Agent + Embedding16 bis 24 GB32 GB8B-LLM plus nomic-embed-text
3 Agenten, 8B-Modelle24 bis 48 GB64 GBDrei parallele 8B-Modelle
5+ Agenten, gemischt48 GB oder mehr64 bis 128 GBMehrere Modelle, Embedding, Vision

Die Werte gelten für quantisierte Modelle, typischerweise 4-bit oder 5-bit. Mehr zur Quantisierung findest Du im entsprechenden Artikel. Wer nicht quantisiert, braucht deutlich mehr VRAM.

Parallele Modelle vs. Modell-Swapping

Es gibt zwei Strategien, um mit mehreren Modellen in einem Agenten-System umzugehen:

Parallele Modelle: Du lädst alle Modelle gleichzeitig in den VRAM. Das ist schnell, weil kein Laden und Entladen nötig ist. Der Nachteil: Du brauchst genug VRAM für alle Modelle plus ihre KV-Caches. Drei 8B-Modelle in 4-bit brauchen etwa 3 x 5 GB für die Gewichte, plus KV-Cache pro Modell. Das summiert sich schnell auf 20 bis 30 GB.

Modell-Swapping: Du lädst nur das Modell, das gerade aktiv ist. Wenn Agent B an der Reihe ist, wird das Modell von Agent A entladen und Modell B geladen. Das spart VRAM, kostet aber Zeit. Jeder Swap dauert mehrere Sekunden, je nach Modellgröße und Speicherbandbreite. Bei Agenten mit vielen Iterationen summiert sich das.

Die Empfehlung: Wenn Du genug VRAM hast, bevorzuge parallele Modelle. Der Geschwindigkeitsvorteil ist bei Agenten-Workloads spürbar. Mehr zur Dimensionierung von Speicher findest Du im Artikel Hardware richtig dimensionieren.

GPU-Empfehlungen für Agenten

Bei Agenten brauchst Du VRAM für drei Dinge gleichzeitig:

  1. Das Hauptmodell: Das LLM, das die Agenten-Logik übernimmt.
  2. Das Embedding-Modell: Für Vektordatenbanken und Retrieval. Klein, aber permanent geladen.
  3. Optional ein Vision-Modell: Wenn Dein Agent Bilder verarbeiten muss.
GPUVRAMEignung
RTX 3060 12 GB12 GBSingle-Agent mit 8B-Modell, knapp
RTX 4060 Ti 16 GB16 GBSingle-Agent plus Embedding
RTX 309024 GB2 bis 3 parallele Agenten, solide Wahl
RTX 409024 GB3 Agenten, schnellere Inferenz
2x RTX 309048 GB5+ Agenten, Multi-Model-Setup
RTX 509032 GB3 bis 4 Agenten, aktuelle Spitze

Eine gebrauchte RTX 3090 mit 24 GB VRAM ist für Agenten-Setups aktuell das beste Preis-Leistungs-Verhältnis. Wenn Du neu kaufst und Budget hast, ist die RTX 5090 mit 32 GB eine starke Option.

RAM und CPU für Agenten

Agenten belasten nicht nur die GPU. Tool-Execution findet auf CPU und RAM statt:

  • Browser-Automation: Playwright oder Selenium starten Browser-Prozesse. Jeder Browser braucht 200 bis 500 MB RAM.
  • Code-Execution: Wenn ein Agent Code ausführt, läuft das in einem separaten Prozess. Sandbox-Umgebungen brauchen zusätzlichen RAM.
  • Vektordatenbanken: Chroma, Qdrant oder FAISS halten Embeddings im RAM.
  • Framework-Overhead: LangGraph, CrewAI und AutoGen selbst brauchen CPU-Ressourcen für Orchestrierung.

Empfehlung: Minimum 32 GB RAM, besser 64 GB. Bei Multi-Agent-Systemen mit Browser-Automation und Code-Execution sind 64 GB sinnvoll. Die CPU sollte mindestens 8 Kerne haben, idealerweise 12 oder mehr, damit Tool-Execution und Framework parallel zur GPU-Inferenz laufen können.

Empfohlene Hardware im Amazon Shop

Hardware für KI-Agenten im Amazon Shop

Bei Amazon ansehen

Affiliate-Link: Bei einem Kauf erhalten wir möglicherweise eine Provision.

Build-Vorschläge für Agenten-PCs

Build 1: Single-Agent-Einstieg (ca. 800 bis 1.200 EUR)

  • GPU: RTX 4060 Ti 16 GB
  • CPU: AMD Ryzen 5 7600 oder Intel Core i5-13400
  • RAM: 32 GB DDR5
  • SSD: 1 TB NVMe
  • Netzteil: 650 W

Reicht für einen Agenten mit 8B-Modell plus Embedding-Modell. Ideal zum Ausprobieren von LangGraph und CrewAI mit einzelnen Agenten.

Build 2: Multi-Agent-Workstation (ca. 2.000 bis 3.000 EUR)

  • GPU: RTX 3090 24 GB (gebraucht) oder RTX 4090 24 GB (neu)
  • CPU: AMD Ryzen 9 7900X oder Intel Core i7-13700K
  • RAM: 64 GB DDR5
  • SSD: 2 TB NVMe
  • Netzteil: 850 W bis 1.000 W

Genug VRAM für 2 bis 3 parallele Agenten. 64 GB RAM für Browser-Automation und Code-Execution. Dieser Build deckt die meisten Agenten-Szenarien ab.

Build 3: Multi-Agent-Server (ca. 4.000 bis 6.000 EUR)

  • GPU: 2x RTX 3090 24 GB (48 GB gesamt) oder RTX 5090 32 GB
  • CPU: AMD Ryzen 9 7950X oder Intel Core i9-13900K
  • RAM: 128 GB DDR5
  • SSD: 4 TB NVMe
  • Netzteil: 1.200 W

Für 5 oder mehr parallele Agenten, Multi-Model-Setups und lang laufende Agenten-Pipelines. 128 GB RAM sorgen dafür, dass Vektordatenbanken, Browser und Sandbox-Umgebungen gleichzeitig laufen können.

Typische Stolpersteine bei Agenten-Hardware

  • VRAM unterschätzt: Agenten brauchen nicht nur Platz für das Modell, sondern auch für den wachsenden KV-Cache. Bei langen Konversationen kann der KV-Cache mehrere GB belegen.
  • Embedding-Modell vergessen: Neben dem LLM läuft ein Embedding-Modell für die Vektordatenbank. Das braucht zusätzlichen VRAM, oft 1 bis 2 GB.
  • OLLAMA_NUM_PARALLEL falsch konfiguriert: Standardmäßig verarbeitet Ollama eine Anfrage gleichzeitig. Für parallele Agenten musst Du diesen Wert erhöhen, was wiederum mehr VRAM benötigt.
  • RAM für Tool-Execution ignoriert: Browser-Automation und Code-Execution laufen auf CPU und RAM. Wer hier zu wenig hat, bekommt OOM-Errors.
  • Model Swapping statt paralleler Modelle: Bei vielen Agenten-Schritten kostet das ständige Laden und Entladen massiv Zeit. Besser genug VRAM einplanen.
  • Speicherbandbreite vernachlässigt: Bei Modell-Swapping ist die Speicherbandbreite entscheidend. NVMe-SSDs sind Pflicht, SATA-SSDs sind zu langsam.
  • Netzteil zu schwach: Zwei GPUs brauchen ordentlich Strom. Ein 850-W-Netzteil reicht für eine RTX 4090, bei zwei Karten brauchst Du 1.000 W oder mehr.
  • Kühlung nicht bedacht: Agenten-Workloads laufen oft stundenlang. Die Hardware muss dauerhaft unter Last stabil bleiben.

Hardware, Kosten und Sicherheit bei Agenten-Hardware

Agenten-PCs sind teurer als reine Chat-Rechner, weil sie mehr VRAM und RAM brauchen. Die Kosten liegen zwischen 800 EUR für einen Single-Agent-Einstieg und 6.000 EUR für einen Multi-Agent-Server. Gebrauchte Hardware, besonders RTX 3090, kann die Kosten deutlich senken.

Sicherheitstechnisch solltest Du darauf achten, dass Code-Execution in einer Sandbox stattfindet. Agenten, die Code ausführen, können Dein System gefährden, wenn sie nicht isoliert sind. Docker-Container oder separate VMs sind hier sinnvoll. Mehr zur Sicherheit findest Du in den KI-Agenten Grundlagen.

FAQ: PC für KI-Agenten - Typische Fragen

Wie viel VRAM brauche ich für einen einzelnen Agenten?

Für einen Single-Agent mit einem 8B-Modell in 4-bit-Quantisierung reichen 12 bis 16 GB VRAM. Wenn Du zusätzlich ein Embedding-Modell lädst, plane 16 bis 24 GB ein.

Reicht eine RTX 3060 mit 12 GB für Agenten?

Für einen einzelnen Agenten mit einem kleinen Modell ja. Für Multi-Agent-Systeme oder parallele Modelle wird es eng. Du müsstest mit Model Swapping arbeiten, was die Latenz erhöht.

Was bedeutet OLLAMA_NUM_PARALLEL und warum ist es wichtig?

Das ist eine Umgebungsvariable in Ollama, die steuert, wie viele Anfragen gleichzeitig verarbeitet werden. Für parallele Agenten solltest Du den Wert erhöhen, z.B. auf 3 oder 4. Das kostet aber mehr VRAM pro paralleler Anfrage.

Brauche ich eine Vektordatenbank für Agenten?

Nicht zwingend, aber viele Agenten-Setups nutzen Retrieval-Augmented Generation. Dafür brauchst Du eine Vektordatenbank wie Chroma oder Qdrant plus ein Embedding-Modell. Beides benötigt zusätzlichen RAM und VRAM.

Lohnt sich eine gebrauchte RTX 3090 für Agenten?

Ja. Die RTX 3090 bietet 24 GB VRAM und ist gebraucht deutlich günstiger als eine neue RTX 4090. Für Multi-Agent-Setups ist sie aktuell die beste Wahl im Preis-Leistungs-Verhältnis.

Wie viel RAM brauche ich für Browser-Automation in Agenten?

Jeder Browser-Prozess braucht 200 bis 500 MB RAM. Wenn Dein Agent mehrere Tabs oder parallele Browser-Sessions öffnet, solltest Du mindestens 64 GB RAM einplanen.

Kann ich Agenten auf einem Mac mit Apple Silicon laufen lassen?

Ja, mit Einschränkungen. Apple Silicon nutzt Unified Memory, was viel Speicher für Modelle bietet. Allerdings sind nicht alle Agenten-Frameworks optimal auf macOS optimiert. Browser-Automation und Code-Execution funktionieren, aber CUDA-spezifische Tools laufen nicht nativ.

Was ist besser: ein großes Modell oder mehrere kleine für Multi-Agent?

Das hängt vom Anwendungsfall ab. Ein großes Modell (z.B. 70B) als zentraler Agent ist oft präziser. Mehrere kleine Modelle (z.B. 8B) für spezialisierte Agenten sind schneller und brauchen weniger VRAM pro Agent. Viele Multi-Agent-Setups nutzen mehrere kleine Modelle.

Brauche ich einen speziellen Prozessor für Agenten?

Nicht zwingend, aber Agenten profitieren von mehr CPU-Kernen. Tool-Execution, Framework-Overhead und Vektordatenbanken laufen auf der CPU. Ein Prozessor mit 12 oder mehr Kernen ist empfehlenswert.

Wie wichtig ist die SSD-Geschwindigkeit bei Agenten?

Sehr wichtig, besonders wenn Du Model Swapping betreibst. NVMe-SSDs laden Modelle deutlich schneller als SATA-SSDs. Bei parallelen Modellen, die im VRAM bleiben, ist die SSD-Geschwindigkeit weniger kritisch.

Kann ich Agenten auf mehreren GPUs laufen lassen?

Ja. Ollama und andere Inferenz-Engines unterstützen Multi-GPU-Setups. Zwei RTX 3090 mit jeweils 24 GB VRAM geben Dir 48 GB gesamt, genug für mehrere parallele Modelle.

Wie viel Strom braucht ein Agenten-PC unter Last?

Ein Single-Agent-Build mit einer RTX 4060 Ti braucht etwa 300 bis 400 Watt unter Last. Eine Multi-Agent-Workstation mit zwei RTX 3090 kann 700 bis 900 Watt ziehen. Achte auf ein ausreichend dimensioniertes Netzteil.

Quellen und weiterführende Literatur

Zurück zum KI Blog
Share:

Ähnliche Beiträge