KI-Cluster planen
Was dieser Artikel über KI-Cluster-Planung behandelt
- Wann ein KI-Cluster sinnvoll ist.
- Hardware-Topologien.
- Netzwerk und Speicher.
- Software-Optionen für verteilte Inferenz.
- Kosten und betriebliche Aspekte.
Einleitung: KI-Cluster planen
Wer die Leistung einer einzelnen Workstation überschreitet oder Redundanz braucht, denkt über einen KI-Cluster nach. Ein Cluster verbindet mehrere Rechner, die gemeinsam arbeiten. Das kann bedeuten, dass mehrere GPUs ein grosses Modell teilen, oder dass verschiedene Workloads auf spezialisierte Nodes verteilt werden. Cluster erfordern aber mehr Planung: Netzwerk, Speicher, Synchronisation und Software müssen zusammenspielen.
Dieser Artikel zeigt, worauf beim Planen eines KI-Clusters geachtet werden muss.
Wichtige Begriffe
- Node: Einzelner Rechner im Cluster.
- Master/Worker: Steuerung und Ausführung.
- Interconnect: Schnelles Netzwerk zwischen Nodes.
- NVLink/Infinity Fabric: Schnelle GPU-Verbindung.
- MPI: Message Passing Interface.
- vLLM/TGI: Inferenz-Server.
- Ray: Framework für verteilte Workloads.
- Kubernetes: Container-Orchestrierung.
- RDMA: Direkter Speicherzugriff übers Netz.
- Scheduler: Workload-Verteilung.
Wann ein Cluster?
- Modell grösser als eine GPU.
- Viele parallele Anfragen.
- Redundanz und Hochverfügbarkeit.
- Skalierbarkeit über einzelne Maschine hinaus.
- Trennung von Trainings- und Inferenz-Workloads.
- Team mit mehreren Nutzern.
Hardware-Topologien
Single-Node Multi-GPU
Mehrere GPUs in einem Rechner. Einfach, aber begrenzt durch Strom, Kühlung und Budget.
Multi-Node Multi-GPU
Mehrere Rechner verbunden. Erfordert schnelles Netzwerk und Software.
Hybrid
Ein leistungsstarker Master und spezialisierte Worker, etwa für Embeddings oder Vision.
Netzwerk
- 10 GbE Minimum.
- 25/100 GbE für schnelle Interconnects.
- RDMA mit InfiniBand ideal.
- Redundante Verbindungen.
- Geringe Latenz.
Speicher
- Gemeinsames Storage für Modelle und Datensets.
- NFS, Ceph oder MinIO.
- Lokal NVMe pro Node für schnellen Modellzugriff.
- 50-100 Gb Netzwerkspeicher für grosse Modelle.
Software-Optionen
| Software | Einsatz |
|---|---|
| vLLM | Hochleistungs-Inferenz |
| TGI (HuggingFace) | Text-Generations-Inferenz |
| Ray | Verteilte Python-Workloads |
| Kubernetes | Container-Orchestrierung |
| Slurm | Workload-Manager in HPC |
| Ollama | Einfache lokale Inferenz pro Node |
Planungsschritte
- Bedarf definieren.
- Topologie wählen.
- Budget festlegen.
- Hardware auswählen.
- Netzwerk planen.
- Speicherlösung wählen.
- Software-Stack festlegen.
- Sicherheit und Monitoring einrichten.
- Testumgebung aufbauen.
- Schrittweise skalieren.
Kosten
- Mehrere Server und GPUs.
- Netzwerk-Switch.
- Kühlung und Strom.
- Speicherinfrastruktur.
- Wartung und Verwaltungsaufwand.
Tipps
- Lieber mit zwei Nodes testen, bevor gross skaliert wird.
- Auf Netzwerk-Durchsatz achten.
- Modellgrösse und Parallelisierungsstrategie klären.
- Keine komplexe Software wählen, wenn ein einzelner Rechner reicht.
- Monitoring und Logging von Anfang an.
- Dokumentation führen.
Typische Stolpersteine
- Netzwerk zu langsam: Inter-Node-Kommunikation bremst.
- Speicher bottleneck: Modelle werden nicht schnell genug verteilt.
- Falsche Software: Ollama allein skaliert nicht automatisch.
- Strom und Kühlung unterschätzt.
- Wartungsaufwand unterschätzt.
- Keine Redundanz: Single Point of Failure.
Weiterführende Links und Infos
- BotServ.de KI-Server selbst bauen
- BotServ.de KI-Workstation
- BotServ.de KI-Mini-PC
- BotServ.de Docker Swarm
FAQ: KI-Cluster
Kann ich Ollama über mehrere Rechner skalieren? Nicht direkt. Für echtes Clustering braucht es vLLM, Ray oder Kubernetes.
Was kostet ein kleiner Cluster? Von einigen Tausend bis über 50.000 Euro, je nach Anforderung.
Reicht 10 GbE? Für Datenübertragung bei grossen Modellen eher zu wenig.
Was ist RDMA? Technologie für extrem schnellen Speicherzugriff übers Netzwerk.
Brauche ich Kubernetes? Nur, wenn viele Container und Workloads verwaltet werden.
Quellen und weiterführende Literatur
- Ray: https://docs.ray.io/
- vLLM: https://docs.vllm.ai/
- Kubernetes: https://kubernetes.io/docs/home/
- Slurm: https://slurm.schedmd.com/
Zusammenfassung: KI-Cluster planen
Ein KI-Cluster verbindet mehrere Rechner und GPUs, um grössere Modelle oder mehr parallele Workloads zu ermöglichen. Wichtig sind schnelles Netzwerk, gemeinsamer Speicher, passende Software wie vLLM, Ray oder Kubernetes und genügend Budget für Strom und Kühlung. Ein Cluster lohnt sich erst ab einer klaren Anforderung. Wer langsam skaliert und von Anfang an Monitoring einrichtet, vermeidet teure Fehlkonfigurationen.


