KI-Agenten mit vLLM betreiben
Was dieser Artikel über vLLM behandelt
- Wie Du KI-Agenten mit vLLM betreibst.
- Warum vLLM für Produktion und viele parallele Requests besser ist.
- Setup, Modellwahl und OpenAI-kompatible API.
- Praxisbeispiele für High-Performance-Agenten.
- Best Practices für Batch-Processing und Skalierung.
Einleitung: vLLM für Agenten verständlich erklärt
vLLM ist ein High-Performance-Inference-Server für LLMs. Er nutzt PagedAttention für effiziente Speichernutzung und unterstützt Batch-Processing für viele parallele Requests. Für Agenten bedeutet das: Schnellere Antworten, mehr parallele Agenten, bessere Ressourcennutzung.
Dieser Artikel richtet sich an fortgeschrittene Anwender, die Agenten mit vLLM betreiben wollen. Grundlagen findest Du in vLLM und KI-Agenten lokal betreiben.
Warum brauche ich vLLM für Agenten?
Stell Dir vor, Du hast 10 Agenten, die gleichzeitig arbeiten. Ollama verarbeitet Requests sequenziell, langsam. vLLM batcht Requests: Alle 10 Agenten bekommen gleichzeitig Antworten. Für Produktion mit vielen Agenten ist vLLM die bessere Wahl.
vLLM für Agenten kurz erklärt
vLLM = High-Performance LLM-Server mit PagedAttention und Batch-Processing. OpenAI-kompatible API für Agenten-Frameworks. Für viele parallele Agenten und Produktion.
Der Kerngedanke lautet: Schneller, mehr parallele Agenten, bessere GPU-Nutzung.
Für wen ist dieser Artikel gedacht?
- Produktions-Teams, die viele Agenten parallel betreiben.
- Performance-Fokussierte, die GPU optimal nutzen wollen.
- Skalierer, die Agenten für viele Nutzer betreiben.
- Fortgeschrittene, die vLLM für Agenten nutzen.
Wichtige Begriffe
- vLLM - High-Performance Inference. Wann nützlich: für Produktion.
- PagedAttention - Speicher-Optimierung. Wann nützlich: für Effizienz.
- Batch-Processing - Viele Requests gleichzeitig. Wann nützlich: für parallele Agenten.
- Ollama - Alternative. Wann nützlich: für einfaches Setup.
- OpenAI-API - Standard-API. Wann nützlich: für Frameworks.
Setup
1. vLLM installieren
pip install vllm
2. Server starten
# Einzelnes Modell
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Llama-3.1-8B-Instruct \
--port 8000
# Mit GPU
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Llama-3.1-8B-Instruct \
--tensor-parallel-size 2 \
--port 8000
3. Mit Agenten-Framework verbinden
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="not-needed"
)
# Agent-Loop (wie bei LM Studio)
response = client.chat.completions.create(
model="meta-llama/Llama-3.1-8B-Instruct",
messages=[{"role": "user", "content": "Task"}],
tools=tools,
tool_choice="auto"
)
Praxisbeispiel: Parallele Agenten
import asyncio
from openai import AsyncOpenAI
client = AsyncOpenAI(
base_url="http://localhost:8000/v1",
api_key="not-needed"
)
async def run_agent(agent_id, task):
"""Einzelner Agent"""
response = await client.chat.completions.create(
model="meta-llama/Llama-3.1-8B-Instruct",
messages=[{"role": "user", "content": task}],
tools=tools,
tool_choice="auto"
)
return response.choices[0].message
async def run_parallel_agents():
"""10 Agenten parallel"""
tasks = [f"Task {i}" for i in range(10)]
agents = [run_agent(i, task) for i, task in enumerate(tasks)]
results = await asyncio.gather(*agents)
return results
# Alle Agenten laufen parallel
results = asyncio.run(run_parallel_agents())
vLLM vs. Ollama
| Aspekt | vLLM | Ollama |
|---|---|---|
| Performance | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ |
| Batch | ⭐⭐⭐⭐⭐ | ⭐⭐ |
| Setup | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| GUI | ❌ | ❌ (CLI) |
| Multi-Modell | ⭐⭐⭐ | ⭐⭐⭐⭐ |
| Produktion | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ |
| Best für | Viele parallele Requests | Einfaches Setup |
Sicherheitshinweise
- API nicht authentifiziert: Die OpenAI-API ist nicht geschützt. Firewall für externe Zugriffe.
- GPU-Speicher: vLLM nutzt viel GPU-Speicher. Monitoring nötig.
- Modell-Sicherheit: Modelle können Prompt Injection ausführen. Siehe Prompt Injection.
Typische Stolpersteine
- Setup komplexer: vLLM ist technischer als Ollama. Für einfaches Setup: Ollama.
- GPU-Speicher: vLLM braucht viel VRAM für Batch-Processing. Richtig dimensionieren.
- Modell-Format: vLLM braucht HF-Format, nicht GGUF. Andere Modelle als Ollama.
- Kein GUI: vLLM ist CLI/API only. Für GUI: LM Studio.
- Overkill für kleine Setups: Für 1-2 Agenten ist Ollama einfacher.
Weiterführende Links
- vLLM - vLLM im Detail.
- Ollama - Alternative.
- KI-Agenten lokal betreiben - Übersicht.
- Mehrere Agenten - Parallele Agenten.
- Hardware-Anforderungen - Hardware.
Key Takeaways:
- vLLM = High-Performance Inference mit PagedAttention und Batch-Processing.
- Für viele parallele Agenten und Produktion besser als Ollama.
- OpenAI-kompatible API für Agenten-Frameworks.
- Komplexeres Setup, aber bessere Performance.
- Für 1-2 Agenten: Ollama ist einfacher.
FAQ
Was ist vLLM?
vLLM oder Ollama?
Wie viel schneller ist vLLM?
Welche Modelle kann ich nutzen?
Wie viel VRAM brauche ich?
Unterstützt vLLM Tool-Calling?
Bleiben meine Daten privat?
Wie skaliere ich vLLM?
Quellen und weiterführende Literatur
- vLLM - GitHub.
- vLLM Docs - Dokumentation.
- PagedAttention - Paper.


