Lokale KI vs. API-Kosten
Was dieser Artikel über lokale KI vs. API-Kosten behandelt
- Wie sich die Kosten von lokaler KI und Cloud-APIs vergleichen lassen.
- Welche Faktoren die Kosten beeinflussen: Anschaffung, Betrieb, Skalierung, Wartung.
- Wie Du den Break-Even-Point berechnest, ab dem sich lokale KI lohnt.
- Wann lokale KI günstiger ist und wann die API günstiger ist.
- Praxisbeispiele für verschiedene Nutzungsszenarien und Lastprofile.
Einleitung: Lokale KI vs. API-Kosten verständlich erklärt
Lokale KI und Cloud-APIs sind zwei Wege, Sprachmodelle zu nutzen. Cloud-APIs wie OpenAI, Anthropic oder Google sind einfach: Du zahlst pro Token, kein Setup, keine Hardware. Lokale KI mit Ollama ist aufwändiger: Du kaufst Hardware, installierst Software, wartest das System. Aber Du zahlst nicht pro Token.
Dieser Artikel richtet sich an Anwender, die KI wirtschaftlich bewerten wollen und vor der Wahl stehen, ob sie lokal oder in der Cloud betreiben. Du solltest verstehen, was lokale KI ist und wie Ollama funktioniert.
Warum brauche ich diesen Vergleich?
Stell Dir vor, Du willst KI im Unternehmen einführen. Du kannst ChatGPT für 20 Euro pro Nutzer und Monat nutzen, oder Du kaufst einen Rechner für 2000 Euro und betreibst Ollama. Was ist günstiger? Die Antwort hängt von der Nutzung ab: Bei wenig Nutzung ist die API günstiger, bei viel Nutzung ist lokale KI günstiger.
Die falsche Wahl kostet Geld. Wer lokale KI kauft und sie wenig nutzt, zahlt für Hardware, die brachliegt. Wer die API nutzt und viel Volumen hat, zahlt sich kaputt.
Lokale KI vs. API-Kosten kurz erklärt
Cloud-APIs kosten pro Token: Du zahlst für jeden Input- und Output-Token. Lokale KI kostet einmalig Hardware und laufend Strom: Du zahlst unabhängig von der Nutzung. Der Break-Even-Point ist die Nutzungsmenge, ab der lokale KI günstiger wird.
Der Kerngedanke lautet: API ist Pay-per-Use, lokale KI ist Flatrate.
Für wen ist dieser Vergleich gedacht?
- Entscheiderinnen und Entscheider, die KI im Unternehmen einführen und Kosten vergleichen.
- Self-Hoster, die wissen wollen, ob sich ihre Investition rechnet.
- Entwicklerinnen und Entwickler, die API-Kosten gegen lokale Hardware abwägen.
- Teams, die Budgetplanung für KI machen.
Vorkenntnisse in lokaler KI und Cloud-APIs sind hilfreich.
Wichtige Begriffe rund um Kosten
- Lokale KI - KI auf eigener Hardware. Wann nützlich: wenn Du unabhängig sein willst.
- Cloud-API - KI als Dienst, Abrechnung pro Token. Wann nützlich: wenn Du schnell starten willst.
- Token - Einheit für Text, ca. 4 Zeichen. Wann nützlich: die Abrechnungseinheit bei APIs.
- Break-Even-Point - Nutzungsmenge, ab der lokale KI günstiger ist. Wann nützlich: die Entscheidungshilfe.
- VRAM - Videospeicher der GPU. Wann nützlich: bestimmt, welche Modelle Du lokal betreiben kannst.
- Quantisierung - Reduzierung der Modellgröße. Wann nützlich: um größere Modelle auf begrenzter Hardware zu betreiben.
- Stromkosten - Laufende Kosten für lokale KI. Wann nützlich: der Hauptkostenfaktor neben Anschaffung.
- Ollama - Lokaler Modellserver. Wann nützlich: die Software für lokale KI.
Kostenfaktoren im Vergleich
Cloud-API-Kosten
Cloud-APIs rechnen pro Token ab. Die Preise variieren nach Modell und Provider:
| Provider | Modell | Input (pro 1M Token) | Output (pro 1M Token) |
|---|---|---|---|
| OpenAI | GPT-4o | 5 $ | 15 $ |
| OpenAI | GPT-4o-mini | 0,15 $ | 0,60 $ |
| Anthropic | Claude 3.5 Sonnet | 3 $ | 15 $ |
| Anthropic | Claude 3 Opus | 15 $ | 75 $ |
| Gemini 1.5 Pro | 1,25 $ | 5 $ | |
| Gemini 1.5 Flash | 0,075 $ | 0,30 $ |
Zusätzlich können Kosten anfallen für:
- Fine-Tuning (Training pro Stunde)
- Embeddings (pro Token)
- Bild-Generierung (pro Bild)
- Function Calling (inkludiert, aber Token zählen)
- Storage für Assistants (pro Tag)
Lokale KI-Kosten
Lokale KI hat einmalige Anschaffungskosten und laufende Betriebskosten:
Einmalige Anschaffung:
| Setup | Hardware | Preis (ca.) |
|---|---|---|
| Einsteiger | RTX 3060 12GB + PC | 800-1200 € |
| Mittelklasse | RTX 4070 12GB + PC | 1200-1800 € |
| Performance | RTX 4090 24GB + PC | 2500-3500 € |
| Workstation | 2x RTX 4090 + PC | 5000-7000 € |
| Mac Mini M4 | 64GB Unified Memory | 2000-2500 € |
| Mac Studio M2 Ultra | 192GB Unified Memory | 8000-10000 € |
Laufende Kosten:
| Faktor | Kosten (ca.) |
|---|---|
| Strom (300W, 24/7) | 30-50 €/Monat |
| Strom (700W, 8h/Tag) | 20-35 €/Monat |
| Internet | 20-40 €/Monat |
| Wartung (Abschreibung) | 50-100 €/Monat |
| Strom aus PV | 0-10 €/Monat |
Break-Even-Rechnung
Beispiel 1: Einzelner Nutzer, moderate Nutzung
Nutzer: 1 Person, 100.000 Token pro Tag (ca. 75.000 Wörter).
Cloud-API (GPT-4o):
- Input: 70.000 Token/Tag × 30 = 2,1M Token/Monat × 5 $/M = 10,50 $
- Output: 30.000 Token/Tag × 30 = 0,9M Token/Monat × 15 $/M = 13,50 $
- Gesamt: 24 $/Monat ≈ 22 €
Lokale KI (RTX 4070, 8h/Tag):
- Anschaffung: 1500 €
- Strom: 25 €/Monat
- Abschreibung (3 Jahre): 42 €/Monat
- Gesamt: 67 €/Monat
Break-Even: Bei 24 €/Monat API-Kosten lohnt sich lokale KI nicht. Die Hardware kostet 67 €/Monat, die API 22 €/Monat.
Beispiel 2: Team, hohe Nutzung
Nutzer: 10 Personen, je 500.000 Token pro Tag.
Cloud-API (GPT-4o):
- Input: 350.000 Token/Tag × 30 × 10 = 105M Token/Monat × 5 $/M = 525 $
- Output: 150.000 Token/Tag × 30 × 10 = 45M Token/Monat × 15 $/M = 675 $
- Gesamt: 1200 $/Monat ≈ 1100 €
Lokale KI (2x RTX 4090, 24/7):
- Anschaffung: 6000 €
- Strom: 50 €/Monat
- Abschreibung (3 Jahre): 167 €/Monat
- Gesamt: 217 €/Monat
Break-Even: Bei 1100 €/Monat API-Kosten ist lokale KI deutlich günstiger. Break-Even nach ca. 6 Monaten.
Beispiel 3: Agenten-Workflows, sehr hohe Nutzung
Nutzer: Agenten-System, 5M Token pro Tag.
Cloud-API (GPT-4o):
- Input: 3,5M Token/Tag × 30 = 105M Token/Monat × 5 $/M = 525 $
- Output: 1,5M Token/Tag × 30 = 45M Token/Monat × 15 $/M = 675 $
- Gesamt: 1200 $/Monat ≈ 1100 €
Cloud-API (GPT-4o-mini):
- Input: 105M × 0,15 $/M = 15,75 $
- Output: 45M × 0,60 $/M = 27 $
- Gesamt: 42,75 $/Monat ≈ 39 €
Lokale KI (Mac Studio M2 Ultra, 24/7):
- Anschaffung: 9000 €
- Strom: 30 €/Monat
- Abschreibung (3 Jahre): 250 €/Monat
- Gesamt: 280 €/Monat
Break-Even: Gegen GPT-4o: lokal ist günstiger. Gegen GPT-4o-mini: API ist günstiger.
Praxisbeispiel: Wann was günstiger ist?
Szenario 1: Gelegentliche Nutzung
Du nutzt KI ab und zu, vielleicht 10.000 Token pro Tag. Cloud-API ist günstiger. Die Kosten sind minimal, keine Hardware nötig.
Szenario 2: Regelmäßige Nutzung, einzelne Person
Du nutzt KI täglich, 100.000 Token pro Tag. Cloud-API ist günstiger, besonders mit günstigen Modellen wie GPT-4o-mini oder Gemini Flash.
Szenario 3: Team, hohe Nutzung
10 Personen nutzen KI intensiv, zusammen 5M Token pro Tag. Lokale KI ist günstiger. Break-Even nach wenigen Monaten.
Szenario 4: Agenten-Workflows, 24/7
Agenten laufen 24/7 und generieren Millionen Token pro Tag. Lokale KI ist deutlich günstiger. API-Kosten würden explodieren.
Szenario 5: Datenschutz kritisch
Du verarbeitest sensible Daten, die nicht in die Cloud dürfen. Lokale KI ist die einzige Option, unabhängig von Kosten.
Versteckte Kosten
Cloud-API
- Datenabfluss: Sensible Daten gehen an den Provider.
- Vendor Lock-in: Wechsel des Providers ist aufwändig.
- Preiserhöhungen: Provider können Preise erhöhen.
- Rate-Limits: Bei hohem Volumen kannst Du gedrosselt werden.
- Ausfälle: Provider kann ausfallen, Du hast keinen Einfluss.
Lokale KI
- Wartung: Updates, Treiber, Modell-Pflege.
- Stromausfall: Bei Ausfall kein KI-Betrieb.
- Hardware-Defekt: GPU kann ausfallen.
- Platz und Lärm: Hardware braucht Platz und macht Lärm.
- Know-how: Du brauchst jemanden, der das System betreut.
Typische Stolpersteine bei der Kostenrechnung
- Stromkosten vergessen: Lokale KI kostet Strom, besonders bei 24/7-Betrieb.
- Abschreibung ignoriert: Hardware hat eine Lebensdauer, plane Abschreibung ein.
- API-Preiserhöhungen nicht einkalkuliert: Provider können Preise ändern.
- Nutzung überschätzt: Viele überschätzen ihre Nutzung und kaufen zu teure Hardware.
- Modell-Größe unterschätzt: Größere Modelle brauchen teurere Hardware.
- Wartungsaufwand unterschätzt: Lokale KI braucht Betreuung.
Weiterführende Links und Infos zu Kosten
- Lokale KI Grundlagen - Was lokale KI ist.
- Ollama installieren - Lokale KI einrichten.
- Quantisierung - Modellgröße reduzieren.
- VRAM-Rechner - VRAM-Bedarf berechnen.
- Stromkostenrechner - Stromkosten berechnen.
- Cloud-Kostenrechner - API-Kosten berechnen.
- GPU kaufen vs. mieten - Hardware-Vergleich.
- KI-Hardware Grundlagen - Hardware verstehen.
Key Takeaways:
- Cloud-API kostet pro Token, lokale KI kostet Hardware und Strom.
- Break-Even hängt von Nutzungsmenge ab.
- Bei wenig Nutzung: API ist günstiger.
- Bei viel Nutzung: lokale KI ist günstiger.
- Bei sensiblen Daten: lokale KI ist die einzige Option.
FAQ: Lokale KI vs. API-Kosten - Typische Fragen
Wann lohnt sich lokale KI finanziell?
Wann ist die API günstiger?
Wie berechne ich den Break-Even-Point?
Wie viel Strom braucht lokale KI?
Wie berechne ich die Abschreibung?
Welches Modell kann ich lokal betreiben?
Ist lokale KI besser für den Datenschutz?
Ist die Qualität gleich?
Kann ich beides kombinieren?
Wie viel Wartung braucht lokale KI?
Quellen und weiterführende Literatur
- OpenAI Pricing - Aktuelle API-Preise.
- Anthropic Pricing - Claude-API-Preise.
- Ollama - Lokaler Modellserver.
- VRAM-Rechner - VRAM-Bedarf berechnen.


