Phi Modelle: Microsofts kompakte KI
Was dieser Artikel behandelt
- Welche Phi-Modelle es gibt und wie sich die Generationen 3, 3.5 und 4 unterscheiden
- Was ein Small Language Model ist und warum kleine Modelle wichtig sind
- Wie viel VRAM Du für die einzelnen Phi-Modelle brauchst
- Wie Du Phi-Modelle mit Ollama lokal startest
- Welche Stärken und Schwächen kompakte Modelle haben
Einleitung
Phi ist die Modellserie von Microsoft, die sich auf einen besonderen Ansatz spezialisiert hat: klein, aber leistungsfähig. Während andere Hersteller immer größere Modelle bauen, geht Microsoft mit Phi den entgegengesetzten Weg. Die Modelle sind bewusst klein gehalten und erreichen trotzdem Leistungen, die man von deutlich größeren Modellen erwarten würde. Microsoft nennt diese Modelle “Small Language Models” oder SLMs.
Wenn Du lokale KI auf begrenzter Hardware betreiben willst, sind Phi-Modelle besonders attraktiv. Sie laufen auf Laptops ohne starke Grafikkarte, auf Edge-Geräten und sogar auf Smartphones. In diesem Artikel bekommst Du einen vollständigen Überblick über die Modellserie, ihre Besonderheiten und wie Du sie lokal einsetzt.
Warum brauche ich Phi?
Phi-Modelle sind aus mehreren Gründen interessant. Erstens sind sie extrem kompakt. Das kleinste Modell, Phi-3 mini, hat nur 3,8 Milliarden Parameter und läuft auf einer Grafikkarte mit 4 GB VRAM. Das macht Phi zur idealen Wahl für Nutzer, die keine teure Hardware haben.
Zweitens ist die Leistung für die Größe bemerkenswert. Microsoft verwendet einen besonderen Trainingsansatz, der als “Textbook Quality” bezeichnet wird. Statt riesige Mengen an rohen Internetdaten zu verwenden, trainiert Microsoft mit sorgfältig gefilterten, hochwertigen Daten, die wie Lehrbücher strukturiert sind. Das Ergebnis sind Modelle, die bei gleicher Größe oft bessere Leistungen erbringen als konventionell trainierte Modelle.
Drittens sind Phi-Modelle vielseitig einsetzbar. Sie eignen sich für Chat, einfaches Coding, Textzusammenfassungen und grundlegende Reasoning-Aufgaben. Für komplexe Aufgaben sind sie nicht die erste Wahl, aber für den Alltag sind sie völlig ausreichend.
Viertens spielt Edge-Deployment eine große Rolle. Phi-Modelle sind klein genug, um auf Mobilgeräten, in Browsern oder auf IoT-Geräten zu laufen. Das eröffnet Anwendungsfälle, die mit größeren Modellen nicht möglich wären.
Phi kurz erklärt
Phi ist eine Serie von Small Language Models, die von Microsoft Research entwickelt werden. Die Modelle basieren auf der Transformer-Architektur und sind als Decoder-only-Modelle aufgebaut. Der Kernunterschied zu anderen Modellserien liegt im Training: Microsoft verwendet hochwertige, gefilterte Daten statt roher Internetdaten.
Die Modellnamen folgen einem einfachen Schema: “Phi” gefolgt von der Versionsnummer und der Größe. Phi-3 mini hat 3,8 Milliarden Parameter, Phi-3 small hat 7,4 Milliarden, Phi-3 medium hat 14 Milliarden. Die Generationen Phi-3, Phi-3.5 und Phi-4 bauen aufeinander auf, wobei jede Generation Verbesserungen bringt.
Die Modelle sind als Instruct-Versionen optimiert auf Dialog und Anweisungen. Sie stehen unter der MIT-Lizenz, einer der freiesten Open-Source-Lizenzen, was kommerzielle Nutzung ohne Einschränkungen erlaubt.
Für wen ist dieser Artikel gedacht?
Dieser Artikel richtet sich an:
- Einsteiger, die ein kompaktes Modell für schwache Hardware suchen
- Heimanwender, die KI auf einem Laptop ohne starke Grafikkarte ausführen wollen
- Entwickler, die Modelle auf Edge-Geräten oder in Browsern einsetzen
- Nutzer mit begrenztem Budget, die keine teure GPU kaufen möchten
- Alle, die verstehen wollen, was Small Language Models sind und warum sie wichtig sind
Wichtige Begriffe
| Begriff | Bedeutung |
|---|---|
| SLM | Small Language Model, ein kompaktes Sprachmodell |
| Parameter | Die gelernten Werte des Modells, Anzahl in Milliarden (B) angegeben |
| Textbook Quality | Trainingsansatz mit hochwertigen, strukturierten Daten |
| Instruct | Auf Anweisungen optimierte Version eines Modells |
| Edge Deployment | Einsatz von Modellen auf Endgeräten statt auf Servern |
| Tokenizer | Zerlegt Text in Tokens, die das Modell verarbeitet |
| Context Length | Maximale Anzahl Tokens, die das Modell gleichzeitig verarbeiten kann |
| Quantisierung | Reduktion der Speichergenauigkeit, um VRAM zu sparen |
| GGUF | Dateiformat für quantisierte Modelle, genutzt von Ollama |
| Fine-Tune | Weitertraining eines Modells auf spezialisierte Daten |
Die Phi-Modelle im Überblick
Microsoft hat die Phi-Serie in mehreren Generationen weiterentwickelt. Jede Generation bringt Verbesserungen in Leistung, Effizienz und Fähigkeiten.
Phi-3
Phi-3 ist die dritte Generation und wurde im April 2024 veröffentlicht. Sie umfasst drei Größen:
- Phi-3 mini (3,8B): Das kleinste Modell der Generation. Es hat 3,8 Milliarden Parameter und einen Context Length von 128.000 Tokens. Trotz seiner geringen Größe erreicht es in vielen Benchmarks das Niveau von Modellen, die dreimal so groß sind. Es läuft auf einer Grafikkarte mit 4 GB VRAM in quantisierter Form.
- Phi-3 small (7,4B): Ein mittelgroßes Modell mit 7,4 Milliarden Parametern. Es bietet deutlich bessere Leistung als mini und ist vergleichbar mit 7B-Modellen anderer Hersteller. Der Context Length beträgt 128.000 Tokens.
- Phi-3 medium (14B): Das größte Modell der Phi-3-Generation mit 14 Milliarden Parametern. Es bietet die beste Leistung der Generation, braucht aber auch entsprechend mehr VRAM.
Phi-3.5
Phi-3.5 ist eine Zwischengeneration, die im August 2024 veröffentlicht wurde. Sie umfasst zwei Modelle:
- Phi-3.5 mini (3,8B): Eine verbesserte Version von Phi-3 mini mit besserer Mehrsprachigkeit und längerem Kontext. Es unterstützt 128.000 Tokens Context Length und ist in mehreren Sprachen trainiert, darunter Deutsch, Französisch und Spanisch.
- Phi-3.5 MoE (16x3,8B): Ein Mixture-of-Experts-Modell mit 16 Experten zu je 3,8 Milliarden Parametern. Bei jeder Anfrage werden 2 Experten aktiviert. Die Gesamtzahl der Parameter beträgt etwa 42 Milliarden, aber nur 6,6 Milliarden sind pro Anfrage aktiv. Dieses Modell ist das leistungsfähigste Phi-Modell, braucht aber auch deutlich mehr VRAM.
Phi-4
Phi-4 ist die aktuellste Generation und wurde im Dezember 2024 veröffentlicht. Sie bringt eine wichtige Neuerung: ein spezielles Training für Mathematik und Reasoning.
- Phi-4 (14B): Ein 14B-Modell mit deutlich verbesserten Fähigkeiten in Mathematik, Coding und Reasoning. Es erreicht in diesen Bereichen Leistungen, die mit Modellen vergleichbar sind, die doppelt so groß sind. Der Context Length beträgt 16.000 Tokens. Phi-4 steht unter der MIT-Lizenz.
Technische Spezifikationen
| Modell | Parameter | Context Length | Architektur | Lizenz |
|---|---|---|---|---|
| Phi-3 mini | 3,8B | 128K | Dense | MIT |
| Phi-3 small | 7,4B | 128K | Dense | MIT |
| Phi-3 medium | 14B | 128K | Dense | MIT |
| Phi-3.5 mini | 3,8B | 128K | Dense | MIT |
| Phi-3.5 MoE | 42B (6,6B aktiv) | 128K | MoE (16x3,8B) | MIT |
| Phi-4 | 14B | 16K | Dense | MIT |
VRAM-Bedarf der Phi-Modelle
Der VRAM-Bedarf ist einer der größten Vorteile der Phi-Modelle. Da sie klein sind, brauchen sie deutlich weniger VRAM als vergleichbare Modelle. Die folgende Tabelle zeigt Richtwerte für Q4_K_M.
| Modell | VRAM bei Q4_K_M | VRAM bei Q8 | VRAM bei FP16 |
|---|---|---|---|
| Phi-3 mini / Phi-3.5 mini | ca. 2,5 GB | ca. 4 GB | ca. 8 GB |
| Phi-3 small | ca. 5 GB | ca. 8 GB | ca. 15 GB |
| Phi-3 medium / Phi-4 | ca. 9 GB | ca. 15 GB | ca. 28 GB |
| Phi-3.5 MoE | ca. 24 GB | ca. 45 GB | ca. 84 GB |
Die Werte sind Richtwerte und variieren leicht. Zusätzlich brauchst Du etwa 1 bis 2 GB für den Kontext. Mehr Details im Artikel RAM und VRAM Anforderungen und unter Modellgröße und Speicherbedarf.
Leistung und Performance
Phi-3 mini und Phi-3.5 mini sind für ihre Größe beeindruckend. Mit 3,8 Milliarden Parametern erreichen sie Leistungen, die man von 7B- bis 10B-Modellen erwarten würde. Sie sind gut für Chat, einfaches Coding, Zusammenfassungen und grundlegende Fragen. Bei komplexem Reasoning oder anspruchsvollem Coding stoßen sie an Grenzen.
Phi-3 small ist vergleichbar mit anderen 7B-Modellen wie Llama 3.1 8B oder Mistral 7B. Die Leistung ist solide, aber nicht herausragend. Der Vorteil liegt in der Effizienz und der MIT-Lizenz.
Phi-3 medium und Phi-4 bieten deutlich mehr Leistung. Phi-4 ist besonders stark in Mathematik und Coding, dank des spezialisierten Trainings. In Mathematik-Benchmarks erreicht es Ergebnisse, die mit Modellen vergleichbar sind, die doppelt so groß sind. Für einen 14B-Parameter ist die Leistung außergewöhnlich.
Phi-3.5 MoE ist das leistungsfähigste Phi-Modell. Durch die MoE-Architektur mit 16 Experten erreicht es Leistungen auf dem Niveau von 70B-Modellen, ist aber bei der Ausführung schneller. Der VRAM-Bedarf ist jedoch hoch, da alle 42 Milliarden Parameter im Speicher liegen müssen.
Warum kleine Modelle wichtig sind
Small Language Models wie Phi sind nicht einfach nur schwächere Versionen großer Modelle. Sie haben eigene Daseinsberechtigungen und Vorteile, die große Modelle nicht bieten können.
Geschwindigkeit: Kleine Modelle sind schneller. Sie generieren Tokens schneller und reagieren prompter. Für interaktive Anwendungen wie Chat ist das ein großer Vorteil.
Hardware-Effizienz: Kleine Modelle brauchen weniger VRAM und weniger Strom. Das macht sie ideal für Laptops, Mobilgeräte und Edge-Deployment. Du brauchst keine teure Grafikkarte, um Phi-Modelle auszuführen.
Kosten: Weniger Hardware bedeutet geringere Kosten. Eine Grafikkarte mit 4 GB VRAM kostet ein Bruchteil einer mit 24 GB. Das macht lokale KI für viel mehr Menschen zugänglich.
Datenschutz auf jedem Gerät: Wenn ein Modell klein genug ist, um auf einem Smartphone zu laufen, bleiben die Daten vollständig auf dem Gerät. Keine Cloud, keine Übertragung, keine Datenschutzbedenken.
Spezialisierung: Kleine Modelle können für spezielle Aufgaben feintunt werden, ohne dass das Training unerschwinglich wird. Ein Fine-Tune von Phi-3 mini ist auf einer einzelnen GPU machbar, während ein Fine-Tune von Llama 70B erhebliche Ressourcen erfordert.
Anwendungsfälle für Phi-Modelle
| Anwendungsfall | Empfohlenes Modell | Warum |
|---|---|---|
| Chat auf schwacher Hardware | Phi-3 mini | Läuft mit 4 GB VRAM |
| Mathematik und Coding | Phi-4 | Spezialisiert auf diese Bereiche |
| Edge-Deployment | Phi-3.5 mini | Kompakt und mehrsprachig |
| Laptop ohne GPU | Phi-3 mini | Läuft auf CPU akzeptabel |
| Maximale Leistung | Phi-3.5 MoE | MoE-Architektur mit hoher Leistung |
| kommerzielle Projekte | Alle Phi-Modelle | MIT-Lizenz ohne Einschränkungen |
Wenn Du unsicher bist, welches Modell für Dich passt, hilft der Artikel Modell finden bei der Entscheidung.
Phi-Modelle mit Ollama ausführen
Ollama ist die einfachste Methode, um Phi-Modelle lokal zu starten. Du brauchst nur einen Befehl im Terminal.
Phi-3 mini starten:
ollama run phi3
Phi-3.5 mini starten:
ollama run phi3.5
Phi-4 starten:
ollama run phi4
Ollama lädt automatisch eine passende quantisierte Version herunter, standardmäßig Q4_K_M. Wenn Du eine andere Quantisierungsstufe nutzen willst, kannst Du diese angeben:
ollama run phi3:3.8b-q5_K_M
Modelle, die Du nicht mehr brauchst, kannst Du mit dem folgenden Befehl entfernen. Mehr dazu im Artikel Modelle verwalten:
ollama rm phi3
Typische Stolpersteine
1. Erwartungen an die Leistung zu hoch: Phi-Modelle sind klein, und das bedeutet Grenzen. Phi-3 mini ist gut für einfache Aufgaben, aber nicht für komplexes Reasoning oder anspruchsvolles Coding. Wenn Du mehr Leistung brauchst, wähle Phi-3 medium oder Phi-4.
2. Context Length von Phi-4 ist begrenzt: Phi-4 hat einen Context Length von 16.000 Tokens, deutlich weniger als Phi-3 mit 128.000 Tokens. Für lange Dokumente ist Phi-4 weniger geeignet. Nutze Phi-3.5 mini, wenn Du langen Kontext brauchst.
3. MoE-Modell braucht viel VRAM: Phi-3.5 MoE hat 42 Milliarden Parameter insgesamt. Auch quantisiert brauchst Du etwa 24 GB VRAM. Das ist deutlich mehr als für die anderen Phi-Modelle. Prüfe Deine Hardware, bevor Du dieses Modell lädst.
4. Deutsch-Qualität überschätzen: Phi-Modelle sind primär auf Englisch trainiert. Phi-3.5 mini hat eine verbesserte Mehrsprachigkeit, aber Deutsch ist nicht auf dem Niveau von Qwen oder Mistral. Für reine Deutsch-Anwendungen sind andere Modelle oft besser.
5. Alte Versionen nutzen: Phi-1 und Phi-2 sind älter und deutlich schwächer. Wenn Du ein Phi-Modell startest, nutze immer Phi-3, Phi-3.5 oder Phi-4.
6. Falsche Größe für die Aufgabe: Phi-3 mini ist gut für einfache Aufgaben, aber nicht für komplexe. Phi-4 ist stark in Mathematik, aber nicht für lange Dokumente. Wähle das Modell passend zum Anwendungsfall, nicht nur nach Größe.
7. Vision-Fähigkeiten erwarten: Phi-Modelle sind reine Text-Modelle. Sie können keine Bilder verarbeiten. Wenn Du Bildanalyse brauchst, nutze Llama 3.2 Vision oder Qwen VL.
Hardware, Kosten und Sicherheit
Hardware: Phi-Modelle sind extrem hardwarefreundlich. Phi-3 mini läuft auf einer Grafikkarte mit 4 GB VRAM, also sogar auf einer alten GTX 1050. Phi-3 medium und Phi-4 brauchen etwa 9 GB VRAM, was auf einer RTX 3060 mit 12 GB gut passt. Phi-3.5 MoE braucht etwa 24 GB VRAM und erfordert eine RTX 3090 oder 4090. Auf einem Mac mit Apple Silicon läuft Phi-3 mini mit 8 GB RAM, Phi-4 mit 16 GB RAM.
Kosten: Die Modelle sind kostenlos und stehen unter der MIT-Lizenz, die kommerzielle Nutzung ohne Einschränkungen erlaubt. Die Hardwarekosten sind minimal: Für Phi-3 mini brauchst Du keine spezielle Grafikkarte, es läuft auf fast jedem Rechner. Das macht Phi zur kostengünstigsten Option für den Einstieg in lokale KI.
Sicherheit: Phi-Modelle laufen lokal, Deine Daten bleiben auf Deinem Rechner. Die MIT-Lizenz gibt Dir volle Kontrolle über die Nutzung, ohne Einschränkungen. Beachte, dass Phi-Modelle keine eingebauten Safety-Filter haben. Für produktive Anwendungen solltest Du zusätzliche Maßnahmen ergreifen. Ein Vorteil der geringen Größe ist, dass Phi-Modelle auf Geräten laufen können, die gar nicht mit dem Internet verbunden sind, was maximale Datensicherheit gewährleistet.
Weiterführende Links
- Lokale KI Modelle - Überblick aller Modell-Artikel
- Modell finden - Hilfe bei der Modellwahl
- Llama Modelle - Metas Open-Source-Serie im Vergleich
- Mistral Modelle - Europas Alternative im Vergleich
- Qwen Modelle - Alibabas Multilingual-Serie im Vergleich
- Ollama - Die einfachste Methode für lokale Modelle
- Modelle verwalten - Modelle in Ollama verwalten
- Quantisierung - Wie Modelle kleiner gemacht werden
- RAM und VRAM Anforderungen - Speicherbedarf verstehen
- Modellgröße und Speicherbedarf - Hardware-Grundlagen
- Was ist lokale KI? - Grundlagenartikel
FAQ
Welches Phi-Modell soll ich als Erstes ausprobieren?
Phi-3 mini ist die beste Wahl für den Einstieg. Es läuft auf fast jeder Hardware mit 4 GB VRAM und bietet eine bemerkenswerte Leistung für seine Größe. Starte mit ollama run phi3.
Was ist ein Small Language Model?
Ein Small Language Model (SLM) ist ein Sprachmodell mit wenigen Milliarden Parametern. Im Gegensatz zu Large Language Models (LLMs) mit 70 Milliarden oder mehr Parametern sind SLMs kompakt, schnell und hardwarefreundlich. Phi-Modelle sind die bekannteste SLM-Serie.
Ist Phi-4 besser als Phi-3?
Phi-4 ist die aktuellste Generation und bietet deutlich bessere Leistungen in Mathematik, Coding und Reasoning. Es hat jedoch einen kürzeren Context Length von 16.000 Tokens gegenüber 128.000 bei Phi-3. Für Mathematik und Coding wähle Phi-4, für lange Dokumente Phi-3 oder Phi-3.5.
Kann ich Phi auf einem Laptop ohne Grafikkarte ausführen?
Ja. Phi-3 mini ist klein genug, um auf einer CPU akzeptabel zu laufen. Die Geschwindigkeit ist geringer als auf einer GPU, aber für einfache Chat-Aufgaben ist es brauchbar. Mit Ollama funktioniert das direkt, ohne spezielle Konfiguration.
Sind Phi-Modelle kostenlos?
Ja. Alle Phi-Modelle stehen unter der MIT-Lizenz, einer der freiesten Open-Source-Lizenzen. Du kannst sie kostenlos nutzen, verändern und auch kommerziell einsetzen, ohne Einschränkungen.
Wie gut ist Phi auf Deutsch?
Phi-Modelle sind primär auf Englisch trainiert. Phi-3.5 mini hat eine verbesserte Mehrsprachigkeit, aber Deutsch ist nicht auf dem Niveau von Qwen oder Mistral. Für einfache Deutsch-Aufgaben reicht es, für komplexe Texte sind andere Modelle besser.
Was ist Phi-3.5 MoE?
Phi-3.5 MoE ist ein Mixture-of-Experts-Modell mit 16 Experten zu je 3,8 Milliarden Parametern. Bei jeder Anfrage werden 2 Experten aktiviert. Es ist das leistungsfähigste Phi-Modell, braucht aber etwa 24 GB VRAM quantisiert.
Kann Phi Bilder verstehen?
Nein. Alle Phi-Modelle sind reine Text-Modelle. Sie können keine Bilder verarbeiten. Wenn Du Bildanalyse brauchst, nutze Llama 3.2 Vision oder Qwen VL.
Ist Phi besser als Llama oder Mistral?
Das hängt vom Anwendungsfall ab. Phi-3 mini ist effizienter als Llama 3.1 8B und läuft auf schwächerer Hardware. Für maximale Leistung sind Llama 3.3 70B oder Qwen 2.5 72B besser. Für Edge-Deployment und schwache Hardware ist Phi die beste Wahl. In Mathematik ist Phi-4 besonders stark.
Was bedeutet Textbook Quality Training?
Microsoft trainiert Phi-Modelle mit sorgfältig gefilterten, hochwertigen Daten, die wie Lehrbücher strukturiert sind. Statt riesige Mengen an rohen Internetdaten zu verwenden, nutzt Microsoft kuratierte Daten mit klaren Erklärungen und Beispielen. Das ermöglicht kleinen Modellen eine überraschend gute Leistung.
Kann ich Phi für kommerzielle Projekte nutzen?
Ja, uneingeschränkt. Die MIT-Lizenz erlaubt kommerzielle Nutzung, Modifikation und Verbreitung ohne Bedingungen. Es gibt keine Einschränkungen bezüglich Nutzerzahlen oder Umsatz, anders als bei der Llama-Lizenz von Meta.
Quellen
- Microsoft Research - Phi Modellübersicht und Dokumentation
- Ollama Modellbibliothek - Phi-Modelle
- Hugging Face - Microsoft Phi Modellseite
- Phi-3, Phi-3.5 und Phi-4 Technische Berichte von Microsoft Research


