Skip to content
BotServBotServ
BenchmarksMMLUHumanEvalGSM8KMT-BenchVergleichModelle

KI-Benchmarks: Modelle objektiv vergleichen

KI-Benchmarks: MMLU, HumanEval, GSM8K, MT-Bench und mehr. Wie Du Modelle vergleichst und welche Metriken zählen. Verständlich erklärt.

S

schutzgeist

12 min read
KI-Benchmarks und Modell-Vergleich

KI-Benchmarks: Modelle objektiv vergleichen

Was dieser Artikel behandelt

  • Was KI-Benchmarks sind und warum sie für den Modellvergleich wichtig sind
  • Die wichtigsten Benchmarks: MMLU, HumanEval, GSM8K, MT-Bench und LMSYS Arena
  • Wie Du Benchmark-Ergebnisse richtig interpretierst und vergleichst
  • Welche Benchmarks für Deinen Anwendungsfall relevant sind
  • Welche Grenzen und Stolpersteine Benchmarks haben

Einleitung

Wenn Du Dich für lokale KI interessierst, stellst Du schnell eine zentrale Frage: Welches Modell ist am besten? Die Antwort ist nicht einfach, weil “am besten” davon abhängt, was Du machen willst. Ein Modell, das guten Code schreibt, kann bei Deutsch-Texten schwach sein. Ein Modell, das Mathematik beherrscht, kann bei kreativen Aufgaben enttäuschen.

Genau hier kommen Benchmarks ins Spiel. Ein Benchmark ist ein standardisierter Test, der ein Modell auf eine bestimmte Aufgabe ansetzt und das Ergebnis mit einem Score bewertet. Statt sich auf subjektive Eindrücke zu verlassen, misst ein Benchmark, wie gut ein Modell bei einer klar definierten Aufgabe abschneidet. Das macht es möglich, verschiedene Modelle objektiv zu vergleichen.

In diesem Artikel lernst Du die wichtigsten Benchmarks kennen, verstehst, was sie messen und wie Du die Ergebnisse für Deine Modellwahl nutzt. Wenn Du noch unsicher bist, welches Modell zu Dir passt, hilft Dir der Artikel Modell finden bei der grundsätzlichen Auswahl.

Warum brauche ich Benchmarks?

Stell Dir vor, Du liest im Internet, dass ein neues Modell “bahnbrechend” sei. Wie prüfst Du, ob das stimmt? Ohne Benchmarks bliebe Dir nur, das Modell selbst auszuprobieren und auf Dein Bauchgefühl zu vertrauen. Das Problem: Deine eigenen Tests sind subjektiv, decken nur wenige Aufgaben ab und sind schwer mit anderen Modellen vergleichbar.

Benchmarks lösen dieses Problem. Sie stellen jedem Modell dieselben Fragen und bewerten die Antworten nach festen Regeln. So kannst Du sehen, dass Modell A bei Mathematik 85 Prozent richtig löst, während Modell B nur 60 Prozent schafft. Das ist objektiv, reproduzierbar und vergleichbar.

Für die lokale KI-Nutzung sind Benchmarks besonders wichtig, weil Du nicht jedes Modell selbst herunterladen und testen kannst. Ein Benchmark-Ergebnis sagt Dir, ob sich der Download lohnt, bevor Du Gigabyte an Modellgewichten auf Deine Festplatte lädst. Das spart Zeit und Speicherplatz.

Zudem helfen Benchmarks bei der Entscheidung zwischen Modellgrößen. Wenn Du siehst, dass ein 9B-Modell bei MMLU fast genauso gut abschneidet wie ein 27B-Modell, kannst Du das kleinere Modell wählen und VRAM sparen.

Benchmarks kurz erklärt

Ein Benchmark besteht aus drei Teilen: einem Datensatz mit Fragen oder Aufgaben, einer Methode zur Auswertung und einem Score, der das Ergebnis zusammenfasst. Das Modell bekommt die Fragen vorgelegt, gibt Antworten, und die Auswertungsmethode prüft, wie viele richtig sind.

Es gibt zwei Hauptarten von Benchmarks:

Multiple-Choice-Benchmarks wie MMLU geben dem Modell eine Frage und mehrere Antwortmöglichkeiten. Das Modell wählt eine aus, und die Auswertung prüft, ob die richtige gewählt wurde. Das ist einfach, objektiv und automatisch auswertbar.

Freitext-Benchmarks wie MT-Bench lassen das Modell freie Antworten geben. Die Auswertung erfolgt entweder durch menschliche Bewerter oder durch ein anderes KI-Modell, das als Richter fungiert. Das ist realistischer, aber weniger objektiv.

Die meisten wichtigen Benchmarks nutzen eine Mischung aus beiden Ansätzen. Im nächsten Abschnitt gehen wir die einzelnen Benchmarks durch.

Für wen ist dieser Artikel gedacht?

Dieser Artikel richtet sich an Dich, wenn Du:

  • Modelle vergleichen willst, ohne jedes einzelne selbst zu testen
  • Benchmark-Ergebnisse in Artikeln und Foren besser verstehen möchtest
  • eine fundierte Kauf- oder Downloadentscheidung treffen willst
  • wissen willst, welche Benchmarks für Deinen Anwendungsfall relevant sind
  • Dich fragst, warum ein Modell bei einem Benchmark gut und bei einem anderen schlecht abschneidet

Du solltest grundlegend verstehen, was ein LLM ist und wie Modelle funktionieren. Wenn Du noch ganz am Anfang stehst, lies zuerst Was ist lokale KI?.

Wichtige Begriffe

BegriffBedeutung
BenchmarkStandardisierter Test zum Vergleich von Modellfähigkeiten
ScoreZahlenwert, der das Ergebnis eines Benchmarks zusammenfasst
MMLUMassive Multitask Language Understanding, breiter Wissenstest
HumanEvalBenchmark für Programmieraufgaben in Python
GSM8KGrade School Math, Mathematikaufgaben für Grundschulniveau
MT-BenchMulti-Turn Benchmark für Konversationsqualität
LMSYS ArenaPlattform für Blind-Vergleiche zwischen Modellen durch Menschen
Few-ShotTestmethode, bei der dem Modell Beispiele vor der Aufgabe gezeigt werden
Zero-ShotTestmethode, bei der das Modell die Aufgabe ohne Beispiele lösen muss
LeaderboardRangliste, die Modelle nach Benchmark-Ergebnissen sortiert

Die wichtigsten Benchmarks im Detail

MMLU: Breites Wissen testen

MMLU (Massive Multitask Language Understanding) ist der bekannteste Benchmark für allgemeines Wissen. Er besteht aus über 15.000 Multiple-Choice-Fragen aus 57 Fächern, von Geschichte über Recht bis hin zu Medizin und Mathematik. Das Modell muss aus vier Antwortmöglichkeiten die richtige wählen.

MMLU misst, wie viel Wissen ein Modell hat und wie gut es dieses Wissen in verschiedenen Bereichen abrufen kann. Ein Score von 80 Prozent bedeutet, dass das Modell 80 Prozent der Fragen richtig beantwortet hat. Aktuelle Top-Modelle erreichen Werte über 85 Prozent.

Für die lokale KI ist MMLU ein guter erster Filter. Wenn ein Modell bei MMLU schlecht abschneidet, ist es wahrscheinlich kein guter Allrounder. Allerdings misst MMLU nur Wissen, nicht die Fähigkeit, flüssige Texte zu schreiben oder komplexe Probleme zu lösen.

HumanEval: Programmieren prüfen

HumanEval ist der Standard-Benchmark für Programmierfähigkeit. Er besteht aus 164 Programmieraufgaben in Python. Das Modell bekommt eine Funktionssignatur und einen Beschreibungstext und muss den Code schreiben, der die Aufgabe löst. Die Auswertung erfolgt automatisch, indem der generierte Code gegen Testfälle ausgeführt wird.

Ein Score von 70 Prozent bedeutet, dass das Modell 70 Prozent der Aufgaben korrekt gelöst hat. Der Score wird als “pass@1” angegeben, was bedeutet, dass das Modell einen Versuch hat. Es gibt auch “pass@10”, bei dem das Modell zehn Versuche hat und einer richtig sein muss.

Für Nutzer, die ein Modell fürs Programmieren suchen, ist HumanEval der wichtigste Benchmark. Modelle wie DeepSeek-Coder und Qwen erreichen hier besonders gute Werte. Mehr zu diesen Modellen findest Du in den Artikeln zu Llama-Modellen und Qwen-Modellen.

GSM8K: Mathematik verstehen

GSM8K (Grade School Math 8K) testet mathematisches Grundverständnis. Der Benchmark besteht aus über 8.000 Mathematikaufgaben auf Grundschulniveau. Die Aufgaben erfordern mehrere Rechenschritte und logisches Denken, aber keine fortgeschrittene Mathematik.

Trotz des niedrigen Niveaus ist GSM8K überraschend schwer für viele Modelle. Der Benchmark testet, ob ein Modell logisch Schritt für Schritt denken kann, nicht nur, ob es Fakten auswendig gelernt hat. Modelle mit Reasoning-Fähigkeiten wie DeepSeek-R1 schneiden hier besonders gut ab.

Der Score gibt an, wie viel Prozent der Aufgaben das Modell korrekt gelöst hat. Aktuelle Top-Modelle erreichen über 90 Prozent, während kleinere Modelle oft bei 50 bis 70 Prozent liegen.

MT-Bench: Konversationsqualität bewerten

MT-Bench (Multi-Turn Benchmark) misst, wie gut ein Modell in Konversationen funktioniert. Der Benchmark besteht aus vordefinierten Konversationen mit mehreren Runden. Das Modell muss nicht nur eine Frage beantworten, sondern auf Folgefragen eingehen und den Kontext der Konversation berücksichtigen.

Die Auswertung erfolgt durch ein starkes KI-Modell, das als Richter fungiert und die Antworten auf einer Skala von 1 bis 10 bewertet. Das ist weniger objektiv als Multiple-Choice-Auswertung, aber näher an der realen Nutzungserfahrung.

MT-Bench ist besonders wichtig, wenn Du ein Modell für Chat-Anwendungen suchst. Ein Modell kann bei MMLU gut abschneiden, aber bei MT-Bench schlecht, wenn es steife oder unpassende Antworten gibt.

LMSYS Chatbot Arena: Der menschliche Vergleich

Die LMSYS Chatbot Arena ist eine Plattform, auf der menschliche Nutzer zwei Modelle im Blind-Vergleich gegeneinander antreten lassen. Die Nutzer stellen eine Frage, sehen die Antworten beider Modelle (ohne zu wissen, welche Modelle es sind) und stimmen für die bessere Antwort. Aus tausenden solchen Vergleichen entsteht ein Ranking, das auf realer menschlicher Wahrnehmung basiert.

Die Arena nutzt ein Elo-Rating-System, wie es auch im Schach verwendet wird. Modelle, die oft gewinnen, steigen im Ranking auf. Das Ergebnis ist ein Leaderboard, das die menschlich wahrgenommene Qualität der Modelle widerspiegelt.

Für die lokale KI ist die Arena besonders nützlich, weil sie echte Nutzerfragen und echte Präferenzen misst, nicht nur standardisierte Testaufgaben. Allerdings sind die meisten verglichenen Modelle große Cloud-Modelle, und nicht alle lokalen Modelle sind in der Arena vertreten.

Benchmark-Vergleich beliebter lokaler Modelle

Die folgende Tabelle zeigt typische Benchmark-Ergebnisse beliebter Modelle für den lokalen Betrieb. Die Werte sind gerundet und können je nach Quantisierung und Testmethode leicht abweichen.

ModellMMLUHumanEvalGSM8KMT-BenchGröße
Llama 3 8Bca. 68ca. 62ca. 52ca. 8,08B
Llama 3 70Bca. 80ca. 75ca. 82ca. 8,970B
Qwen 2.5 7Bca. 74ca. 70ca. 75ca. 8,37B
Qwen 2.5 32Bca. 83ca. 82ca. 85ca. 9,032B
Gemma 2 9Bca. 72ca. 60ca. 68ca. 8,39B
Gemma 2 27Bca. 76ca. 65ca. 78ca. 8,727B
Mistral 7Bca. 62ca. 40ca. 52ca. 7,67B
DeepSeek-R1 7B Distillca. 70ca. 72ca. 80ca. 8,27B
DeepSeek-R1 32B Distillca. 79ca. 80ca. 88ca. 8,832B

Diese Tabelle zeigt einige wichtige Dinge: Qwen-Modelle sind bei Coding und Mathematik besonders stark. DeepSeek-R1 Distills schlagen bei GSM8K deutlich über ihr Gewicht. Gemma 2 27B ist bei MMLU erstaunlich stark für seine Größe. Mistral 7B ist ein solider Allrounder, stößt aber bei Coding und Mathematik an Grenzen.

Mehr zu den einzelnen Modellfamilien findest Du in den Artikeln zu Llama-Modellen, Qwen-Modellen und Mistral-Modellen.

Wie interpretiere ich Benchmark-Ergebnisse?

Benchmark-Ergebnisse sind nützlich, aber Du musst sie richtig lesen. Hier sind die wichtigsten Tipps:

Schau auf den Anwendungsfall: Wenn Du ein Modell fürs Programmieren suchst, ignoriere MMLU und schau auf HumanEval. Wenn Du Mathematik brauchst, schau auf GSM8K. Kein einzelner Benchmark sagt Dir, ob ein Modell für Deine Aufgabe gut ist.

Vergleiche ähnliche Größen: Ein 7B-Modell mit 70 Prozent MMLU ist beeindruckend. Ein 70B-Modell mit 70 Prozent MMLU ist enttäuschend. Vergleiche immer Modelle ähnlicher Größe miteinander.

Beachte die Quantisierung: Benchmark-Ergebnisse werden oft mit unquantisierten Modellen (FP16) erhoben. Ein quantisiertes Modell in Q4_K_M kann einige Punkte schlechter abschneiden. Plane mit etwa 1 bis 3 Prozentpunkten Unterschied bei Q4_K_M.

Schau auf Trends, nicht auf einzelne Punkte: Ein Modell mit 71,3 Prozent MMLU ist nicht wesentlich besser als eines mit 70,8 Prozent. Unterschiede unter 2 Prozentpunkten sind oft Rauschen. Schau auf klare Abstände, nicht auf Kommastellen.

Prüfe das Datum: KI-Modelle entwickeln sich schnell. Ein Benchmark-Ergebnis von vor einem Jahr ist möglicherweise nicht mehr aktuell. Suche nach den neuesten Ergebnissen.

Benchmarks selbst ausführen

Wenn Du ein Modell lokal betreibst und selbst testen willst, kannst Du Benchmarks mit Tools wie lm-evaluation-harness ausführen. Das ist das Standard-Tool, das auch von den meisten Modellentwicklern genutzt wird.

# lm-evaluation-harness installieren
pip install lm-eval

# MMLU mit einem lokalen Modell ausführen
lm_eval --model hf --model_args pretrained=meta-llama/Llama-3-8B-Instruct --tasks mmlu --batch_size 8

Das Ausführen von Benchmarks braucht Zeit und Rechenleistung. Für die meisten Nutzer reicht es, die veröffentlichten Ergebnisse zu vergleichen, anstatt selbst Benchmarks laufen zu lassen. Wenn Du aber genaue Werte für eine bestimmte Quantisierung brauchst, ist die eigene Ausführung der sicherste Weg.

Mehr zur Qualitätsprüfung lokaler Systeme findest Du im Artikel Qualität testen.

Typische Stolpersteine

1. Ein einzelner Benchmark als Maß aller Dinge: Kein einzelner Benchmark erfasst alle Fähigkeiten eines Modells. Ein Modell kann bei MMLU glänzen und bei Konversationen enttäuschen. Schau immer mehrere Benchmarks an.

2. Benchmark-Scores mit realer Nutzung gleichgesetzt: Ein hoher MMLU-Score bedeutet nicht, dass das Modell in Deiner Anwendung gut ist. Benchmarks sind vereinfachte Tests, die reale Nutzung nur annähernd abbilden.

3. Quantisierung nicht berücksichtigt: Die meisten Benchmark-Ergebnisse gelten für unquantisierte Modelle. Ein Q4_K_M-Modell kann deutlich schlechter abschneiden. Vergleiche immer mit demselben Quantisierungsniveau.

4. Größenunterschied ignoriert: Ein 70B-Modell sollte besser abschneiden als ein 7B-Modell. Der interessante Vergleich ist, wie viel ein Modell pro Parameter erreicht, nicht der absolute Score.

5. Veraltete Ergebnisse genutzt: KI entwickelt sich schnell. Ein Benchmark-Ergebnis von vor sechs Monaten kann bereits überholt sein. Suche nach aktuellen Vergleichen und Leaderboards.

6. LMSYS Arena als alleinige Quelle: Die Arena misst menschliche Präferenz, nicht objektive Fähigkeit. Ein Modell, das eloquent aber falsch antwortet, kann in der Arena besser abschneiden als eines, das knapp aber korrekt antwortet.

7. Contamination nicht beachtet: Manche Modelle haben die Benchmark-Fragen bereits im Training gesehen. Das verfälscht die Ergebnisse nach oben. Seriöse Entwickler weisen darauf hin, wenn Contamination ausgeschlossen wurde.

Hardware, Kosten und Sicherheit

Hardware: Benchmarks selbst ausführen braucht Rechenleistung. Ein MMLU-Lauf mit 15.000 Fragen kann auf einer GPU Stunden dauern. Für die meisten Nutzer reicht es, veröffentlichte Ergebnisse zu lesen. Wenn Du selbst testest, nutze eine GPU mit mindestens 12 GB VRAM.

Kosten: Benchmark-Ergebnisse sind kostenlos verfügbar. Die wichtigsten Leaderboards wie LMSYS Arena und Hugging Face Open LLM Leaderboard sind frei zugänglich. Die eigene Ausführung kostet nur Rechenzeit auf Deiner Hardware.

Sicherheit: Benchmarks haben keine direkten Sicherheitsauswirkungen. Wenn Du Benchmarks lokal ausführen, bleiben Deine Daten auf Deinem Rechner. Es werden keine Informationen an externe Dienste gesendet.

FAQ

Was ist ein guter MMLU-Score?

Ein Score über 70 Prozent ist für ein 7B- bis 13B-Modell gut. Für Modelle ab 30B sollten es über 75 Prozent sein. Top-Modelle erreichen über 85 Prozent. Vergleiche immer Modelle ähnlicher Größe miteinander.

Sind Benchmarks aussagekräftiger als eigene Tests?

Benchmarks sind objektiver und vergleichbar, eigene Tests sind näher an Deiner realen Nutzung. Ideal ist eine Kombination: Nutze Benchmarks für die Vorauswahl und teste die finalen Kandidaten selbst an Deinen Aufgaben.

Was bedeutet pass@1 bei HumanEval?

pass@1 bedeutet, dass das Modell einen Versuch hat, die Aufgabe zu lösen. Wenn der generierte Code die Testfälle besteht, zählt es als Erfolg. pass@10 bedeutet, das Modell hat zehn Versuche, und einer muss richtig sein.

Wie zuverlässig ist die LMSYS Chatbot Arena?

Die Arena basiert auf tausenden menschlichen Vergleichen und ist eine der zuverlässigsten Methoden, um Modellqualität zu messen. Sie ist aber nicht perfekt: Menschen bevorzugen oft längere oder freundlichere Antworten, auch wenn sie nicht korrekter sind.

Beeinflusst Quantisierung die Benchmark-Ergebnisse?

Ja. Ein Q4_K_M-Modell kann 1 bis 3 Prozentpunkte schlechter abschneiden als das FP16-Original. Bei sehr niedrigen Quantisierungen wie Q2 oder Q3 können die Unterschiede deutlich größer sein.

Was ist Benchmark-Contamination?

Contamination bedeutet, dass ein Modell die Benchmark-Fragen bereits im Training gesehen hat. Das führt zu künstlich hohen Scores, weil das Modell die Antworten auswendig kennt, nicht weil es die Aufgabe löst. Seriöse Entwickler prüfen darauf.

Kann ich Benchmarks mit Ollama-Modellen ausführen?

Ja, mit Tools wie lm-evaluation-harness kannst Du Benchmarks auf Modellen ausführen, die über Ollama bereitgestellt werden. Du musst das Modell über die Ollama-API ansprechen. Die Ausführung dauert je nach Benchmark und Modellgröße Minuten bis Stunden.

Welcher Benchmark ist am wichtigsten für Programmierer?

HumanEval ist der Standard-Benchmark für Programmierfähigkeit. Er testet, ob das Modell korrekten Python-Code generiert. Für umfassendere Tests gibt es auch MBPP und LiveCodeBench, die ähnliche Aufgaben mit anderen Schwerpunkten messen.

Warum schneiden manche Modelle bei GSM8K so unterschiedlich ab?

GSM8K testet logisches Denken und mehrschrittiges Rechnen. Modelle mit Reasoning-Training wie DeepSeek-R1 schneiden hier deutlich besser ab, weil sie Probleme in Zwischenschritte zerlegen. Modelle ohne Reasoning geben oft schnelle, aber falsche Antworten.

Gibt es Benchmarks für Deutsch?

Ja, es gibt multilinguale Benchmarks wie MGSM (mehrsprachige Mathematik) und multilinguale MMLU-Varianten. Die meisten Standard-Benchmarks sind aber englischsprachig. Für Deutsch-Lastige Anwendungen solltest Du zusätzlich selbst testen.

Soll ich immer das Modell mit dem höchsten Score wählen?

Nicht unbedingt. Ein Modell mit etwas niedrigerem Score kann für Deine spezifische Aufgabe besser geeignet sein, besonders wenn es kleiner und damit schneller ist. Benchmarks sind eine Orientierung, nicht das einzige Kriterium.

Quellen

  • Hugging Face Open LLM Leaderboard
  • LMSYS Chatbot Arena Leaderboard
  • MMLU: Massive Multitask Language Understanding (Paper auf arXiv)
  • HumanEval: Evaluating Code Synthesis (Paper auf arXiv)
  • GSM8K: Training Verifiers for Math Word Problems (Paper auf arXiv)
  • MT-Bench: Multi-Turn Benchmark (LMSYS Forschung)
  • lm-evaluation-harness Dokumentation auf GitHub
Zurück zum KI Blog
Share:

Ähnliche Beiträge