KI-Benchmarks erklärt: MMLU, GPQA, SWE-bench und mehr
KI-Benchmarks nachschlagen: Was MMLU, GPQA, SWE-bench, HumanEval, ARC-AGI und rund 50 weitere Tests messen, wie sie bewertet werden und wo ihre Grenzen liegen.
| Benchmark | Bereich | Was wird gemessen | Umfang und Format | Kennzahl | Zufallsniveau | Aussagekraft |
|---|
Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.
Benchmarks richtig lesen
KI-Benchmarks sind standardisierte Testsammlungen, mit denen Anbieter und Forschende Sprachmodelle vergleichen. MMLU prüft Wissen in 57 Fächern mit Multiple-Choice-Fragen, GPQA schwierige Fragen aus Biologie, Physik und Chemie auf Promotionsniveau, die sich nicht einfach ergoogeln lassen. HumanEval misst, ob ein Modell kurze Python-Funktionen korrekt schreibt, SWE-bench, ob es echte Fehler aus GitHub-Projekten beheben kann. ARC-AGI testet abstraktes Schlussfolgern an Rätseln aus farbigen Gittern, die für Menschen leicht und für Modelle schwer sind.
Beim Lesen von Ergebnissen hilft das Zufallsniveau: Bei vier Antwortmöglichkeiten erreicht Raten 25 Prozent, ein Wert von 30 Prozent ist dann kaum besser als Zufall. Achten Sie außerdem darauf, wie gemessen wurde: mit wie vielen Beispielen im Prompt (Few-Shot), mit oder ohne Nachdenkphase, mit einem oder mehreren Versuchen (pass@1 oder pass@k) und auf welcher Teilmenge, etwa GPQA Diamond oder SWE-bench Verified. Unterschiedliche Bedingungen machen Zahlen verschiedener Anbieter schwer vergleichbar.
Zwei Probleme begrenzen die Aussagekraft: Sättigung, wenn alle aktuellen Modelle über 90 Prozent liegen und Unterschiede im Rauschen verschwinden, und Kontamination, wenn Testfragen in die Trainingsdaten gelangt sind. Neuere Benchmarks wie LiveCodeBench verwenden deshalb laufend neue Aufgaben, andere halten ihre Testfragen geheim. Für die eigene Modellwahl ist ein kleiner Test mit echten Aufgaben aus Ihrem Alltag meist aussagekräftiger; dabei helfen der Modell-Finder und das Bewertungsraster.
Anleitung: KI-Benchmarks in 4 Schritten
- Im Suchfeld einen Benchmark oder ein Thema eingeben, etwa „Code“ oder „Mathe“.
- Mit „Bereich“ die Liste auf Wissen, Mathematik, Code, Agenten, Multimodal oder langen Kontext eingrenzen.
- In der Tabelle Inhalt, Kennzahl, Zufallsniveau und Hinweise zur Aussagekraft lesen.
- Mit „Liste kopieren“ die gefilterte Übersicht als Text übernehmen.
Typische Anwendungsfälle
- Modellankündigungen verstehen: Einordnen, was eine Angabe wie „GPQA Diamond 80 %“ eigentlich misst.
- Modell auswählen: Benchmarks finden, die zur eigenen Aufgabe passen, etwa SWE-bench für Programmieragenten.
- Präsentationen vorbereiten: Kurze, sachliche Erklärungen für Kollegen und Entscheider übernehmen.
Häufige Fragen
Was bedeutet Diamond bei GPQA?
GPQA Diamond ist die schwierigste Teilmenge mit 198 Fragen, bei denen Fachleute sicher richtig lagen und Laien mit Internetzugang meist scheiterten. Die meisten Anbieter berichten diese Teilmenge.
Was ist der Unterschied zwischen SWE-bench und SWE-bench Verified?
SWE-bench enthält über 2.000 Aufgaben aus echten GitHub-Issues. Verified ist eine von Menschen geprüfte Auswahl von 500 Aufgaben, bei denen Beschreibung und Tests eindeutig lösbar sind.
Warum sind MMLU-Werte kaum noch aussagekräftig?
Aktuelle Spitzenmodelle liegen fast alle bei 85 bis 90 Prozent oder darüber, und ein Teil der Fragen enthält Fehler. Deshalb wurden schwierigere Nachfolger wie MMLU-Pro entwickelt.
Was ist Chatbot Arena?
Eine Plattform (heute LMArena), auf der Menschen anonym zwei Antworten vergleichen und die bessere wählen. Aus vielen Stimmen entsteht eine Rangliste nach einem Elo-ähnlichen Verfahren. Sie misst Vorlieben, nicht Richtigkeit.
Welcher Benchmark ist der wichtigste?
Keiner allein. Für Programmieraufgaben sind SWE-bench Verified und LiveCodeBench aussagekräftiger als HumanEval, für Fachwissen eher GPQA als MMLU. Am verlässlichsten ist ein eigener Test mit typischen Aufgaben.
Was bedeutet pass@1?
Der Anteil der Aufgaben, die das Modell mit dem ersten erzeugten Lösungsversuch löst. pass@10 zählt eine Aufgabe als gelöst, wenn einer von zehn Versuchen die Tests besteht.
Zum Weiterlesen
- Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
- Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
- Warum deutsche Texte mehr Tokens brauchen als englischeDeutsche Texte brauchen meist 20 bis 50 Prozent mehr Tokens als englische. Woran das liegt, was es kostet und was man dagegen tun kann.
Das könnte auch helfen
Antwortzeit-Rechnerneu
Wie lange dauert eine KI-Antwort? Wartezeit aus Antwortlänge, Geschwindigkeit und Nachdenken.
Öffnenmax_tokens-Rechnerneu
Welches max_tokens für 500 Wörter? Ausgabelimit passend zur gewünschten Antwortlänge setzen.
ÖffnenTemperatur-Simulator
Sehen, wie Temperatur, Top-p und Top-k die Wortwahl eines Sprachmodells verändern.
ÖffnenModell-Finder
Welches KI-Modell passt? Aufgabe, Kontext und Budget angeben, passende Modelle nach Preis erhalten.
ÖffnenToken-Zähler
Tokens eines Textes oder einer Datei (PDF, Word, TXT) zählen, mit Kosten für alle Modelle.
ÖffnenKontextfenster-Rechner
Passt mein Dokument ins Kontextfenster? Seiten oder Wörter eingeben, für alle Modelle prüfen.
Öffnen