KI-Modelle im Vergleich: Wer ist wo am stärksten?
Welches KI-Modell ist das beste fürs Programmieren, für Büroarbeit, lange Dokumente oder Faktenwissen? 12 aktuelle Modelle von Anthropic, OpenAI, Google, xAI, DeepSeek, Mistral und Moonshot im Leistungsvergleich nach Themen, mit Preis-Leistung in Euro.
- Insgesamt am stärkstenClaude Opus 5.5 (57,6 Punkte), dahinter Claude Sonnet 5.5 (56,0 Punkte)
- ProgrammierenClaude Sonnet 5.5 (63,6 %), dahinter Claude Opus 5.5 (59,6 %)
- BüroarbeitClaude Opus 5.5 (1.866 Elo), dahinter Claude Sonnet 5.5 (1.839 Elo)
- Schwierige FachfragenClaude Opus 5.5 (61,4 %), dahinter Claude Fable 5.1 (59,1 %)
- Lange DokumenteKimi K3 (88,7 %), dahinter Claude Fable 5.1 (85,3 %)
- Bilder und DiagrammeClaude Opus 5.5 (87,7 %), dahinter GPT-6 Astra (86,9 %)
- Am zuverlässigsten bei FaktenClaude Opus 5.5 (+46,4), dahinter Claude Fable 5.1 (+43,5)
- Am schnellstenDeepSeek V4.1 Flash (326 Tokens/s), dahinter Claude Sonnet 5.5 (206 Tokens/s)
- Beste Preis-LeistungGPT-6 Luna (214,7 Punkte je €), dahinter DeepSeek V4.1 Flash (84,8 Punkte je €)
Gesamtleistung
Der Intelligence Index fasst zehn anspruchsvolle Tests aus Mathematik, Naturwissenschaft, Programmieren, Agenten-Aufgaben und Schlussfolgern zu einem Wert zusammen. Test: Artificial Analysis Intelligence Index, Einheit: Punkte.
- 1Claude Opus 5.5Anthropic57,6
- 2Claude Sonnet 5.5Anthropic56,0
- 3Claude Fable 5.1Anthropic53,4
- 4GPT-6 AstraOpenAI52,7
- 5Gemini 4 ArgonGoogle52,6
- 6GPT-6.1 SolOpenAI51,8
- 7Grok 4.7xAI46,4
- 8Kimi K3Moonshot AI · offen43,6
- 9Gemini 3.8 FlashGoogle40,9
- 10DeepSeek V4.1 FlashDeepSeek · offen39,5
- 11Mistral Large 4Mistral38,4
- 12GPT-6 LunaOpenAI38,1
Programmieren und Agenten im Terminal
Terminal-Bench 4.0 prüft, ob ein Modell echte Aufgaben in der Kommandozeile selbstständig löst: Software einrichten, Fehler finden, Code ändern und testen. Test: Terminal-Bench 4.0, Einheit: %.
- 1Claude Sonnet 5.5Anthropic63,6 %
- 2Claude Opus 5.5Anthropic59,6 %
- 3GPT-6 AstraOpenAI59,1 %
- 4Gemini 4 ArgonGoogle57,1 %
- 5GPT-6.1 SolOpenAI56,1 %
- 6Claude Fable 5.1Anthropic52,0 %
- 7DeepSeek V4.1 FlashDeepSeek · offen26,8 %
- 8Mistral Large 4Mistral26,8 %
- 9Grok 4.7xAI25,8 %
- 10Gemini 3.8 FlashGoogle19,7 %
- 11Kimi K3Moonshot AI · offen12,6 %
- 12GPT-6 LunaOpenAI12,6 %
Büro- und Wissensarbeit
GDPval-AA misst Arbeitsergebnisse aus 44 Berufen, etwa Berichte, Tabellen und Präsentationen. Fachleute vergleichen die Ergebnisse paarweise; daraus entsteht eine Elo-Wertung wie im Schach. Test: GDPval-AA, Einheit: Elo.
- 1Claude Opus 5.5Anthropic1.866
- 2Claude Sonnet 5.5Anthropic1.839
- 3Claude Fable 5.1Anthropic1.758
- 4Grok 4.7xAI1.715
- 5Gemini 4 ArgonGoogle1.626
- 6DeepSeek V4.1 FlashDeepSeek · offen1.600
- 7GPT-6.1 SolOpenAI1.575
- 8GPT-6 AstraOpenAI1.542
- 9Kimi K3Moonshot AI · offen1.537
- 10GPT-6 LunaOpenAI1.437
- 11Gemini 3.8 FlashGoogle1.435
- 12Mistral Large 4Mistral1.424
Schwierige Fachfragen
Humanity's Last Exam besteht aus sehr schweren Fragen von Fachleuten aus über hundert Gebieten. Selbst Spitzenmodelle lösen nur einen Teil. Test: Humanity's Last Exam, Einheit: %.
- 1Claude Opus 5.5Anthropic61,4 %
- 2Claude Fable 5.1Anthropic59,1 %
- 3Gemini 4 ArgonGoogle57,1 %
- 4Claude Sonnet 5.5Anthropic55,0 %
- 5GPT-6 AstraOpenAI54,7 %
- 6GPT-6.1 SolOpenAI52,9 %
- 7Gemini 3.8 FlashGoogle47,8 %
- 8Kimi K3Moonshot AI · offen46,9 %
- 9Grok 4.7xAI43,1 %
- 10DeepSeek V4.1 FlashDeepSeek · offen39,2 %
- 11GPT-6 LunaOpenAI38,5 %
- 12Mistral Large 4Mistral35,0 %
Lange Dokumente verstehen
AA-LCR prüft, ob ein Modell Fragen zu sehr langen Dokumentensammlungen richtig beantwortet, bei denen Informationen über viele Seiten verteilt sind. Test: AA Long Context Reasoning, Einheit: %.
- 1Kimi K3Moonshot AI · offen88,7 %
- 2Claude Fable 5.1Anthropic85,3 %
- 3Claude Opus 5.5Anthropic84,7 %
- 4DeepSeek V4.1 FlashDeepSeek · offen84,0 %
- 5GPT-6 LunaOpenAI83,3 %
- 6GPT-6.1 SolOpenAI83,0 %
- 7Claude Sonnet 5.5Anthropic82,7 %
- 8Gemini 3.8 FlashGoogle81,3 %
- 9Mistral Large 4Mistral81,3 %
- 10GPT-6 AstraOpenAI80,7 %
- 11Gemini 4 ArgonGoogle79,7 %
- 12Grok 4.7xAI76,7 %
Faktenwissen und Zuverlässigkeit
Der Omniscience-Index zählt richtige Antworten positiv und falsche negativ; Zurückhaltung („weiß ich nicht“) ist neutral. Ein negativer Wert heißt: mehr falsche als richtige Antworten, also häufiges Halluzinieren. Test: AA-Omniscience, Einheit: Index.
- 1Claude Opus 5.5Anthropic+46,4
- 2Claude Fable 5.1Anthropic+43,5
- 3GPT-6 AstraOpenAI+43,4
- 4Gemini 4 ArgonGoogle+42,4
- 5GPT-6.1 SolOpenAI+41,5
- 6Claude Sonnet 5.5Anthropic+32,3
- 7Grok 4.7xAI+32,0
- 8Gemini 3.8 FlashGoogle+29,6
- 9Kimi K3Moonshot AI · offen+19,7
- 10GPT-6 LunaOpenAI+0,7
- 11DeepSeek V4.1 FlashDeepSeek · offen-5,3
- 12Mistral Large 4Mistral-5,3
Bilder und Diagramme verstehen
MMMU-Pro stellt Fragen zu Bildern, Diagrammen, Tabellen und Skizzen aus Studienfächern. Nicht alle Modelle wurden darin getestet. Test: MMMU-Pro, Einheit: %.
- 1Claude Opus 5.5Anthropic87,7 %
- 2GPT-6 AstraOpenAI86,9 %
- 3GPT-6.1 SolOpenAI86,0 %
- 4Gemini 3.8 FlashGoogle85,6 %
- 5Kimi K3Moonshot AI · offen80,5 %
- 6GPT-6 LunaOpenAI79,7 %
- 7DeepSeek V4.1 FlashDeepSeek · offen77,0 %
- 8Mistral Large 4Mistral76,4 %
Nicht getestet oder ohne öffentlichen Preis: Claude Sonnet 5.5, Claude Fable 5.1, Gemini 4 Argon, Grok 4.7.
Antwortgeschwindigkeit
Gemessen wird, wie viele Tokens das Modell pro Sekunde ausgibt (Median über viele Anfragen). Mehr ist schneller; bei Modellen mit langer Denkphase kommt eine Wartezeit vor der ersten Ausgabe hinzu. Test: Artificial Analysis, Ausgabegeschwindigkeit, Einheit: Tokens/s.
- 1DeepSeek V4.1 FlashDeepSeek · offen326
- 2Claude Sonnet 5.5Anthropic206
- 3Gemini 3.8 FlashGoogle203
- 4Claude Opus 5.5Anthropic152
- 5Mistral Large 4Mistral137
- 6GPT-6 LunaOpenAI128
- 7Claude Fable 5.1Anthropic104
- 8Grok 4.7xAI82
- 9GPT-6.1 SolOpenAI60
- 10GPT-6 AstraOpenAI59
- 11Kimi K3Moonshot AI · offen47
Nicht getestet oder ohne öffentlichen Preis: Gemini 4 Argon.
Preis-Leistung
Gesamtpunkte geteilt durch den Mischpreis in Euro je Million Tokens (drei Teile Eingabe, ein Teil Ausgabe). Hohe Werte bedeuten viel Leistung pro Euro. Test: eigene Berechnung, Einheit: Punkte je €.
- 1GPT-6 LunaOpenAI214,7
- 2DeepSeek V4.1 FlashDeepSeek · offen84,8
- 3Gemini 3.8 FlashGoogle30,7
- 4Mistral Large 4Mistral21,0
- 5Grok 4.7xAI17,4
- 6Claude Sonnet 5.5Anthropic15,8
- 7GPT-6.1 SolOpenAI14,6
- 8Kimi K3Moonshot AI · offen8,2
- 9Claude Opus 5.5Anthropic8,1
- 10Claude Fable 5.1Anthropic3,0
- 11GPT-6 AstraOpenAI3,0
Nicht getestet oder ohne öffentlichen Preis: Gemini 4 Argon.
Platzierung je Thema
Rang jedes Modells in allen Themen. Je dunkler das Feld, desto weiter vorn. Spaltenkopf anklicken, um danach zu sortieren.
| Modell | |||||||||
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5Anthropic | 1 | 2 | 1 | 1 | 3 | 1 | 1 | 4 | 9 |
| Claude Sonnet 5.5Anthropic | 2 | 1 | 2 | 4 | 7 | 6 | – | 2 | 6 |
| Claude Fable 5.1Anthropic | 3 | 6 | 3 | 2 | 2 | 2 | – | 7 | 10 |
| GPT-6 AstraOpenAI | 4 | 3 | 8 | 5 | 10 | 3 | 2 | 10 | 11 |
| Gemini 4 ArgonGoogle | 5 | 4 | 5 | 3 | 11 | 4 | – | – | – |
| GPT-6.1 SolOpenAI | 6 | 5 | 7 | 6 | 6 | 5 | 3 | 9 | 7 |
| Grok 4.7xAI | 7 | 9 | 4 | 9 | 12 | 7 | – | 8 | 5 |
| Kimi K3Moonshot AI | 8 | 11 | 9 | 8 | 1 | 9 | 5 | 11 | 8 |
| Gemini 3.8 FlashGoogle | 9 | 10 | 11 | 7 | 8 | 8 | 4 | 3 | 3 |
| DeepSeek V4.1 FlashDeepSeek | 10 | 7 | 6 | 10 | 4 | 11 | 7 | 1 | 2 |
| Mistral Large 4Mistral | 11 | 8 | 12 | 12 | 9 | 12 | 8 | 5 | 4 |
| GPT-6 LunaOpenAI | 12 | 12 | 10 | 11 | 5 | 10 | 6 | 6 | 1 |
So lesen Sie den Vergleich
Alle Werte stammen vom unabhängigen Testlabor Artificial Analysis (Artificial Analysis Intelligence Index v4.3.2), Stand 7. Oktober 2026. Getestet wurde jeweils die stärkste Denkstufe eines Modells, etwa „Max“ oder „High“. In niedrigeren Stufen antworten die Modelle schneller und günstiger, erreichen aber weniger Punkte.
Gemini 4 Argon ist noch nicht allgemein verfügbar und hat keinen öffentlichen Preis; es fehlt deshalb bei Preis-Leistung. Kimi K3 und DeepSeek V4.1 Flash sind offene Modelle, die sich auch selbst betreiben lassen.
Was die Modelle für Ihre Aufgabe kosten, zeigt der interaktive Kostenvergleich; welches Modell zu Budget und Anforderungen passt, findet der Modell-Finder.
Faustregeln
- Für schwierige, lange Aufgaben lohnt sich ein Spitzenmodell; die Mehrkosten sind oft kleiner als die Zeit für Nacharbeit.
- Für viele einfache Anfragen sind kleine Modelle wie Gemini 3.8 Flash, DeepSeek V4.1 Flash oder GPT-6 Luna die bessere Wahl.
- Bei Faktenfragen Quellen mitgeben, statt sich auf das Wissen des Modells zu verlassen.
- Vor der Entscheidung zwei oder drei Modelle mit eigenen Beispielen testen.
Häufige Fragen
Welches KI-Modell ist das beste?
Nach dem Gesamtwert des unabhängigen Testlabors Artificial Analysis liegt derzeit Claude Opus 5.5 vorn (Stand 7. Oktober 2026). Das „beste“ Modell hängt aber von der Aufgabe ab: Beim Programmieren, bei Büroarbeit und bei langen Dokumenten liegen teils andere Modelle an der Spitze, und günstige Modelle bieten oft deutlich mehr Leistung pro Euro.
Welches KI-Modell ist am besten zum Programmieren?
Im Test Terminal-Bench 4.0, der echte Aufgaben in der Kommandozeile prüft, erreicht Claude Sonnet 5.5 den höchsten Wert (63,6 %). Für einfache Code-Aufgaben reichen oft auch günstigere Modelle.
Welches Modell halluziniert am wenigsten?
Im Omniscience-Index, der falsche Antworten bestraft, schneidet Claude Opus 5.5 am besten ab. Modelle mit negativem Wert geben mehr falsche als richtige Antworten auf Wissensfragen; für Fakten sollten Sie dort Quellen mitliefern, etwa per RAG.
Wie aussagekräftig sind solche Tests?
Benchmarks messen eng umrissene Aufgaben unter festen Bedingungen. Sie zeigen Tendenzen, ersetzen aber keinen Test mit Ihren eigenen Daten. Kleine Unterschiede von ein bis zwei Punkten sind im Alltag meist nicht spürbar. Prüfen Sie zwei oder drei Kandidaten mit echten Beispielen aus Ihrer Arbeit.
Warum fehlen manche Modelle?
Wir zeigen Modelle, für die Artificial Analysis vergleichbare Messungen in allen Kernthemen veröffentlicht hat. Ältere oder kleinere Modelle wie Claude Haiku oder GPT-5.4 mini sind in der aktuellen Testreihe nicht vollständig erfasst. Ihre Preise finden Sie in der Modellübersicht.