KI-Modelle im Vergleich: Wer ist wo am stärksten?

Welches KI-Modell ist das beste fürs Programmieren, für Büroarbeit, lange Dokumente oder Faktenwissen? 12 aktuelle Modelle von Anthropic, OpenAI, Google, xAI, DeepSeek, Mistral und Moonshot im Leistungsvergleich nach Themen, mit Preis-Leistung in Euro.

  1. Insgesamt am stärksten
    Claude Opus 5.5 (57,6 Punkte), dahinter Claude Sonnet 5.5 (56,0 Punkte)
  2. Programmieren
    Claude Sonnet 5.5 (63,6 %), dahinter Claude Opus 5.5 (59,6 %)
  3. Büroarbeit
    Claude Opus 5.5 (1.866 Elo), dahinter Claude Sonnet 5.5 (1.839 Elo)
  4. Schwierige Fachfragen
    Claude Opus 5.5 (61,4 %), dahinter Claude Fable 5.1 (59,1 %)
  5. Lange Dokumente
    Kimi K3 (88,7 %), dahinter Claude Fable 5.1 (85,3 %)
  6. Bilder und Diagramme
    Claude Opus 5.5 (87,7 %), dahinter GPT-6 Astra (86,9 %)
  7. Am zuverlässigsten bei Fakten
    Claude Opus 5.5 (+46,4), dahinter Claude Fable 5.1 (+43,5)
  8. Am schnellsten
    DeepSeek V4.1 Flash (326 Tokens/s), dahinter Claude Sonnet 5.5 (206 Tokens/s)
  9. Beste Preis-Leistung
    GPT-6 Luna (214,7 Punkte je €), dahinter DeepSeek V4.1 Flash (84,8 Punkte je €)

Gesamtleistung

Der Intelligence Index fasst zehn anspruchsvolle Tests aus Mathematik, Naturwissenschaft, Programmieren, Agenten-Aufgaben und Schlussfolgern zu einem Wert zusammen. Test: Artificial Analysis Intelligence Index, Einheit: Punkte.

  1. 1Claude Opus 5.5Anthropic57,6
  2. 2Claude Sonnet 5.5Anthropic56,0
  3. 3Claude Fable 5.1Anthropic53,4
  4. 4GPT-6 AstraOpenAI52,7
  5. 5Gemini 4 ArgonGoogle52,6
  6. 6GPT-6.1 SolOpenAI51,8
  7. 7Grok 4.7xAI46,4
  8. 8Kimi K3Moonshot AI · offen43,6
  9. 9Gemini 3.8 FlashGoogle40,9
  10. 10DeepSeek V4.1 FlashDeepSeek · offen39,5
  11. 11Mistral Large 4Mistral38,4
  12. 12GPT-6 LunaOpenAI38,1

Programmieren und Agenten im Terminal

Terminal-Bench 4.0 prüft, ob ein Modell echte Aufgaben in der Kommandozeile selbstständig löst: Software einrichten, Fehler finden, Code ändern und testen. Test: Terminal-Bench 4.0, Einheit: %.

  1. 1Claude Sonnet 5.5Anthropic63,6 %
  2. 2Claude Opus 5.5Anthropic59,6 %
  3. 3GPT-6 AstraOpenAI59,1 %
  4. 4Gemini 4 ArgonGoogle57,1 %
  5. 5GPT-6.1 SolOpenAI56,1 %
  6. 6Claude Fable 5.1Anthropic52,0 %
  7. 7DeepSeek V4.1 FlashDeepSeek · offen26,8 %
  8. 8Mistral Large 4Mistral26,8 %
  9. 9Grok 4.7xAI25,8 %
  10. 10Gemini 3.8 FlashGoogle19,7 %
  11. 11Kimi K3Moonshot AI · offen12,6 %
  12. 12GPT-6 LunaOpenAI12,6 %

Büro- und Wissensarbeit

GDPval-AA misst Arbeitsergebnisse aus 44 Berufen, etwa Berichte, Tabellen und Präsentationen. Fachleute vergleichen die Ergebnisse paarweise; daraus entsteht eine Elo-Wertung wie im Schach. Test: GDPval-AA, Einheit: Elo.

  1. 1Claude Opus 5.5Anthropic1.866
  2. 2Claude Sonnet 5.5Anthropic1.839
  3. 3Claude Fable 5.1Anthropic1.758
  4. 4Grok 4.7xAI1.715
  5. 5Gemini 4 ArgonGoogle1.626
  6. 6DeepSeek V4.1 FlashDeepSeek · offen1.600
  7. 7GPT-6.1 SolOpenAI1.575
  8. 8GPT-6 AstraOpenAI1.542
  9. 9Kimi K3Moonshot AI · offen1.537
  10. 10GPT-6 LunaOpenAI1.437
  11. 11Gemini 3.8 FlashGoogle1.435
  12. 12Mistral Large 4Mistral1.424

Schwierige Fachfragen

Humanity's Last Exam besteht aus sehr schweren Fragen von Fachleuten aus über hundert Gebieten. Selbst Spitzenmodelle lösen nur einen Teil. Test: Humanity's Last Exam, Einheit: %.

  1. 1Claude Opus 5.5Anthropic61,4 %
  2. 2Claude Fable 5.1Anthropic59,1 %
  3. 3Gemini 4 ArgonGoogle57,1 %
  4. 4Claude Sonnet 5.5Anthropic55,0 %
  5. 5GPT-6 AstraOpenAI54,7 %
  6. 6GPT-6.1 SolOpenAI52,9 %
  7. 7Gemini 3.8 FlashGoogle47,8 %
  8. 8Kimi K3Moonshot AI · offen46,9 %
  9. 9Grok 4.7xAI43,1 %
  10. 10DeepSeek V4.1 FlashDeepSeek · offen39,2 %
  11. 11GPT-6 LunaOpenAI38,5 %
  12. 12Mistral Large 4Mistral35,0 %

Lange Dokumente verstehen

AA-LCR prüft, ob ein Modell Fragen zu sehr langen Dokumentensammlungen richtig beantwortet, bei denen Informationen über viele Seiten verteilt sind. Test: AA Long Context Reasoning, Einheit: %.

  1. 1Kimi K3Moonshot AI · offen88,7 %
  2. 2Claude Fable 5.1Anthropic85,3 %
  3. 3Claude Opus 5.5Anthropic84,7 %
  4. 4DeepSeek V4.1 FlashDeepSeek · offen84,0 %
  5. 5GPT-6 LunaOpenAI83,3 %
  6. 6GPT-6.1 SolOpenAI83,0 %
  7. 7Claude Sonnet 5.5Anthropic82,7 %
  8. 8Gemini 3.8 FlashGoogle81,3 %
  9. 9Mistral Large 4Mistral81,3 %
  10. 10GPT-6 AstraOpenAI80,7 %
  11. 11Gemini 4 ArgonGoogle79,7 %
  12. 12Grok 4.7xAI76,7 %

Faktenwissen und Zuverlässigkeit

Der Omniscience-Index zählt richtige Antworten positiv und falsche negativ; Zurückhaltung („weiß ich nicht“) ist neutral. Ein negativer Wert heißt: mehr falsche als richtige Antworten, also häufiges Halluzinieren. Test: AA-Omniscience, Einheit: Index.

  1. 1Claude Opus 5.5Anthropic+46,4
  2. 2Claude Fable 5.1Anthropic+43,5
  3. 3GPT-6 AstraOpenAI+43,4
  4. 4Gemini 4 ArgonGoogle+42,4
  5. 5GPT-6.1 SolOpenAI+41,5
  6. 6Claude Sonnet 5.5Anthropic+32,3
  7. 7Grok 4.7xAI+32,0
  8. 8Gemini 3.8 FlashGoogle+29,6
  9. 9Kimi K3Moonshot AI · offen+19,7
  10. 10GPT-6 LunaOpenAI+0,7
  11. 11DeepSeek V4.1 FlashDeepSeek · offen-5,3
  12. 12Mistral Large 4Mistral-5,3

Bilder und Diagramme verstehen

MMMU-Pro stellt Fragen zu Bildern, Diagrammen, Tabellen und Skizzen aus Studienfächern. Nicht alle Modelle wurden darin getestet. Test: MMMU-Pro, Einheit: %.

  1. 1Claude Opus 5.5Anthropic87,7 %
  2. 2GPT-6 AstraOpenAI86,9 %
  3. 3GPT-6.1 SolOpenAI86,0 %
  4. 4Gemini 3.8 FlashGoogle85,6 %
  5. 5Kimi K3Moonshot AI · offen80,5 %
  6. 6GPT-6 LunaOpenAI79,7 %
  7. 7DeepSeek V4.1 FlashDeepSeek · offen77,0 %
  8. 8Mistral Large 4Mistral76,4 %

Nicht getestet oder ohne öffentlichen Preis: Claude Sonnet 5.5, Claude Fable 5.1, Gemini 4 Argon, Grok 4.7.

Antwortgeschwindigkeit

Gemessen wird, wie viele Tokens das Modell pro Sekunde ausgibt (Median über viele Anfragen). Mehr ist schneller; bei Modellen mit langer Denkphase kommt eine Wartezeit vor der ersten Ausgabe hinzu. Test: Artificial Analysis, Ausgabegeschwindigkeit, Einheit: Tokens/s.

  1. 1DeepSeek V4.1 FlashDeepSeek · offen326
  2. 2Claude Sonnet 5.5Anthropic206
  3. 3Gemini 3.8 FlashGoogle203
  4. 4Claude Opus 5.5Anthropic152
  5. 5Mistral Large 4Mistral137
  6. 6GPT-6 LunaOpenAI128
  7. 7Claude Fable 5.1Anthropic104
  8. 8Grok 4.7xAI82
  9. 9GPT-6.1 SolOpenAI60
  10. 10GPT-6 AstraOpenAI59
  11. 11Kimi K3Moonshot AI · offen47

Nicht getestet oder ohne öffentlichen Preis: Gemini 4 Argon.

Preis-Leistung

Gesamtpunkte geteilt durch den Mischpreis in Euro je Million Tokens (drei Teile Eingabe, ein Teil Ausgabe). Hohe Werte bedeuten viel Leistung pro Euro. Test: eigene Berechnung, Einheit: Punkte je €.

  1. 1GPT-6 LunaOpenAI214,7
  2. 2DeepSeek V4.1 FlashDeepSeek · offen84,8
  3. 3Gemini 3.8 FlashGoogle30,7
  4. 4Mistral Large 4Mistral21,0
  5. 5Grok 4.7xAI17,4
  6. 6Claude Sonnet 5.5Anthropic15,8
  7. 7GPT-6.1 SolOpenAI14,6
  8. 8Kimi K3Moonshot AI · offen8,2
  9. 9Claude Opus 5.5Anthropic8,1
  10. 10Claude Fable 5.1Anthropic3,0
  11. 11GPT-6 AstraOpenAI3,0

Nicht getestet oder ohne öffentlichen Preis: Gemini 4 Argon.

Stärkenprofil

Platzierung je Thema

Rang jedes Modells in allen Themen. Je dunkler das Feld, desto weiter vorn. Spaltenkopf anklicken, um danach zu sortieren.

Modell
Claude Opus 5.5Anthropic121131149
Claude Sonnet 5.5Anthropic212476–26
Claude Fable 5.1Anthropic363222–710
GPT-6 AstraOpenAI438510321011
Gemini 4 ArgonGoogle5453114–––
GPT-6.1 SolOpenAI657665397
Grok 4.7xAI7949127–85
Kimi K3Moonshot AI81198195118
Gemini 3.8 FlashGoogle91011788433
DeepSeek V4.1 FlashDeepSeek107610411712
Mistral Large 4Mistral1181212912854
GPT-6 LunaOpenAI12121011510661

So lesen Sie den Vergleich

Alle Werte stammen vom unabhängigen Testlabor Artificial Analysis (Artificial Analysis Intelligence Index v4.3.2), Stand 7. Oktober 2026. Getestet wurde jeweils die stärkste Denkstufe eines Modells, etwa „Max“ oder „High“. In niedrigeren Stufen antworten die Modelle schneller und günstiger, erreichen aber weniger Punkte.

Gemini 4 Argon ist noch nicht allgemein verfügbar und hat keinen öffentlichen Preis; es fehlt deshalb bei Preis-Leistung. Kimi K3 und DeepSeek V4.1 Flash sind offene Modelle, die sich auch selbst betreiben lassen.

Was die Modelle für Ihre Aufgabe kosten, zeigt der interaktive Kostenvergleich; welches Modell zu Budget und Anforderungen passt, findet der Modell-Finder.

Faustregeln

  • Für schwierige, lange Aufgaben lohnt sich ein Spitzenmodell; die Mehrkosten sind oft kleiner als die Zeit für Nacharbeit.
  • Für viele einfache Anfragen sind kleine Modelle wie Gemini 3.8 Flash, DeepSeek V4.1 Flash oder GPT-6 Luna die bessere Wahl.
  • Bei Faktenfragen Quellen mitgeben, statt sich auf das Wissen des Modells zu verlassen.
  • Vor der Entscheidung zwei oder drei Modelle mit eigenen Beispielen testen.
Fragen

Häufige Fragen

Welches KI-Modell ist das beste?

Nach dem Gesamtwert des unabhängigen Testlabors Artificial Analysis liegt derzeit Claude Opus 5.5 vorn (Stand 7. Oktober 2026). Das „beste“ Modell hängt aber von der Aufgabe ab: Beim Programmieren, bei Büroarbeit und bei langen Dokumenten liegen teils andere Modelle an der Spitze, und günstige Modelle bieten oft deutlich mehr Leistung pro Euro.

Welches KI-Modell ist am besten zum Programmieren?

Im Test Terminal-Bench 4.0, der echte Aufgaben in der Kommandozeile prüft, erreicht Claude Sonnet 5.5 den höchsten Wert (63,6 %). Für einfache Code-Aufgaben reichen oft auch günstigere Modelle.

Welches Modell halluziniert am wenigsten?

Im Omniscience-Index, der falsche Antworten bestraft, schneidet Claude Opus 5.5 am besten ab. Modelle mit negativem Wert geben mehr falsche als richtige Antworten auf Wissensfragen; für Fakten sollten Sie dort Quellen mitliefern, etwa per RAG.

Wie aussagekräftig sind solche Tests?

Benchmarks messen eng umrissene Aufgaben unter festen Bedingungen. Sie zeigen Tendenzen, ersetzen aber keinen Test mit Ihren eigenen Daten. Kleine Unterschiede von ein bis zwei Punkten sind im Alltag meist nicht spürbar. Prüfen Sie zwei oder drei Kandidaten mit echten Beispielen aus Ihrer Arbeit.

Warum fehlen manche Modelle?

Wir zeigen Modelle, für die Artificial Analysis vergleichbare Messungen in allen Kernthemen veröffentlicht hat. Ältere oder kleinere Modelle wie Claude Haiku oder GPT-5.4 mini sind in der aktuellen Testreihe nicht vollständig erfasst. Ihre Preise finden Sie in der Modellübersicht.