MentalHealthBench: OpenAI testet KI bei psychischen Krisen
OpenAI hat einen neuen Test veröffentlicht, der prüft, wie gut KI-Modelle in Gesprächen über psychische Gesundheit reagieren, von Alltagssorgen bis zum Notfall.
MentalHealthBench enthält 1.215 simulierte Gespräche und 5.262 Bewertungskriterien, erarbeitet von mehr als 80 Psychologinnen, Psychologen und Psychiatern aus 22 Ländern in 19 Sprachen. Rund 28 Prozent der Fälle sind Notfälle, 18 Prozent besonders akute Situationen.
Selbst OpenAIs stärkstes Modell GPT-6 Astra erfüllt nur 57,3 Prozent der Kriterien. Der Test soll helfen, Schwächen zu finden und zu messen, ob Modelle in Krisen angemessen reagieren und auf professionelle Hilfe verweisen.
KI-Chatbots ersetzen keine Fachleute. Wer einen Chatbot für Kunden betreibt, sollte festlegen, wie er bei sensiblen Themen reagiert und an Menschen übergibt; Hinweise gibt KI im Kundenservice.
Quellen
Eigene Zusammenfassung auf Grundlage der genannten Quellen, erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Illustration: Tokenlabor, per Programm gezeichnet, kein KI-Bild.


