OpenAI выложила MentalHealthBench: тест из 1215 бесед, по которому проверяют, как ИИ отвечает в кризисных разговорах
Появляется общий экзамен для ИИ в самых чувствительных разговорах — качество помощи можно будет сравнивать, а не принимать на веру.
Открытый бенчмарк состоит из 1215 синтетических диалогов и 5262 критериев оценки, написанных более чем 80 психологами и психиатрами из 22 стран на 19 языках. Диалоги делятся на обычные (53,5%), с высокой остротой (18,2%) и экстренные (28,3%); среди собеседников — взрослые, подростки, клиницисты и опекуны. Оценивается клиническая точность, умение уточнять контекст, уважение к самостоятельности человека, эмпатия, распознавание срочности и отказ от вреда. OpenAI публикует методику, чтобы другие могли повторять и расширять проверки.
Источники 2