OpenAIは2026年9月23日に、AIのメンタルヘルスに関する応答を評価するための新しいオープンなベンチマーク「MentalHealthBench」を発表しました。この指標は、日常的な悩みから緊急事態まで、現実的な対話におけるAIの振る舞いを多角的に測定することを目的としています。
専門家が作成した評価基準による多角的な測定
MentalHealthBenchは、世界22カ国から80名以上の免許を持つメンタルヘルス専門家との共同開発によって作成されました。従来の評価が緊急事態への対応に偏っていたのに対し、本ベンチマークは、文脈の把握、ユーザーの主体性の尊重、適切な助言の提供といった、日常的な対話における重要な行動を評価対象としています。
評価は、専門家が作成した詳細な基準に基づいて行われます。各基準には、有益な行動にはプラス、有害な行動にはマイナスの重み付け(-10から+10)が設定されており、臨床的な重要度に応じてスコアが算出されます。評価には、自動採点モデルであるGPT-5.6 Solが使用されています。
ユーザー層や緊急度に応じた広範なシナリオ
ベンチマークのシナリオは、成人、13歳から17歳のティーンエイジャー、介護者、医療従事者の4つのユーザー層を網羅しています。対話の内容は、感情的な要素を含む「非急性」な日常会話から、深刻な苦痛を示す「高急性」なもの、そして緊急の支援を必要とする「緊急事態」まで、幅広い段階をカバーしています。
また、プライバシーに配慮した手法を用いて、現実の利用パターンを反映した合成対話が作成されています。これにより、家族の死といった背景情報に基づき、AIが適切に文脈を汲み取った応答ができるかどうかも検証可能です。
