OpenAI、「ChatGPT」の心の健康対応を測る新指標を公開 22カ国80人超の専門家と作成
- OpenAI が9月23日、心の健康に関する会話の応答を測る指標を公開しました。
- 名称は「MentalHealthBench」で、誰でも使える公開形式です。
- 22カ国の資格を持つ専門家80人超と作り、研究者が自分で検証できます。

OpenAI は2026年9月23日、「MentalHealthBench」を公開しました。AI が心の健康に関わる会話でどう応答するかを測る、誰でも使える評価指標です。
作成には22カ国の資格を持つ心理士と精神科医が80人以上参加しました。話す言語は19、専門分野は約20に及びます。重みは-10から+10で、望ましい応答には加点、有害な応答には減点が付きます。
応答の採点は「GPT-5.6 Sol」が自動で行います。
感情の要素を含む日常の会話、緊急ではないものの深刻な悩みを示す会話、そして今すぐ現実の支援が必要な緊急時の会話です。登場するのは大人、10代、介護する家族、臨床医で、複数の言語と地域を含みます。会話はプライバシーを守る手法で作った合成のやりとりです。
「MentalHealthBench」は公開されているため、ほかの研究者が手法を確かめ、自分で評価を実行できます。「ChatGPT」は週に10億人以上が使っており、治療や専門的なケアの代わりにはなりません。OpenAI は地域の相談窓口や信頼できる人につなぐ応答を目指しています。
つまり、AI が悩みの相談にどう答えるかを採点する、共通のテスト問題集ができたということです。これまでの評価は緊急時の対応に偏っていました。今回は、日常の愚痴から緊急事態まで幅を広げ、採点表は各国の専門家が書いています。新人の相談員に模擬ケースを解かせ、指導役が点を付ける仕組みに近い作りです。

性能の数字より先に、専門家80人超という作り方の説明が並びます。採点の物差しそのものを合議で組み上げる発想は、なかなか手間のかかる話です。
採点役が「GPT-5.6 Sol」という AI である点も見逃せません。専門家が書いた基準に沿わせているとはいえ、採点の癖まで消えるのかは気になります。
安全対策が先、性能は後。心の相談を AI に持ち込む人が増えるほど、企業の問い合わせ窓口でも同じ水準の応答が問われそうです。社内の一次対応に AI を置いている人なら、応答の設計を見直す材料になります。
そういえば、この取り組みは「HealthBench」の続きにあたります。次は他社のモデルの点数が同じ物差しで並ぶかを見たいです。
社内の相談対応や問い合わせ対応に AI を置いている人は、心の健康に関わる会話での応答の質を、公開された共通の基準で確かめられるようになります。
出典: OpenAI News ↗

