AI PICKS
調査・データOpenAI News公式発表2時間前・発表

OpenAI、「ChatGPT」の心の健康対応を測る新指標を公開 22カ国80人超の専門家と作成

結論(先に3行)
  1. OpenAI が9月23日、心の健康に関する会話の応答を測る指標を公開しました。
  2. 名称は「MentalHealthBench」で、誰でも使える公開形式です。
  3. 22カ国の資格を持つ専門家80人超と作り、研究者が自分で検証できます。
画像: OpenAI News

OpenAI は2026年9月23日、「MentalHealthBench」を公開しました。AI が心の健康に関わる会話でどう応答するかを測る、誰でも使える評価指標です。

作成には22カ国の資格を持つ心理士と精神科医が80人以上参加しました。話す言語は19、専門分野は約20に及びます。重みは-10から+10で、望ましい応答には加点、有害な応答には減点が付きます。

応答の採点は「GPT-5.6 Sol」が自動で行います。

感情の要素を含む日常の会話、緊急ではないものの深刻な悩みを示す会話、そして今すぐ現実の支援が必要な緊急時の会話です。登場するのは大人、10代、介護する家族、臨床医で、複数の言語と地域を含みます。会話はプライバシーを守る手法で作った合成のやりとりです。

「MentalHealthBench」は公開されているため、ほかの研究者が手法を確かめ、自分で評価を実行できます。「ChatGPT」は週に10億人以上が使っており、治療や専門的なケアの代わりにはなりません。OpenAI は地域の相談窓口や信頼できる人につなぐ応答を目指しています。

つまり、どういうこと?

つまり、AI が悩みの相談にどう答えるかを採点する、共通のテスト問題集ができたということです。これまでの評価は緊急時の対応に偏っていました。今回は、日常の愚痴から緊急事態まで幅を広げ、採点表は各国の専門家が書いています。新人の相談員に模擬ケースを解かせ、指導役が点を付ける仕組みに近い作りです。

編集部の見方AI PICKS編集部

性能の数字より先に、専門家80人超という作り方の説明が並びます。採点の物差しそのものを合議で組み上げる発想は、なかなか手間のかかる話です。

採点役が「GPT-5.6 Sol」という AI である点も見逃せません。専門家が書いた基準に沿わせているとはいえ、採点の癖まで消えるのかは気になります。

安全対策が先、性能は後。心の相談を AI に持ち込む人が増えるほど、企業の問い合わせ窓口でも同じ水準の応答が問われそうです。社内の一次対応に AI を置いている人なら、応答の設計を見直す材料になります。

そういえば、この取り組みは「HealthBench」の続きにあたります。次は他社のモデルの点数が同じ物差しで並ぶかを見たいです。

誰に関係するか

社内の相談対応や問い合わせ対応に AI を置いている人は、心の健康に関わる会話での応答の質を、公開された共通の基準で確かめられるようになります。

出典: OpenAI News

このニュースのツールAIチャットボット
ChatGPT icon
ChatGPT4.65最低料金¥0〜チャット文章生成コード生成
この発表の背景AI PICKS編集部

ChatGPTは、自然な対話を通じて質問回答、文章作成、情報整理、アイデア出しを支援するAIチャットボットです。

AI PICKSの総合評価は4.65(5点満点)、AIチャットボットカテゴリ87ツール中3位、最低料金は¥0〜です。

同じ用途の候補: ClaudeGeminiPerplexity

関連ニュースニュース一覧 >
法人の方へChatGPTの法人導入、無料相談セキュリティ要件・学習不使用の契約・研修まで、条件に合う候補を絞ってお返しします。相談料・紹介料は無料。