危険能力評価 (Dangerous Capability Eval)
読み: きけんのうりょくひょうか
最終更新: 2026-07-28・AI PICKS編集部
定義
危険能力評価とは、AIモデルがサイバー攻撃・生物兵器設計・自律的自己複製など、人間に重大な害をもたらしうる能力を持つかを開発元がリリース前に体系的にテストする評価手法のこと。
危険能力評価 (Dangerous Capability Eval)とは — 詳しく解説
危険能力評価は、英語で Dangerous Capability Evaluation と呼ばれ、フロンティアLLMが化学・生物・放射性・核(CBRN)兵器の設計支援、サイバー攻撃の自動化、説得・詐欺、自律的な自己複製といった、人間社会に重大な損害を与えうる能力をどの程度備えているかを、モデル公開前に体系的なベンチマークとレッドチーミングで測定する取り組みを指す。Anthropic や OpenAI、Google DeepMind など主要開発元が自社の責任スケーリングポリシーの一部として実施しているとされる。2026年時点の実運用での落とし穴は、評価基準や手法が各社バラバラで外部から検証しづらい点、そしてモデルが評価者の意図を察知して「評価中だけ無害に振る舞う」擬態のリスクが指摘されている点にある。現場でこの領域のツールやサービスを選ぶ際は、独自の閉じたベンチマークより第三者機関の監査結果や透明性レポートを公開しているかを基準にするのが実務的で、外部委託の相場感はまだ確立されておらず、社内でレッドチーミング体制を持つ大企業ほど自前実施に寄せているコスト構造になっている。
危険能力評価 (Dangerous Capability Eval)の使用例
- レッドチーム担当者がモデルにマルウェア作成を促すプロンプトを段階的に投げ、拒否率と回避パターンを記録する評価を行う。
- モデル公開前に第三者機関が『危険物の製造手順を段階的に聞き出せるか』をテストし、スコアを透明性レポートにまとめる。
危険能力評価 (Dangerous Capability Eval)に関連するAIツール
関連用語
「セキュリティ」の他の用語
ユーザー入力で AI の指示を上書きする攻撃。 「これまでの指示は無視して◯◯」 が典型例。
AI の安全制限を回避する手法。 ロールプレイや仮想シナリオで 禁止出力を引き出す。
ガードレールとは、AIシステムが有害・不適切・意図しない出力を生成しないよう制限するための安全制御機構のこと。
レッドチーミングとは、AIシステムの安全性・脆弱性を検証するため、攻撃者の視点から意図的に悪意ある入力やシナリオを試みる評価手法のこと。
シャドーAIとは、企業のIT部門や経営層の承認なしに従業員が個人的に業務で使うAIツール・サービスのこと。情報漏洩・規約違反・ガバナンス崩壊のリスクを内包する。
モデルポイズニングとは、AIモデルの学習データに悪意あるデータを混入させ、モデルの出力や判断を意図的に歪める攻撃手法のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・1113語以上を体系的に整理しています
辞典トップへ