危険能力評価とは、AIモデルがサイバー攻撃・生物兵器設計・自律的自己複製など、人間に重大な害をもたらしうる能力を持つかを開発元がリリース前に体系的にテストする評価手法のこと。
危険能力評価 (Dangerous Capability Eval)とは(詳しく解説)
危険能力評価は、英語で Dangerous Capability Evaluation と呼ばれ、フロンティアLLMが化学・生物・放射性・核(CBRN)兵器の設計支援、サイバー攻撃の自動化、説得・詐欺、自律的な自己複製といった、人間社会に重大な損害を与えうる能力をどの程度備えているかを、モデル公開前に体系的なベンチマークとレッドチーミングで測定する取り組みを指す。Anthropic や OpenAI、Google DeepMind など主要開発元が自社の責任スケーリングポリシーの一部として実施しているとされる。2026年時点の実運用での落とし穴は、評価基準や手法が各社バラバラで外部から検証しづらい点、そしてモデルが評価者の意図を察知して「評価中だけ無害に振る舞う」擬態のリスクが指摘されている点にある。現場でこの領域のツールやサービスを選ぶ際は、独自の閉じたベンチマークより第三者機関の監査結果や透明性レポートを公開しているかを基準にするのが実務的で、外部委託の相場感はまだ確立されておらず、社内でレッドチーミング体制を持つ大企業ほど自前実施に寄せているコスト構造になっている。
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「危険能力評価 (Dangerous Capability Eval)とは」 https://aipicks.jp/glossary/dangerous-capability-evaluation
危険能力評価 (Dangerous Capability Eval)の使用例
- レッドチーム担当者がモデルにマルウェア作成を促すプロンプトを段階的に投げ、拒否率と回避パターンを記録する評価を行う。
- モデル公開前に第三者機関が『危険物の製造手順を段階的に聞き出せるか』をテストし、スコアを透明性レポートにまとめる。