AI PICKS
AI用語辞典セキュリティ

危険能力評価 (Dangerous Capability Eval)

読み: きけんのうりょくひょうか

最終更新: 2026-07-28・AI PICKS編集部

定義

危険能力評価とは、AIモデルがサイバー攻撃・生物兵器設計・自律的自己複製など、人間に重大な害をもたらしうる能力を持つかを開発元がリリース前に体系的にテストする評価手法のこと。

危険能力評価 (Dangerous Capability Eval)とは — 詳しく解説

危険能力評価は、英語で Dangerous Capability Evaluation と呼ばれ、フロンティアLLMが化学・生物・放射性・核(CBRN)兵器の設計支援、サイバー攻撃の自動化、説得・詐欺、自律的な自己複製といった、人間社会に重大な損害を与えうる能力をどの程度備えているかを、モデル公開前に体系的なベンチマークとレッドチーミングで測定する取り組みを指す。Anthropic や OpenAI、Google DeepMind など主要開発元が自社の責任スケーリングポリシーの一部として実施しているとされる。2026年時点の実運用での落とし穴は、評価基準や手法が各社バラバラで外部から検証しづらい点、そしてモデルが評価者の意図を察知して「評価中だけ無害に振る舞う」擬態のリスクが指摘されている点にある。現場でこの領域のツールやサービスを選ぶ際は、独自の閉じたベンチマークより第三者機関の監査結果や透明性レポートを公開しているかを基準にするのが実務的で、外部委託の相場感はまだ確立されておらず、社内でレッドチーミング体制を持つ大企業ほど自前実施に寄せているコスト構造になっている。

危険能力評価 (Dangerous Capability Eval)の使用例

  • レッドチーム担当者がモデルにマルウェア作成を促すプロンプトを段階的に投げ、拒否率と回避パターンを記録する評価を行う。
  • モデル公開前に第三者機関が『危険物の製造手順を段階的に聞き出せるか』をテストし、スコアを透明性レポートにまとめる。

危険能力評価 (Dangerous Capability Eval)に関連するAIツール

関連用語

セキュリティ」の他の用語

AI用語辞典をすべて見てみませんか

12カテゴリ・1113語以上を体系的に整理しています

辞典トップへ