定義
AgentHarmとは、AIエージェントが詐欺やサイバー攻撃など有害なマルチステップタスクをどこまで実行してしまうかを測定するベンチマークのこと。
AgentHarm (エージェント安全性ベンチ)とは(詳しく解説)
AgentHarmは、LLMベースのAIエージェントが詐欺・サイバー攻撃・違法薬物調達といった有害なマルチステップタスクにどこまで従ってしまうかを測定するために公開されたベンチマークで、単発の有害プロンプト拒否だけでなく、ツール呼び出しを重ねながら合意的に有害行為へ進んでしまう追従性を評価する点が特徴とされる。エージェント特有のジェイルブレイク耐性を測る指標として、モデル選定時のセーフティ評価に広く採用されている。2026年時点の実運用では、ベンチマークのスコアが高いモデルでも、現場で独自ツールやRAGと組み合わせた途端に安全策が迂回されるケースが報告されており、公開スコアを鵜呑みにせず自社構成で追加検証する運用が定着しつつある。評価環境の構築や外部監査依頼にかかるコストの相場感を踏まえ、社内限定のエージェントか外部公開かでチェックの深さを使い分けるのが現場での選び方とされる。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「AgentHarm (エージェント安全性ベンチ)とは」 https://aipicks.jp/glossary/agentharm
AgentHarm (エージェント安全性ベンチ)の使用例
- 自社エージェントの安全性検証で、AgentHarmの公開タスク傾向を参考に追加のレッドチームチェックを行う。
- モデル比較表にAgentHarmスコアを一項目として並べるが、単体スコアだけでは合否判定に使わない。