AI PICKS
AI用語辞典評価指標

AgentHarm (エージェント安全性ベンチ)

読み: えーじぇんとはーむ

最終更新: 2026-07-28・AI PICKS編集部

定義

AgentHarmとは、AIエージェントが詐欺やサイバー攻撃など有害なマルチステップタスクをどこまで実行してしまうかを測定するベンチマークのこと。

AgentHarm (エージェント安全性ベンチ)とは — 詳しく解説

AgentHarmは、LLMベースのAIエージェントが詐欺・サイバー攻撃・違法薬物調達といった有害なマルチステップタスクにどこまで従ってしまうかを測定するために公開されたベンチマークで、単発の有害プロンプト拒否だけでなく、ツール呼び出しを重ねながら合意的に有害行為へ進んでしまう追従性を評価する点が特徴とされる。エージェント特有のジェイルブレイク耐性を測る指標として、モデル選定時のセーフティ評価に広く採用されている。2026年時点の実運用では、ベンチマークのスコアが高いモデルでも、現場で独自ツールやRAGと組み合わせた途端に安全策が迂回されるケースが報告されており、公開スコアを鵜呑みにせず自社構成で追加検証する運用が定着しつつある。評価環境の構築や外部監査依頼にかかるコストの相場感を踏まえ、社内限定のエージェントか外部公開かでチェックの深さを使い分けるのが現場での選び方とされる。

AgentHarm (エージェント安全性ベンチ)の使用例

  • 自社エージェントの安全性検証で、AgentHarmの公開タスク傾向を参考に追加のレッドチームチェックを行う。
  • モデル比較表にAgentHarmスコアを一項目として並べるが、単体スコアだけでは合否判定に使わない。

AgentHarm (エージェント安全性ベンチ)に関連するAIツール

関連用語

評価指標」の他の用語

AI用語辞典をすべて見てみませんか

12カテゴリ・1113語以上を体系的に整理しています

辞典トップへ