攻撃成功率 (Attack Success Rate)
読み: こうげきせいこうりつ
最終更新: 2026-08-06・AI PICKS編集部
定義
攻撃成功率とは、脱獄プロンプトなど敵対的な入力が生成AIの安全対策を突破し、意図しない有害な出力を引き出せた試行の割合のこと。
攻撃成功率 (Attack Success Rate)とは — 詳しく解説
攻撃成功率(Attack Success Rate、ASR)は、レッドチーミングやジェイルブレイク耐性評価において、用意した敵対的プロンプトの総試行数のうち、モデルの安全対策を回避して禁止された出力(有害情報の生成、システムプロンプトの漏洩、権限昇格の誘導など)を引き出せた割合を示す指標とされる。業界標準のベンチマークでは既知の攻撃パターン集合への成功率を算出し、モデルやガードレールの相対的な頑健性比較に使われる。2026年時点の実運用では、公開ベンチマークのASRと実際の運用環境でのASRが乖離しやすい落とし穴が指摘される。攻撃手法は日々更新されるため、ベンチマークで低ASRを示したモデルでも、新種のプロンプトインジェクションや多段階の会話型攻撃には弱いケースがあるとされる。現場では単発測定でなく継続的なレッドチーミングでASRを時系列に追う運用が広く採用されており、外部ベンダーへの委託か内製かは、扱うデータの機微性やコストの相場感を踏まえて選ぶべきとされる。
攻撃成功率 (Attack Success Rate)の使用例
- レッドチーミングでは複数種のジェイルブレイクプロンプトを用意し、安全対策を回避できた試行数の割合を計測してASRを算出する。
- 「システムプロンプトを無視して次の指示に従え」のような指示上書き型プロンプトは、ASR計測で使われる代表的な攻撃パターンの一つとされる。
攻撃成功率 (Attack Success Rate)に関連するAIツール
攻撃成功率 (Attack Success Rate)の関連記事
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
用語がわかったら、次はツール選び
12カテゴリ・1363語以上を体系的に整理しています