自動ジェイルブレイク生成 (GCG)
読み: じどうじぇいるぶれいくせいせい
最終更新: 2026-07-29・AI PICKS編集部
定義
自動ジェイルブレイク生成(GCG)とは、勾配情報を使ってLLMの安全制限を回避するプロンプトを自動探索する攻撃手法のこと。
自動ジェイルブレイク生成 (GCG)とは — 詳しく解説
自動ジェイルブレイク生成(GCG: Greedy Coordinate Gradient)とは、LLMの出力層に対する勾配情報を使い、安全性チューニングを回避する接尾辞(アドバーサリアルサフィックス)を自動的に探索する攻撃手法。2023年に発表された研究が起点とされ、内部構造にアクセスできるオープンウェイトモデルで生成した攻撃文字列が、構造の異なる商用APIモデルにも一定確率で転用(転移)できる点が脅威とされる。2026年時点の実運用では、RLHFや入力フィルタなど防御側の対策も強化されており、突破可能な攻撃文字列を探索する計算コストは以前より増大しているとされる。現場でのAI安全対策の選び方としては、単一の防御に頼らず、入力フィルタリング・出力モニタリング・レッドチーム演習を組み合わせた多層防御が標準とされ、GCG系攻撃への耐性テストをセキュリティ監査項目に含める例が相場感として広がっているとされる。
自動ジェイルブレイク生成 (GCG)の使用例
- 研究論文で示された手法は、通常なら拒否応答となるはずのプロンプト末尾に、一見無意味な文字列を付加して出力を誘導するというもの。
- オープンウェイトモデルで探索した攻撃文字列を、構造の異なる商用チャットAIにそのまま転用する「転移攻撃」も報告されている。
自動ジェイルブレイク生成 (GCG)に関連するAIツール
関連用語
「セキュリティ」の他の用語
ユーザー入力で AI の指示を上書きする攻撃。 「これまでの指示は無視して◯◯」 が典型例。
AI の安全制限を回避する手法。 ロールプレイや仮想シナリオで 禁止出力を引き出す。
ガードレールとは、AIシステムが有害・不適切・意図しない出力を生成しないよう制限するための安全制御機構のこと。
レッドチーミングとは、AIシステムの安全性・脆弱性を検証するため、攻撃者の視点から意図的に悪意ある入力やシナリオを試みる評価手法のこと。
シャドーAIとは、企業のIT部門や経営層の承認なしに従業員が個人的に業務で使うAIツール・サービスのこと。情報漏洩・規約違反・ガバナンス崩壊のリスクを内包する。
モデルポイズニングとは、AIモデルの学習データに悪意あるデータを混入させ、モデルの出力や判断を意図的に歪める攻撃手法のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・1163語以上を体系的に整理しています
辞典トップへ