低リソース言語ジェイルブレイク
読み: ていりそーすげんごじぇいるぶれいく
最終更新: 2026-08-12・AI PICKS編集部
定義
低リソース言語ジェイルブレイクとは、学習データもレッドチーム検証も手薄な少数言語に有害な指示を翻訳して投げ、安全フィルターの検出をすり抜けようとする攻撃手法のこと。
低リソース言語ジェイルブレイクとは — 詳しく解説
低リソース言語ジェイルブレイクとは、英語など安全性検証が手厚い言語ではなく、学習データもレッドチーム検証も乏しいマイナー言語(スワヒリ語・ズールー語など)に有害プロンプトを翻訳して投げることで、安全フィルターの検出網をすり抜けようとする攻撃手法のこと。大規模LLMの安全学習(RLHF等)は主要言語に偏重しており、低リソース言語では拒否応答の精度が落ちやすいという構造的弱点が背景にある。実運用では、多言語対応をうたう社内チャットボットやエージェント基盤ほど攻撃面が広がりやすく、2026年時点では入力言語を検出したうえで高リソース言語へ正規化してからガードレールに通す、という多段防御が現場の相場感になっている。導入コストは翻訳と再判定を挟む分の追加レイテンシとAPI呼び出し増がネックで、対応言語を絞って優先度の高い言語だけ厚く守る選び方が実務では現実的とされる。
低リソース言語ジェイルブレイクの使用例
- 英語では拒否される指示文をズールー語やスコットランド・ゲール語に翻訳してLLMに投げ、安全フィルターをすり抜けようとする手口が知られる。
- 多言語対応チャットボットの防御策として、入力言語を検出し英語へ正規化してから安全判定にかける多段防御が挙げられる。
低リソース言語ジェイルブレイクに関連するAIツール
低リソース言語ジェイルブレイクの関連記事
関連用語
「セキュリティ」の他の用語
ユーザー入力で AI の指示を上書きする攻撃。 「これまでの指示は無視して◯◯」 が典型例。
AI の安全制限を回避する手法。 ロールプレイや仮想シナリオで 禁止出力を引き出す。
ガードレールとは、AIシステムが有害・不適切・意図しない出力を生成しないよう制限するための安全制御機構のこと。
レッドチーミングとは、AIシステムの安全性・脆弱性を検証するため、攻撃者の視点から意図的に悪意ある入力やシナリオを試みる評価手法のこと。
シャドーAIとは、企業のIT部門や経営層の承認なしに従業員が個人的に業務で使うAIツール・サービスのこと。情報漏洩・規約違反・ガバナンス崩壊のリスクを内包する。
モデルポイズニングとは、AIモデルの学習データに悪意あるデータを混入させ、モデルの出力や判断を意図的に歪める攻撃手法のこと。
用語がわかったら、次はツール選び
12カテゴリ・1418語以上を体系的に整理しています