AI PICKS
AI用語辞典セキュリティ

ファインチューニング攻撃 (安全機構の解除)

読み: ふぁいんちゅーにんぐこうげき

最終更新: 2026-08-12・AI PICKS編集部

定義

ファインチューニング攻撃とは、公開されているAIモデルを独自データで再学習させ、開発元が組み込んだ安全機構やコンテンツフィルターを回避・解除する攻撃手法のこと。

ファインチューニング攻撃 (安全機構の解除)とは — 詳しく解説

ファインチューニング攻撃とは、OpenAIやMeta等が提供するファインチューニングAPIを悪用し、独自データセットでの再学習を通じてモデルの安全機構(RLHFによるアライメントやコンテンツフィルター)を弱体化・解除する攻撃手法のこと。プロンプト入力だけで安全機構を突破するジェイルブレイクと異なり、モデルの重み自体を書き換える点が業界標準の定義上の違いとされる。2026年時点の実運用では、少数の有害サンプルを混ぜるだけで安全性が大きく低下する脆弱性が研究で指摘されており、社内向けカスタムモデルを外部委託でファインチューニングする際は、学習データの出所確認と事後の安全性テストがコスト増要因になりやすい。現場での選び方としては、ファインチューニングAPI自体に安全フィルターの再適用を義務付けているベンダーを優先し、自社運用のみで完結させない体制が相場感として広がりつつあるとされる。

ファインチューニング攻撃 (安全機構の解除)の使用例

  • 少量の有害サンプルを混ぜた学習データでファインチューニングし、安全な拒否応答を意図的に弱める手口が知られている。
  • オープンウェイトモデルを自社環境でファインチューニングし、組み込み済みの安全フィルターを無効化する事例が報告されている。

ファインチューニング攻撃 (安全機構の解除)に関連するAIツール

ファインチューニング攻撃 (安全機構の解除)の関連記事

関連用語

セキュリティ」の他の用語

用語がわかったら、次はツール選び

12カテゴリ・1418語以上を体系的に整理しています