LLMペネトレーションテスト (LLM Pentesting)
読み: えるえるえむぺねとれーしょんてすと
最終更新: 2026-07-19・AI PICKS編集部
定義
LLMペネトレーションテストとは、大規模言語モデルを組み込んだシステムに対しプロンプトインジェクションやジェイルブレイクなどの手法で疑似攻撃を行い、脆弱性を洗い出すセキュリティ診断のことである。
LLMペネトレーションテスト (LLM Pentesting)とは — 詳しく解説
LLMペネトレーションテストは、OWASP Top 10 for LLM Applicationsなどの業界標準を参照しながら、プロンプトインジェクション・出力からの機密情報漏えい・不適切なツール呼び出し・ジェイルブレイクといった攻撃シナリオを模擬し、LLMアプリケーションの防御体制を検証する手法とされる。従来のWebアプリ診断と異なり入力が自然言語であるため攻撃パターンが無限に近く、単発の診断では見落としが生じやすい点が実運用上の落とし穴として指摘される。2026年時点では、RAGやエージェント連携を持つ製品の増加に伴い、ツール実行権限やAPI連携部分まで診断範囲に含めるかどうかで相場感が大きく変わり、簡易診断から本格的なレッドチーム演習まで幅がある。現場での選び方としては、自社のLLM利用範囲(社内利用かエンドユーザー向けか)を整理したうえで、対象範囲とコストのバランスを見て診断会社を選定することが重要とされる。
LLMペネトレーションテスト (LLM Pentesting)の使用例
- システムプロンプトを無視させ非公開情報を出力させる指示を送り、ガードレールの突破可否を検証する。
- RAG検索結果に悪意ある指示文を仕込み、LLMが外部ツールを誤動作させないか確認する。
LLMペネトレーションテスト (LLM Pentesting)に関連するAIツール
関連用語
「セキュリティ」の他の用語
ユーザー入力で AI の指示を上書きする攻撃。 「これまでの指示は無視して◯◯」 が典型例。
AI の安全制限を回避する手法。 ロールプレイや仮想シナリオで 禁止出力を引き出す。
ガードレールとは、AIシステムが有害・不適切・意図しない出力を生成しないよう制限するための安全制御機構のこと。
レッドチーミングとは、AIシステムの安全性・脆弱性を検証するため、攻撃者の視点から意図的に悪意ある入力やシナリオを試みる評価手法のこと。
シャドーAIとは、企業のIT部門や経営層の承認なしに従業員が個人的に業務で使うAIツール・サービスのこと。情報漏洩・規約違反・ガバナンス崩壊のリスクを内包する。
モデルポイズニングとは、AIモデルの学習データに悪意あるデータを混入させ、モデルの出力や判断を意図的に歪める攻撃手法のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・713語以上を体系的に整理しています
辞典トップへ