garak (LLM脆弱性スキャナ)
読み: がらっく
最終更新: 2026-08-01・AI PICKS編集部
定義
garak(ガラック)とは、大規模言語モデルに対してプロンプトインジェクションや有害出力などの脆弱性を自動的に検査するオープンソースのセキュリティスキャナのことです。
garak (LLM脆弱性スキャナ)とは — 詳しく解説
garakは、大規模言語モデル(LLM)に対してプロンプトインジェクション、ジェイルブレイク、有害出力、個人情報漏えい、ハルシネーションなど既知の攻撃パターンを自動で当てて脆弱性を洗い出すオープンソースのセキュリティスキャナで、ネットワーク診断ツールのnmapに相当するLLM版として広く知られる。CLIから対象モデルとプローブ群を指定するだけで実行でき、GPT系やClaude、オープンウェイトモデルなど幅広いLLMに対応するとされる。ただし実運用では、検知結果はあくまで既知パターンへの反応であり、独自ファインチューニング済みモデルや業務特化プロンプトの弱点までは拾いきれない点に注意が必要とされる。現場では、CI/CDに組み込んで新モデル導入時やプロンプト変更時に定期実行し、RAGやエージェント機能を追加した後の回帰チェックとして使うケースが多い。2026年時点ではOSSゆえライセンス費用は発生しないが、大量プローブの実行はAPIコール課金がかさむため、対象モデルとプローブ数を絞ってコストを管理するのが相場感として定着しつつある。
garak (LLM脆弱性スキャナ)の使用例
- garak --model_type openai --model_name gpt-4 --probes promptinject を実行し、既知の攻撃パターンを一括検査する。
- 新モデル導入前にgarakでハルシネーション系プローブを走らせ、CI上で回帰チェックとして使う運用例があるとされる。
garak (LLM脆弱性スキャナ)に関連するAIツール
関連用語
「セキュリティ」の他の用語
ユーザー入力で AI の指示を上書きする攻撃。 「これまでの指示は無視して◯◯」 が典型例。
AI の安全制限を回避する手法。 ロールプレイや仮想シナリオで 禁止出力を引き出す。
ガードレールとは、AIシステムが有害・不適切・意図しない出力を生成しないよう制限するための安全制御機構のこと。
レッドチーミングとは、AIシステムの安全性・脆弱性を検証するため、攻撃者の視点から意図的に悪意ある入力やシナリオを試みる評価手法のこと。
シャドーAIとは、企業のIT部門や経営層の承認なしに従業員が個人的に業務で使うAIツール・サービスのこと。情報漏洩・規約違反・ガバナンス崩壊のリスクを内包する。
モデルポイズニングとは、AIモデルの学習データに悪意あるデータを混入させ、モデルの出力や判断を意図的に歪める攻撃手法のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・1313語以上を体系的に整理しています
辞典トップへ