悪意あるLLM (WormGPT型)
読み: あくいあるえるえるえむ わーむじーぴーてぃーがた
最終更新: 2026-08-06・AI PICKS編集部
定義
悪意あるLLM(WormGPT型)とは、安全ガードレールを外し、詐欺やマルウェア作成など犯罪目的に特化させた大規模言語モデルのことである。
悪意あるLLM (WormGPT型)とは — 詳しく解説
WormGPTやFraudGPTに代表される悪意あるLLMは、正規の大規模言語モデルからガードレールを除去する、あるいはオープンソースモデルを不正目的向けに再学習して作られるとされる。フィッシングメール文面の自動生成、マルウェアコードの補助生成、ディープフェイク詐欺のシナリオ作成などへの悪用が報告されている。2026年時点の実運用上の落とし穴は、正規ベンダー側の検知網強化に伴い、こうしたツールがダークウェブ上で月額課金のサブスクリプションとして流通し、相場感としては数十〜数百ドル規模で取引されているとされる点にある。企業の現場では単体の対策ツール導入だけでなく、メールセキュリティやEDRとの多層防御、従業員教育まで含めたコスト設計が求められる。検知精度の数字だけで選ぶのではなく、継続的なアップデート体制を持つベンダーかどうかを基準にした選び方が重要とされる。
悪意あるLLM (WormGPT型)の使用例
- 「取引先を装い、緊急送金を促すメール文面を作って」という依頼にガードレールなしで応答するとされる。
- マルウェアの難読化コードや脆弱性を突く攻撃スクリプトの生成補助に使われるとされる。
悪意あるLLM (WormGPT型)に関連するAIツール
悪意あるLLM (WormGPT型)の関連記事
関連用語
「セキュリティ」の他の用語
ユーザー入力で AI の指示を上書きする攻撃。 「これまでの指示は無視して◯◯」 が典型例。
AI の安全制限を回避する手法。 ロールプレイや仮想シナリオで 禁止出力を引き出す。
ガードレールとは、AIシステムが有害・不適切・意図しない出力を生成しないよう制限するための安全制御機構のこと。
レッドチーミングとは、AIシステムの安全性・脆弱性を検証するため、攻撃者の視点から意図的に悪意ある入力やシナリオを試みる評価手法のこと。
シャドーAIとは、企業のIT部門や経営層の承認なしに従業員が個人的に業務で使うAIツール・サービスのこと。情報漏洩・規約違反・ガバナンス崩壊のリスクを内包する。
モデルポイズニングとは、AIモデルの学習データに悪意あるデータを混入させ、モデルの出力や判断を意図的に歪める攻撃手法のこと。
用語がわかったら、次はツール選び
12カテゴリ・1363語以上を体系的に整理しています