Constitutional Classifiers (憲法分類器)
読み: こんすてぃちゅーしょなる・くらしふぁいやーず
最終更新: 2026-07-30・AI PICKS編集部
定義
Constitutional Classifiersとは、あらかじめ定めた「憲法」的ルールに沿って入出力を分類し、有害なプロンプトやジェイルブレイクを検知してブロックする防御用分類器のこと。
Constitutional Classifiers (憲法分類器)とは — 詳しく解説
Constitutional Classifiersは、モデルの入出力を「許容される/されない」の基準(憲法)に沿って学習した分類器でフィルタリングし、脱獄(ジェイルブレイク)プロンプトや有害生成を防ぐ仕組みとされる。入力側と出力側の双方に分類器を配置し、通常のリクエストは通しつつ攻撃パターンのみを検知するのが標準的な構成とされる。2026年時点の実運用では、誤検知(過剰ブロック)によって正当な利用まで弾かれるケースや、分類器自体の追加推論がレイテンシとコストを押し上げる点が課題として挙げられている。現場での選定では、既存のガードレールやモデレーションAPIとの重複を避け、自社のリスク許容度に応じて検知閾値を調整できるか、誤検知時のログ確認・チューニング体制を用意できるかが判断基準になるとされる。
Constitutional Classifiers (憲法分類器)の使用例
- 入力分類器: 明らかに有害な指示を含むプロンプトを検知し、モデルへの到達前にブロックする。
- 出力分類器: 生成された回答に有害情報が紛れていないかをリアルタイムで検査し遮断する。
Constitutional Classifiers (憲法分類器)に関連するAIツール
関連用語
「セキュリティ」の他の用語
ユーザー入力で AI の指示を上書きする攻撃。 「これまでの指示は無視して◯◯」 が典型例。
AI の安全制限を回避する手法。 ロールプレイや仮想シナリオで 禁止出力を引き出す。
ガードレールとは、AIシステムが有害・不適切・意図しない出力を生成しないよう制限するための安全制御機構のこと。
レッドチーミングとは、AIシステムの安全性・脆弱性を検証するため、攻撃者の視点から意図的に悪意ある入力やシナリオを試みる評価手法のこと。
シャドーAIとは、企業のIT部門や経営層の承認なしに従業員が個人的に業務で使うAIツール・サービスのこと。情報漏洩・規約違反・ガバナンス崩壊のリスクを内包する。
モデルポイズニングとは、AIモデルの学習データに悪意あるデータを混入させ、モデルの出力や判断を意図的に歪める攻撃手法のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・1213語以上を体系的に整理しています
辞典トップへ