スパースオートエンコーダ (SAE)
読み: すぱーすおーとえんこーだ
最終更新: 2026-07-19・AI PICKS編集部
定義
スパースオートエンコーダ(SAE)とは、LLM内部の活性化ベクトルを疎な特徴量に分解し、人間が解釈可能な概念単位として取り出すニューラルネット手法のこと。
スパースオートエンコーダ (SAE)とは — 詳しく解説
スパースオートエンコーダ(SAE)は、Transformer内部の隠れ層activationを、多数のニューロンが混ざり合う「重ね合わせ」状態から疎(スパース)な基底へ再構成することで、単一の意味的特徴に対応する解釈可能な次元を取り出す教師なし学習手法とされる。Anthropicなどが2023年以降、大規模LLMの内部理解(メカニスティック解釈可能性)の主要な手法として採用してきたとされる。2026年時点の実運用では、SAEの学習自体に大きな計算コストがかかり、数十億パラメータ級のモデルでは専用GPUで数日〜数週間規模の学習が相場感とされる。現場でよく指摘される落とし穴として、抽出された「特徴」が単一の意味を持つとは限らず、複数の概念が依然として絡み合う「特徴分裂・結合」問題が残る点、辞書サイズ(潜在次元数)の選び方次第で解釈性と再構成精度がトレードオフになる点が挙げられる。実運用で導入する際は、対象モデル全体でなく特定の層に絞って部分適用し、小規模で検証してからスケールさせる進め方が現実的とされる。
スパースオートエンコーダ (SAE)の使用例
- SAEで抽出した特徴次元をダッシュボード化し、特定トピックへの反応が強い活性化パターンを可視化する
- ファインチューニング後にSAEの特徴分布を比較し、意図しない挙動変化がないか差分を確認する
スパースオートエンコーダ (SAE)に関連するAIツール
関連用語
「LLM / 言語モデル」の他の用語
Artificial Intelligence の略。人間の知能をコンピュータで再現する技術全般を指す。
Large Language Model の略。 膨大なテキストで学習した文章生成 AI。 ChatGPT / Claude / Gemini が代表例。
AI がそれっぽい嘘をつく現象。 学習データに無い情報を推測で生成してしまう。
AI が一度に扱える文章の長さ。 トークン数で表現される (例: Claude Opus 4.7 は 1M トークン)。
AI が扱う文字のかたまり。 日本語は 1 文字 ≒ 1 トークン、 英語は単語 ≒ 1 トークン。 料金計算の単位でもある。
文章・画像・音声・動画 を新規に作り出す AI 技術。 ChatGPT 以降の AI ブームの主役。
AI用語辞典をすべて見てみませんか
12カテゴリ・713語以上を体系的に整理しています
辞典トップへ