注意シンク (Attention Sink)
読み: ちゅういしんく
最終更新: 2026-08-06・AI PICKS編集部
定義
注意シンクとは、Transformerの自己注意機構において、意味的な関連性が薄いにもかかわらず特定のトークン(多くは先頭トークン)に注意重みが集中する現象のこと。
注意シンク (Attention Sink)とは — 詳しく解説
注意シンクは2023年にStreamingLLMの研究で報告された現象で、Transformer系LLMの自己注意機構において先頭付近の特定トークンが意味的重要性とは無関係に高い注意重みを受け続けることを指すとされる。これはsoftmaxの正規化特性上、注意を「捨てる先」が必要になるためと説明される。長文脈推論でKVキャッシュを削減する際、この注意シンクトークンだけを残せば古い文脈を破棄しても出力品質が大きく劣化しにくいことが知られており、StreamingLLMやそれに続く効率化手法の基盤になっている。2026年時点の実運用では、長文脈対応をうたうモデルやフレームワークの多くがこの性質を前提にKVキャッシュ圧縮を行っているため、独自にコンテキスト管理を実装する場合は注意シンクの扱いを誤るとコスト削減と引き換えに文脈追跡精度が落ちる落とし穴がある。現場でモデルやライブラリを選ぶ際は、長文脈での応答一貫性が実際に保たれるかをベンチマークで確認し、単純なトークン数の相場感だけで判断しないことが望ましいとされる。
注意シンク (Attention Sink)の使用例
- 長文脈チャットボットの設計時に「先頭トークンを常にKVキャッシュへ残す」設定は、注意シンクを保持するための典型的な対策とされる。
- 「なぜLLMは会話の最初の発言に妙に注意を向け続けるのか」という疑問への説明として、注意シンクの存在が挙げられることが多い。
注意シンク (Attention Sink)に関連するAIツール
注意シンク (Attention Sink)の関連記事
関連用語
「LLM / 言語モデル」の他の用語
Artificial Intelligence の略。人間の知能をコンピュータで再現する技術全般を指す。
Large Language Model の略。 膨大なテキストで学習した文章生成 AI。 ChatGPT / Claude / Gemini が代表例。
AI がそれっぽい嘘をつく現象。 学習データに無い情報を推測で生成してしまう。
AI が一度に扱える文章の長さ。 トークン数で表現される (例: Claude Opus 4.7 は 1M トークン)。
AI が扱う文字のかたまり。 日本語は 1 文字 ≒ 1 トークン、 英語は単語 ≒ 1 トークン。 料金計算の単位でもある。
文章・画像・音声・動画 を新規に作り出す AI 技術。 ChatGPT 以降の AI ブームの主役。
用語がわかったら、次はツール選び
12カテゴリ・1355語以上を体系的に整理しています