時空間アテンション (Spatio-temporal Attention)
読み: じくうかんあてんしょん
最終更新: 2026-08-14・AI PICKS編集部
定義
時空間アテンションとは、動画生成AIが各フレーム内の空間的な特徴とフレーム間の時間的な変化を同時に捉える注意機構のこと。
時空間アテンション (Spatio-temporal Attention)とは — 詳しく解説
時空間アテンションは、Transformerのself-attention機構を動画データに拡張したもので、各フレーム内のピクセル間の関係(空間方向)と、フレームをまたいだ動きの連続性(時間方向)を同時にモデル化する仕組みとされる。CogVideoXやSoraなど主要な動画生成モデルの多くがこの機構を採用しているとされ、静止画の拡散モデルに時間軸の一貫性を持たせる鍵の一つとして扱われる。ただし計算コストは解像度とフレーム数に対して増大しやすく、長尺・高解像度になるほどVRAM消費と学習・推論コストが跳ね上がる点が実運用上の落とし穴になりやすい。2026年時点では、フルの時空間アテンションを毎フレーム計算するのではなく、空間方向と時間方向を分離して計算する分解型アテンションや、局所ウィンドウに限定した近似手法でコストを抑える設計が広く採用されている。現場でツールを選ぶ際は、生成できる動画の長さ・解像度の上限、シーンをまたいだ一貫性の崩れやすさ、API利用時の相場感(秒単価や月額クレジット制)を比較軸にすると失敗しにくい。
時空間アテンション (Spatio-temporal Attention)の使用例
- Soraなど大型動画生成モデルは、時空間アテンションでフレーム間の動きの一貫性を保っているとされる。
- プロンプト例:「歩く人物を10秒間、動きが自然に繋がる形で生成して」という指示は内部で時空間アテンション処理を経る。
時空間アテンション (Spatio-temporal Attention)に関連するAIツール
時空間アテンション (Spatio-temporal Attention)の関連記事
関連用語
「動画生成」の他の用語
OpenAI の動画生成 AI。 ChatGPT Pro で利用可能、 最大 20 秒の高品質動画を生成。
プロ向け AI 動画編集・生成スイート。 Gen-3 / Gen-4 で 映画品質の動画を生成。
VeoとはGoogle DeepMindが開発した動画生成AIモデルのこと。テキストプロンプトや静止画から高精細な動画を生成でき、物理的整合性と映像の時間的一貫性においてSoraと並ぶ業界最高水準を誇る。
Kling(可灵)とは、中国の快手(Kuaishou)が開発したAI動画生成モデルのこと。テキストや画像から最大2分・1080pの高品質動画を生成でき、SoraやRunwayと並ぶ有力な動画生成AIとして世界的に注目されている。
PikaとはテキストプロンプトやAI画像を入力するだけで3〜10秒の高品質な短尺動画クリップを自動生成できるAI動画生成プラットフォームのこと。
Luma Dream Machineとは、Luma AIが提供するテキストや画像から高品質な動画クリップを自動生成できるAIビデオ生成ツールのこと。物理的にリアルな映像と滑らかなカメラワークを特徴とする。
用語がわかったら、次はツール選び
12カテゴリ・1468語以上を体系的に整理しています