空間知能 (3D空間理解)
読み: くうかんちのう
最終更新: 2026-08-06・AI PICKS編集部
定義
空間知能とは、AIが2D画像や映像から物体の奥行き・配置・物理的な関係性を3Dとして理解し、動きや変化を予測する能力のこと。
空間知能 (3D空間理解)とは — 詳しく解説
空間知能とは、生成AIが平面的な画像・動画データから、物体同士の奥行き・大きさ・配置関係、さらには重力や衝突といった物理法則を推論し、時間軸上での変化を予測・生成する能力を指す。従来の動画生成モデルが「見た目のもっともらしさ」を優先していたのに対し、空間知能を備えたモデルは物体の一貫性(フレームをまたいでも形状や位置関係が崩れない)を重視する点が業界標準の定義とされる。2026年時点の実運用では、長尺・複数カット動画で背景や小物の位置がフレームごとに微妙にズレる、いわゆる時空間的な不整合が依然として発生しやすく、現場では生成後の目視チェック工程を省略できないのが実態とされる。コスト面では空間知能対応モデルは通常の動画生成より計算負荷が高く、生成単価・処理時間ともに割高になる傾向があるため、相場感を把握したうえで「短尺の広告カットには軽量モデル、長尺のプロダクト紹介には空間知能対応モデル」といった使い分けが現場での選び方として広がっている。
空間知能 (3D空間理解)の使用例
- 「机の上のコップを倒さずにペンだけ動かして」のように物理的な制約を守った動画生成を指示する
- 複数カットにまたがるプロダクト紹介動画で、背景の家具位置を一貫させたまま撮影角度を変える
空間知能 (3D空間理解)に関連するAIツール
空間知能 (3D空間理解)の関連記事
関連用語
「動画生成」の他の用語
OpenAI の動画生成 AI。 ChatGPT Pro で利用可能、 最大 20 秒の高品質動画を生成。
プロ向け AI 動画編集・生成スイート。 Gen-3 / Gen-4 で 映画品質の動画を生成。
VeoとはGoogle DeepMindが開発した動画生成AIモデルのこと。テキストプロンプトや静止画から高精細な動画を生成でき、物理的整合性と映像の時間的一貫性においてSoraと並ぶ業界最高水準を誇る。
Kling(可灵)とは、中国の快手(Kuaishou)が開発したAI動画生成モデルのこと。テキストや画像から最大2分・1080pの高品質動画を生成でき、SoraやRunwayと並ぶ有力な動画生成AIとして世界的に注目されている。
PikaとはテキストプロンプトやAI画像を入力するだけで3〜10秒の高品質な短尺動画クリップを自動生成できるAI動画生成プラットフォームのこと。
Luma Dream Machineとは、Luma AIが提供するテキストや画像から高品質な動画クリップを自動生成できるAIビデオ生成ツールのこと。物理的にリアルな映像と滑らかなカメラワークを特徴とする。
用語がわかったら、次はツール選び
12カテゴリ・1363語以上を体系的に整理しています