動画セグメンテーション (Video Segmentation)
読み: どうがせぐめんてーしょん
最終更新: 2026-07-19・AI PICKS編集部
定義
動画セグメンテーションとは、動画の各フレームに写る人物・物体・背景をピクセル単位で識別し、領域ごとに分割する画像認識技術のことである。
動画セグメンテーション (Video Segmentation)とは — 詳しく解説
動画セグメンテーションは、フレームごとにオブジェクトや背景をピクセル単位で分離する技術で、SAM(Segment Anything Model)系のモデルが動画向けに拡張されたことで、フレーム間の一貫性を保った追跡が可能になったとされる。背景除去、ロトスコープ、オブジェクトの差し替えといった動画編集の自動化に広く使われている。2026年時点の実運用では、動きの速いシーンや遮蔽(オクルージョン)が多い映像で境界がぶれる、いわゆる「フリッカー」が起きやすい点が現場での課題として挙げられる。高解像度・長尺の動画ほど処理コストが跳ね上がるため、用途に応じて解像度を落とす、区間を絞って処理するといった工夫が必要とされる。導入時はモデル単体の精度だけでなく、動画編集ソフトやワークフローへの統合のしやすさ、処理時間とコストのバランスで選ぶのが現場での基本的な考え方とされる。
動画セグメンテーション (Video Segmentation)の使用例
- 動画編集ソフトで人物だけを切り抜き、背景を差し替える処理
- SAMを応用したモデルで動画内の特定オブジェクトをフレーム全体で追跡・抽出する処理
動画セグメンテーション (Video Segmentation)に関連するAIツール
関連用語
「動画生成」の他の用語
OpenAI の動画生成 AI。 ChatGPT Pro で利用可能、 最大 20 秒の高品質動画を生成。
プロ向け AI 動画編集・生成スイート。 Gen-3 / Gen-4 で 映画品質の動画を生成。
VeoとはGoogle DeepMindが開発した動画生成AIモデルのこと。テキストプロンプトや静止画から高精細な動画を生成でき、物理的整合性と映像の時間的一貫性においてSoraと並ぶ業界最高水準を誇る。
Kling(可灵)とは、中国の快手(Kuaishou)が開発したAI動画生成モデルのこと。テキストや画像から最大2分・1080pの高品質動画を生成でき、SoraやRunwayと並ぶ有力な動画生成AIとして世界的に注目されている。
PikaとはテキストプロンプトやAI画像を入力するだけで3〜10秒の高品質な短尺動画クリップを自動生成できるAI動画生成プラットフォームのこと。
Luma Dream Machineとは、Luma AIが提供するテキストや画像から高品質な動画クリップを自動生成できるAIビデオ生成ツールのこと。物理的にリアルな映像と滑らかなカメラワークを特徴とする。
AI用語辞典をすべて見てみませんか
12カテゴリ・713語以上を体系的に整理しています
辞典トップへ