AI PICKS
AI用語辞典 / カテゴリ

動画生成

Sora / Runway / Klingなど動画AI

72語を50音順で表示

Act-One (演技キャプチャ生成)

あくとわん

Act-One(演技キャプチャ生成)とは、俳優が演じた表情や視線の動きを一本の参照動画から解析し、生成AIキャラクターの演技としてそのまま転写する動画生成機能のこと。

イメージ・トゥ・ビデオ (画像から動画)

いめーじとぅびでお

イメージ・トゥ・ビデオとは、静止画像1枚を入力としてAIが連続フレームを自動生成し、動きのある動画クリップへ変換する生成AI技術のこと。

Veo

ヴェオ

VeoとはGoogle DeepMindが開発した動画生成AIモデルのこと。テキストプロンプトや静止画から高精細な動画を生成でき、物理的整合性と映像の時間的一貫性においてSoraと並ぶ業界最高水準を誇る。

AIアバター (AI Avatar)

えーあいあばたー

AIアバターとは、人物の顔・声・動作をAIが生成・合成し、実写さながらの仮想キャラクターや分身を映像として出力する技術のこと。

AI動画編集 (AI Video Editing)

えーあいどうがへんしゅう

AI動画編集とは、素材選定・カット割り・字幕生成・音声調整などの動画編集工程をAIが自動化する制作手法のこと。

AI VTuber (AIバーチャルタレント)

えーあいぶいちゅーばー

AI VTuberとは、音声合成・モーション生成・対話AIを組み合わせ、AIが自律的にキャラクターとして配信や動画を演じる仕組みのこと。

AIモーションキャプチャ (Markerless MoCap)

えーあいもーしょんきゃぷちゃー

AIモーションキャプチャとは、マーカーや専用スーツを使わず通常のカメラ映像から人体の骨格・動きをAIが解析し、3Dデータとして抽出する技術のこと。

AIロトスコープ (AI Rotoscoping)

えーあいろとすこーぷ

AIロトスコープとは、動画の各フレームからAIが被写体を自動抽出し、線画やアニメ風の表現に変換する技術のこと。

絵コンテから動画 (Storyboard-to-Video)

えこんてからどうが

絵コンテから動画(Storyboard-to-Video)とは、カット割りやカメラワークを描いた絵コンテをAIが解析し、連続した動画クリップへ自動変換する映像制作手法のこと。

LTX Video (エルテーエックス)

えるてぃーえっくすびでお

LTX Videoとは、Lightricksが開発したオープンソースの高速動画生成AIモデルのことで、軽量設計により一般的なGPUでも高速に動画を書き出せる点が特徴。

オプティカルフロー (Optical Flow)

おぷてぃかるふろー

オプティカルフローとは、動画の連続フレーム間で画素がどう移動したかを推定する技術のこと。動画生成AIの動き制御・補間・手ブレ補正の基盤技術として使われる。

音声同時生成動画 (Native Audio Video)

おんせいどうじせいせいどうが

音声同時生成動画とは、映像と音声(SE・BGM・ナレーション)をAIが一括して同時に生成する動画制作技術のこと。

開始終了フレーム指定 (First-Last Frame)

かいししゅうりょうふれーむしてい

開始終了フレーム指定とは、動画生成AIに始点と終点の2枚の静止画を与え、その間の動きを自動補間させる手法のこと。

カメオ出演 (Cameo / 実写差し込み)

かめおしゅつえん

カメオ出演とは、本人が撮影した顔・声の参照データをAI動画生成サービスに登録し、生成動画内に本人そっくりの映像を差し込める機能のことである。

カメラコントロール (Camera Control)

かめらこんとろーる

カメラコントロールとは、AI動画生成においてパン・ティルト・ズーム・ドリーなどのカメラワークをテキストプロンプトやGUIパラメータで指定・制御する機能のこと。

キーフレーム (Keyframe)

きーふれーむ

キーフレームとは、動画の特定時点における画像・ポーズ・スタイルを固定することで、AI動画生成の動きや構図を制御するための基準フレームのこと。

Google Flow (フロー)

ぐーぐるふろー

Google Flow(フロー)とは、Googleの動画生成AI「Veo」とImagen、Geminiを組み合わせ、キャラクターやシーンの一貫性を保ちながら短編映像を作れるAI動画制作ツールのこと。

Kling (可灵)

くりんぐ

Kling(可灵)とは、中国の快手(Kuaishou)が開発したAI動画生成モデルのこと。テキストや画像から最大2分・1080pの高品質動画を生成でき、SoraやRunwayと並ぶ有力な動画生成AIとして世界的に注目されている。

Grok Imagine (xAI動画生成)

ぐろっくいまじん

Grok Imagine とは、 xAI が Grok アプリに統合した動画生成 AI 機能のことで、 テキストや 1 枚の静止画から 数秒の短尺動画を自動生成するツールを指す。

CogVideoX (オープン動画生成)

こぐびでおえっくす

CogVideoXとは、清華大学系のZhipu AIが開発したオープンソースの動画生成AIモデルのことで、商用APIに頼らず自前でホスティングできる点が特徴。

HunyuanVideo (混元動画)

こんげんどうが

HunyuanVideo(混元動画)とは、Tencentが2024年12月に公開したオープンソースの動画生成AIモデルのこと。

参照動画生成 (Reference-to-Video)

さんしょうどうがせいせい

参照動画生成とは、既存の画像や動画をリファレンスとしてAIに与え、その構図・動き・スタイルを引き継いだ新しい動画を生成する技術のこと。

Seedance (ByteDance動画生成)

しーだんす

SeedanceとはByteDance(TikTok親会社)が開発した、テキストや画像から高品質な動画を生成するAIモデルのこと。

シームレスループ動画 (Seamless Loop)

しーむれするーぷどうが

シームレスループ動画とは、動画クリップの終端と始端をAIが違和感なく接続し、継ぎ目を感じさせず無限再生できるように生成した動画のことである。

自動字幕生成 (Auto Captioning)

じどうじまくせいせい

自動字幕生成とは、AIが動画や音声から発話内容を認識し、字幕(キャプション)をタイムコードと同期させて自動的に生成する技術のこと。

SkyReels (人物動画生成)

すかいりーるず

SkyReelsとは、静止画1枚と簡単な指示から、まばたきや表情変化まで含む自然な人物動画を生成できるAI動画生成モデルのこと。

Sora

そら

OpenAI の動画生成 AI。 ChatGPT Pro で利用可能、 最大 20 秒の高品質動画を生成。

縦型ショート動画生成 (Short-form Video)

たてがたしょーとどうがせいせい

縦型ショート動画生成とは、TikTokやReelsなどスマホ視聴に最適化した9:16の短尺動画をAIが自動生成する技術のこと。

長尺動画生成 (Long-form Video)

ちょうしゃどうがせいせい

長尺動画生成とは、AIを使って数分〜数十分規模の動画コンテンツを自動生成する技術のこと。脚本・ナレーション・映像合成を一気通貫で行い、従来の制作コストを大幅に削減できる。

DiT (拡散トランスフォーマー)

でぃーてぃー

DiT(拡散トランスフォーマー)とは、画像・動画生成モデルの内部構造でU-Netの代わりにTransformerを用いる拡散モデルのアーキテクチャのこと。

テキスト・トゥ・ビデオ (動画生成)

てきすととぅびでお

テキスト・トゥ・ビデオとはテキストプロンプトを入力するだけで動画を自動生成するAI技術のこと。文章から映像・音声・ナレーションまでを一括生成でき、動画制作を民主化する。

デジタルヒューマン (Digital Human)

でじたるひゅーまん

デジタルヒューマンとは、AIで人間そっくりの外見・表情・声を再現し、映像や対話で活用できるバーチャルキャラクターのこと。

テンポラル一貫性 (Temporal Consistency)

てんぽらるいっかんせい

テンポラル一貫性とは、AI動画生成において隣接するフレーム間で被写体・背景・照明などの視覚要素が矛盾なく保たれる性質のこと。

動画アップスケール (Video Upscaling)

どうがあっぷすけーる

動画アップスケールとは、低解像度や古い動画をAIが解析し、ディテールを補完しながら高解像度・高フレームレートに変換する映像処理技術のこと。

動画インペインティング (Video Inpainting)

どうがいんぺいんてぃんぐ

動画インペインティングとは、動画フレーム内の指定領域を前後フレームの情報をもとに時系列の整合性を保ちながら自動補完・修復するAI技術のこと。不要オブジェクト除去や映像修復に広く使われる。

動画延長 (Video Extension)

どうがえんちょう

動画延長とは、生成AIを使って既存の動画クリップの末尾を自然につなぎ、より長い映像を自動生成する技術のこと。

動画から3D (Video-to-3D)

どうがからさんでぃー

動画から3Dとは、単眼または複数視点の動画映像からAIが被写体や空間の奥行きを推定し、立体的な3Dモデルを自動生成する技術のこと。

動画から動画 (Video-to-Video)

どうがからどうが

動画から動画(Video-to-Video)とは、入力した動画の動きや構図を保ったまま、スタイルや画質、背景などをAIで別の映像に変換する動画生成技術のこと。

動画キャラクター一貫性 (Video Character Consistency)

どうがきゃらくたーいっかんせい

動画キャラクター一貫性とは、AI生成動画において同一キャラクターの顔・体型・服装などの見た目を、複数のシーンやカットをまたいで保持し続ける技術のこと。

動画スタイル変換 (Video Restyle)

どうがすたいるへんかん

動画スタイル変換(Video Restyle)とは、既存の動画のコンテンツ構造を保ちながら映像の見た目・画風・質感だけを別のスタイルに変換するAI技術のこと。

動画セグメンテーション (Video Segmentation)

どうがせぐめんてーしょん

動画セグメンテーションとは、動画の各フレームに写る人物・物体・背景をピクセル単位で識別し、領域ごとに分割する画像認識技術のことである。

動画トークナイザ (Video Tokenizer)

どうがとーくないざ

動画トークナイザとは、動画を時空間パッチや離散的なトークン列に変換し、生成AIモデルが扱える形式にする技術のこと。

動画背景差し替え (Video Background Replacement)

どうがはいけいさしかえ

動画背景差し替えとは、AIが動画内の被写体を自動検出し、背景だけを別の映像やCG空間に置き換える技術のこと。

動画フェイススワップ (Video Face Swap)

どうがふぇいすすわっぷ

動画フェイススワップとは、動画内の人物の顔を別人の顔に置き換えて自然に合成するAI技術のことである。

動画要約 (Video Summarization)

どうがようやく

動画要約とは、AIが動画の音声・字幕・映像内容を解析し、要点を短いテキストや短尺動画にまとめる技術のこと。

動画リフレーム (縦横比変換)

どうがりふれーむ

動画リフレームとは、元の動画から被写体を検出し、縦横比の異なる画面へ自動で構図を再構成する技術のこと。

動画リライティング (Video Relighting)

どうがりらいてぃんぐ

動画リライティングとは、撮影済み動画の照明・光源をAIで解析し直し、時間帯や光の向き・色温度を後から自在に変更する技術のこと。

トーキングヘッド動画 (Talking Head)

とーきんぐへっどどうが

トーキングヘッド動画とは、人物の顔・上半身を映したまま口が動いてしゃべっているように見せるAI生成動画のこと。

ニューラルレンダリング (Neural Rendering)

にゅーらるれんだりんぐ

ニューラルレンダリングとは、深層学習モデルで3D形状や光の反射・質感を学習し、写実的な画像や映像を生成するレンダリング手法のことである。

バーチャルプロダクション (Virtual Production)

ばーちゃるぷろだくしょん

バーチャルプロダクションとは、LEDウォール映像とゲームエンジンのリアルタイムCGを組み合わせ、撮影現場で背景合成まで完結させる映像制作手法のこと。

Hailuo (海螺AI)

はいるお

Hailuo(海螺AI)とは、中国のAIスタートアップMiniMaxが開発した、テキストや参照画像から高品質な動画を自動生成できるAI動画生成ツールのこと。

Pika

ぴか

PikaとはテキストプロンプトやAI画像を入力するだけで3〜10秒の高品質な短尺動画クリップを自動生成できるAI動画生成プラットフォームのこと。

PixVerse (ピックスバース)

ぴっくすばーす

PixVerse(ピックスバース)とは、テキストや静止画から数秒〜数十秒の短尺動画を自動生成できるAI動画生成サービスのこと。

Higgsfield (ヒッグスフィールド)

ひっぐすふぃーるど

Higgsfield(ヒッグスフィールド)とは、人物の自然な動作表現とシネマティックな映像品質に特化したAI動画生成サービスのこと。

Vidu (ヴィドゥ動画生成)

びどぅ

Vidu とは 中国 Shengshu 社が開発する AI 動画生成サービスのこと。 テキストや画像から数秒〜十数秒の動画を生成し、 キャラクターの一貫性維持に強みを持つ。

物理整合性 (Physical Plausibility)

ぶつりせいごうせい

物理整合性とは、AI生成動画や3Dモデルにおいて重力・慣性・衝突などの物理法則に沿った自然な動きが再現されているかを示す指標のこと。

プレイアブル世界モデル (Genie型)

ぷれいあぶるせかいもでる

プレイアブル世界モデル(Genie型)とは、1枚の画像や短いプロンプトから、キー操作などで探索できる仮想空間をリアルタイム生成するAI技術のこと。

FramePack (長尺動画生成)

ふれーむぱっく

FramePackとは、動画生成AIが長尺の動画を作る際に、過去フレームを圧縮して一定サイズの入力に収め、メモリを節約しながらフレーム数を延ばす手法のこと。

フレーム補間 (Frame Interpolation)

ふれーむほかん

フレーム補間とは、映像の既存フレーム間にAIが中間フレームを自動生成し、滑らかな動きや高フレームレートを実現する技術のこと。

HeyGen (ヘイジェン)

へいじぇん

HeyGenとはテキストや台本を入力するだけでAIアバターが登場する動画や多言語吹き替え動画を自動生成できる、企業・クリエイター向け動画制作SaaSのこと。

MAGI-1 (オープン動画生成)

まぎわん

MAGI-1とは、中国のSand AIが開発しオープンソース公開した自己回帰型の動画生成AIモデルのこと。

マルチショット生成 (Multi-shot Generation)

まるちしょっとせいせい

マルチショット生成とは、1回の生成プロセスで複数のカメラショット(場面転換)を含む動画を、キャラクターや背景の一貫性を保ちながら連続して出力する技術のこと。

モーション転送 (Motion Transfer)

もーしょんてんそう

モーション転送とは、ある動画や人物の動き情報を骨格推定で抽出し、別のキャラクターや映像に適用して同じ動きを再現するAI技術のこと。

モーションブラシ (Motion Brush)

もーしょんぶらし

モーションブラシとは、静止画の特定領域をブラシで塗ることで、その部分だけをAIが自動的にアニメーション化できる動画生成機能のこと。

モーションLoRA (Motion LoRA)

もーしょんろーら

モーションLoRAとは、動画生成AIの基盤モデルへの軽量な追加学習によって特定のカメラワークや被写体の動きを再現できるようにする技術のことである。

Mochi (モチ動画生成)

もち

Mochiとは、AIスタートアップGenmoが開発した、テキストから動画を生成するオープンソース系の動画生成AIモデルのこと。

Runway

らんうぇい

プロ向け AI 動画編集・生成スイート。 Gen-3 / Gen-4 で 映画品質の動画を生成。

リアルタイムアバター (Live Avatar)

りあるたいむあばたー

リアルタイムアバターとは、AIが人物の表情や口の動きを即座に生成し、配信や対話にその場で反映させる技術のこと。

リアルタイム動画生成 (Real-time Video)

りあるたいむどうがせいせい

リアルタイム動画生成とは、テキストや画像の入力に対してほぼ遅延なく動画コンテンツを生成するAI技術のこと。

リップシンク (Lip Sync)

りっぷしんく

リップシンクとは、動画内の人物の口の動きを音声や台詞と自動で同期させるAI技術のこと。

Luma Dream Machine

るまどりーむましん

Luma Dream Machineとは、Luma AIが提供するテキストや画像から高品質な動画クリップを自動生成できるAIビデオ生成ツールのこと。物理的にリアルな映像と滑らかなカメラワークを特徴とする。

Wan (通義万相)

わん (つうぎまんそう)

Wan (通義万相) とはアリババ(阿里巴巴)が開発したオープンソースの動画生成 AI モデルのこと。テキストや画像から高品質な短尺動画を生成できる。

他のカテゴリ

AI用語辞典のトップへ

全カテゴリ横断で検索・絞り込みができます

辞典トップへ