定義
Video-MMEとは、マルチモーダルAIモデルの動画理解能力を、短尺から長尺までの多様な動画と質問応答セットで測定するベンチマークのこと。
Video-MME (動画理解ベンチ)とは(詳しく解説)
Video-MMEは、数十秒の短尺クリップから1時間超の長尺動画までを対象に、字幕・音声・映像フレームを組み合わせたマルチモーダル質問応答で構成される動画理解ベンチマークで、GPT-4oやGemini、Qwen-VLなど主要なマルチモーダルLLMの動画理解精度を横並びで比較する用途で広く採用されているとされる。ただし2026年時点の実運用では、ベンチマークスコアが高いモデルでも長尺動画になるとフレームサンプリングの粗さから重要な場面を取りこぼし、現場での要約精度や検索精度がスコアほど伸びないという落とし穴が指摘されている。また動画1本あたりのフレーム抽出・音声書き起こし・推論にかかるトークン量が画像単体や短文入力に比べて大きく膨らみやすく、コスト面では相場感が数倍〜数十倍になるケースもあるとされる。そのため現場で動画理解モデルを選定する際は、ベンチマーク順位だけでなく、実際に扱う動画の長さやフレームレートに近い条件で自社データによる実測検証を行うことが推奨されている。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「Video-MME (動画理解ベンチ)とは」 https://aipicks.jp/glossary/video-mme
Video-MME (動画理解ベンチ)の使用例
- 長尺の会議録画をVideo-MME形式のQAで評価し、要約AIが重要な決定事項を拾えているか検証する。
- 動画検索機能に使うLLMを選ぶ際、Video-MMEのスコアと自社動画データでの実測精度を突き合わせて比較する。