Geminiの動画理解にagentic機能
- Geminiにagentic video understandingが加わりました。
- 動画分析のトークン消費を最大88%削減します。
- 追加の機能料金なしでGemini APIから使えます。

Google DeepMindは、Gemini向けのagentic video understandingを発表しました。対象モデルはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteです。動画分析の精度を高めながら、トークン使用量とコストを大きく抑える新機能です。
この機能は、固定フレームレートで動画を読み込む静的な処理とは異なります。Geminiが推論とネイティブ動画ツールを組み合わせ、必要な動画区間を動的に検索、スキャン、確認します。視覚フレーム、音声、文字起こしから必要な情報だけを取得します。
標準的な動画分析ベンチマークでは、agentic video understandingを使うGeminiモデルが分析コストを最大66%、トークン消費を最大88%削減し、精度を最大7%高めました。長尺動画では、静的処理で発生しやすい高いトークンコストや重要情報の取りこぼしを抑えます。
用途として、サブ秒単位の瞬間検索、長尺動画内の複雑な検索、異常検知、動作や物体のカウントが示されています。動画アップロードとYouTube動画に対応し、Google AI StudioとGemini Enterprise Agent PlatformのGemini APIから利用できます。標準のGemini APIトークン料金が適用され、追加の機能料金はありません。
長尺動画を分析する開発者や、動画検索、異常検知、カウント処理を扱うチームに関係します。




