Google DeepMindは2026年9月1日に、Geminiモデルにおける「Agentic Video Understanding(エージェンティック動画理解)」の提供を開始したと発表しました。この技術は、モデルが動画内の必要な箇所を自律的に探索・検査することで、解析精度を向上させつつコストを大幅に抑えるものです。
従来の解析手法との違い
従来の動画処理は、1秒間に1フレームといった固定のフレームレートで動画を読み込む「静的」な手法が主流でした。これに対し、新しいエージェンティック動画理解は、Geminiの推論能力と動画専用ツールを組み合わせることで、モデル自身が「何を、どの速度で、どの形式(映像、音声、文字起こし)で見るべきか」を判断します。これにより、動画内の特定の瞬間を動的に検索し、必要な信号のみを取得することが可能になりました。
向上した精度とコスト効率
Gemini 3.7 Flashを用いたベンチマークでは、従来の処理手法と比較して解析コストを最大66%、トークン消費量を最大88%削減することに成功しています。さらに、解析の精度も最大7%向上しました。この効率化は、10分程度のガイド動画から数時間に及ぶレクチャー動画まで、長尺の動画解析において特に顕著な効果を発揮します。
実現する高度な動画処理
この技術により、従来の固定フレームレートでは見逃されがちだった、コンマ数秒単位の瞬間的な変化の特定が可能になります。また、数時間にわたる動画の中から特定の情報を探し出す作業や、素早い動きの検知、物体や動作の正確なカウントといった、高度な動画解析タスクへの活用が期待されています。
利用可能なモデルと環境
本機能は、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteの各モデルで提供されます。Google AI StudioおよびGemini Enterprise Agent Platformを通じて、動画ファイルやYouTube動画に対して利用可能です。なお、追加の機能料金は発生せず、標準的なGemini APIのトークン料金が適用されます。
