AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

Google DeepMind、動画解析のコストを最大66%削減する新技術を発表

Google DeepMindによる動画解析コスト削減技術に関するプレスリリースの引用画像。

https://storage.googleapis.com/gweb-uniblog-publish-prod/images/agentic-video___keyword__blog-header.width-1300.png

Google DeepMindは2026年9月1日に、Geminiモデルにおける「Agentic Video Understanding(エージェンティック動画理解)」の提供を開始したと発表しました。この技術は、モデルが動画内の必要な箇所を自律的に探索・検査することで、解析精度を向上させつつコストを大幅に抑えるものです。

従来の解析手法との違い

従来の動画処理は、1秒間に1フレームといった固定のフレームレートで動画を読み込む「静的」な手法が主流でした。これに対し、新しいエージェンティック動画理解は、Geminiの推論能力と動画専用ツールを組み合わせることで、モデル自身が「何を、どの速度で、どの形式(映像、音声、文字起こし)で見るべきか」を判断します。これにより、動画内の特定の瞬間を動的に検索し、必要な信号のみを取得することが可能になりました。

向上した精度とコスト効率

Gemini 3.7 Flashを用いたベンチマークでは、従来の処理手法と比較して解析コストを最大66%、トークン消費量を最大88%削減することに成功しています。さらに、解析の精度も最大7%向上しました。この効率化は、10分程度のガイド動画から数時間に及ぶレクチャー動画まで、長尺の動画解析において特に顕著な効果を発揮します。

実現する高度な動画処理

この技術により、従来の固定フレームレートでは見逃されがちだった、コンマ数秒単位の瞬間的な変化の特定が可能になります。また、数時間にわたる動画の中から特定の情報を探し出す作業や、素早い動きの検知、物体や動作の正確なカウントといった、高度な動画解析タスクへの活用が期待されています。

利用可能なモデルと環境

本機能は、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteの各モデルで提供されます。Google AI StudioおよびGemini Enterprise Agent Platformを通じて、動画ファイルやYouTube動画に対して利用可能です。なお、追加の機能料金は発生せず、標準的なGemini APIのトークン料金が適用されます。

発表元: https://deepmind.google/blog/introducing-agentic-video-in-gemini/