Introducing agentic video understanding with Gemini

Gemini
GoogleがGeminiモデルのエージェンティック動画理解機能を発表。トークン消費を最大88%、コストを最大66%削減しつつ精度を向上。

概要

Googleは、最新のGeminiモデル(Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite)全体でエージェンティック動画理解機能を発表した。動画分析の精度、トークン効率、コストを大幅に改善する。固定フレームレートの従来型静的動画処理とは異なり、エージェンティック動画理解によりGeminiは目標指向型の能動的な役割で動画を分析できるようになる。モデルは内部ツールを用いて、視聴する内容、速度、モダリティ(フレーム、音声、文字起こし)を動的に判断し、最も関連する瞬間とシグナルのみを取得する。

Googleによると、この新アプローチにより、標準的な動画分析ベンチマークでトークン消費を最大88%削減、分析コストを最大66%削減、精度を最大7%向上させることが可能。これらの改善は、ハウツー動画、講義、複数時間の録画などの長時間コンテンツで特に顕著であり、従来は静的処理で開発者は高コストと詳細の欠落の間で選択を迫られていた。エージェンティック理解を搭載したGemini 3.7 Flashは、テスト対象モデル中最高の総合品質と最高の精度とコストのバランスを提供するとされている。

この機能は、サブ秒単位の瞬間検索による精密編集、長時間動画での「haystackの中のneedle」検索、動的リサンプリングによる異常検出、時間経過に伴うアクションやオブジェクトの正確なカウントなど、複数の新機能を実現する。早期アクセスパートナーから強いパフォーマンスが報告されている。この機能は現在、Google AI StudioおよびGemini Enterprise Agent PlatformのGemini APIで利用可能で、動画アップロードとYouTube動画の両方に対応する。開発者はAPIで処理パラメータを"agentic"に設定するだけで有効化できる。Googleはまた、今後数か月以内にGeminiアプリのFlashおよびFlash-Liteモデルユーザーにこの機能を展開し、YouTubeの「Ask YouTube」機能の駆動にも活用する予定である。

(出典:Gemini)