Introducing agentic video understanding with Gemini
内容摘要
Google在最新的Gemini模型——Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite中推出了智能体视频理解功能(agentic video understanding),显著提升了视频分析的准确性、token效率和成本效益。与传统的固定帧率静态视频处理方式不同,智能体视频理解使Gemini能够以主动的、目标导向的方式分析视频。模型通过内部工具动态决定观看内容、观看速度以及使用哪种模态(画面、音频或转录文本),仅获取最相关的时刻和信号。
据Google介绍,这一新方法在标准视频分析基准测试中可将token消耗降低高达88%,分析成本降低高达66%,同时将准确性提升高达7%。这些改进在长视频内容(如教程、讲座和多小时录影)中尤为显著——传统静态处理方式下开发者不得不在高成本和丢失细节之间做出取舍。搭载智能体理解的Gemini 3.7 Flash在所测试模型中据说提供了最佳的整体质量以及最佳的准确性与成本平衡。
该功能解锁了多项新能力,包括用于精确编辑的亚秒级关键时刻检索、长视频中的大海捞针式搜索、通过动态重采样进行异常检测,以及对动作和对象随时间变化的准确计数。早期合作伙伴报告了强劲的性能表现。该功能现已在Google AI Studio和Gemini Enterprise Agent Platform的Gemini API中提供,支持视频上传和YouTube视频。开发者只需在API中将处理参数设置为"agentic"即可启用。Google还计划在未来几个月内将该功能推广至Gemini应用中Flash和Flash-Lite模型的用户,并驱动YouTube的"Ask YouTube"功能。
(来源:Gemini)