Introducing agentic video understanding with Gemini

Gemini
Google lanza la comprensión agentic de video para los modelos Gemini, reduciendo el consumo de tokens hasta un 88% y los costos hasta un 66%.

Resumen

Google ha lanzado la comprensión agentic de video en sus últimos modelos Gemini: Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite, logrando mejoras significativas en precisión, eficiencia de tokens y costo para el análisis de video. A diferencia del procesamiento estático tradicional, que ingiere el metraje a una tasa fija de fotogramas por segundo, la comprensión agentic de video permite a Gemini asumir un rol activo y orientado a objetivos al analizar video. El modelo decide dinámicamente qué ver, a qué velocidad y a través de qué modalidad (fotogramas, audio o transcripción), utilizando una herramienta interna para obtener solo los momentos y señales más relevantes.

Según Google, el nuevo enfoque reduce el consumo de tokens hasta un 88%, disminuye los costos de análisis hasta un 66% y mejora la precisión hasta un 7% en los benchmarks estándar de análisis de video. Estas mejoras son especialmente notables en contenido de larga duración, como guías prácticas, conferencias y grabaciones de varias horas, donde el procesamiento estático tradicionalmente obligaba a los desarrolladores a elegir entre altos costos y pérdida de detalles. Se informa que Gemini 3.7 Flash con comprensión agentic ofrece la mejor calidad general y el mejor equilibrio entre precisión y costo entre los modelos probados.

La función habilita varias capacidades nuevas, incluida la recuperación de momentos por debajo del segundo para edición precisa, búsqueda de aguja en un pajar en videos largos, detección de anomalías mediante remuestreo dinámico y conteo preciso de acciones y objetos a lo largo del tiempo. Los socios de acceso anticipado informaron un rendimiento sólido. La función ya está disponible a través de la API de Gemini en Google AI Studio y en la plataforma Gemini Enterprise Agent Platform para cargas de video y videos de YouTube. Los desarrolladores pueden habilitarla simplemente configurando el parámetro de procesamiento en "agentic". Google también planea implementar la función para los usuarios de la app Gemini en los modelos Flash y Flash-Lite, y potenciar la función "Ask YouTube" de YouTube en los próximos meses.

(Fuente:Gemini)