Gemini Flash научился «вырезать» лишнее из видео: до 88% меньше токенов, выше точность
Раньше Gemini при анализе видео обрабатывал каждый кадр с частотой 1 кадр в секунду, независимо от запроса: хоть «перескажи всю лекцию», хоть «когда докладчик переключил слайд с ценами?». Это приводило к перерасходу токенов и высокой стоимости. Новая функция agentic video understanding меняет подход: модель сама решает, какие фрагменты смотреть, с какой частотой кадров и через какой модаль (видео, аудио, транскрипт). По сути, Gemini запускает внутренний цикл с инструментами поиска и сканирования, загружая только то, что нужно для ответа.
Результаты впечатляют: до 88% меньше токенов, до 66% снижение стоимости и до 7% прирост точности на стандартных бенчмарках видеоанализа. Эффект особенно заметен на длинных видео — от 10-минутных гайдов до многочасовых записей. Gemini 3.7 Flash с agentic understanding выходит на Pareto-фронт точности и стоимости среди протестированных моделей.
Функция доступна только как hosted API — через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Открытых весов нет. Поддерживает загрузку файлов и публичные YouTube-ссылки. Тарификация — стандартная для Gemini API, без дополнительной платы за фичу. Разработчикам больше не нужно вручную собирать логику выбора кадров — модель делает это сама.