Модели и агенты
Gemini научился «смотреть» и анализировать видео как агент: анонс от DeepMind
Google DeepMind официально запустил agentic video understanding на базе Gemini. Это не простая классификация — модель способна отслеживать динамику сцены, распознавать объекты и действия, а затем инициировать ответные шаги без дополнительной команды. Фактически Gemini получает «зрение» и способность действовать как агент в реальном видеопотоке.
Технология открывает новые сценарии: от автоматизации мониторинга производства и складской логистики до ассистентов, которые понимают происходящее на экране или вокруг пользователя. DeepMind подчеркивает, что video understanding — шаг к более глубокому мультимодальному взаимодействию, когда ИИ не просто «видит», а понимает контекст и может на него влиять.
Источник: deepmind.google