Google Research представила AI-сорежиссёра: 4 агентных фреймворка для связных минутных видео
Google Research представила AI-сорежиссёра — набор из четырёх агентных фреймворков для генерации длинных видео. Система работает поверх Gemini и Veo, не привязана к конкретной модели и наследует водяные знаки SynthID. Она решает две ключевые проблемы: семантический дрейф (смена одежды или фона между кадрами) и каскадные сбои (один плохой кадр портит весь ролик).
Первый фреймворк, Co-Director (принят на COLM 2026), использует многорукого бандита для креативного планирования. Второй, CANVAS (принят на EMNLP 2026), хранит визуальную память персонажей и объектов. Третий, A²RD, генерирует видео сегмент за сегментом без дополнительного обучения. Четвёртый, VQQA, улучшает промпты через визуальные вопросы и ответы.
Google создала три новых бенчмарка: GenAD-Bench (400 рекламных сценариев), HardContinuityBench (сцены с повторными появлениями) и LVBench-C (120 сценариев с исчезновением объектов). Результаты: Co-Director набрал 81,4 балла на GenAD-Bench и 3,96 из 5 в оценках людей. CANVAS улучшил непрерывность фона на 21,6%, согласованность персонажей — на 9,6%. A²RD показал до 30% лучшей согласованности на видео от 1 до 10 минут.
Система сравнивается с StoryMem от ByteDance, MovieAgent и AutoStudio. В тесте с музейным ограблением CANVAS сохранил кепку вора и драгоценный камень, тогда как конкуренты их теряли. Google также поделилась 10-минутным фильмом, сгенерированным через A²RD.