Dyna-2: модель робота, обученная на 1 млн часов видео людей, показала scaling law
Dyna Robotics выпустила Dyna-2 — world-action модель (WAM) для манипуляций роботов. Она предобучена на более чем 1 млн часов эгоцентричного видео человека (примерно 170 лет непрерывного опыта). Идея в том, чтобы заменить дорогую телеметрию с разметкой действий обычным человеческим видео — и проверить, масштабируется ли обучение на таких данных.
Команда построила «лестницу данных» от 1 000 до 1 000 000 часов и измерила три результата: scaling law на человеческих данных, перенос этого закона на невиданные ранее данные роботов и доказательство, что предсказание видео управляет переносом. Модель использует смесь трансформеров: видео и действия токенизируются отдельно, с разными стеками DiT, которые взаимодействуют друг с другом.
Scaling law подтвердился: все четыре метрики монотонно улучшаются по степенному закону. Например, accuracy@0.1 выросла на 51% при увеличении данных. Закон переносится на роботов zero-shot — на 39 задачах с двумя платформами YAM. Совместное шумоподавление видео и действий превзошло подход только с действиями на всех 39 задачах. Добавление видео-часов при фиксированных 50 000 часах с действиями снизило MSE робота с 0.340 до 0.120.
Развёртывание Dyna-2 возможно только как vendor-operated система — через покупку робочей ячейки Dyna. Публичного чекпоинта, API или лицензии нет. Роботы Dyna-1 уже работают в отелях, ресторанах и прачечных. Модель нацелена на mid-market сервисных операторов с повторяющимися стационарными задачами: уборка подносов, комплектация аптечек, зачерпывание еды, завязывание верёвок и т.д.