AgenticFocus: пайплайн превращения любого FPV-видео в датасет для гуманоидных роботов
Развитие Physical AI упирается в нехватку обучающих данных. Если для VLM можно взять тексты из интернета, то VLA и world-action-модели кормить практически нечем. Создавать новые датасеты оказалось едва ли не сложнее, чем спроектировать самого робота.
При этом в открытом доступе есть огромное количество видео от первого лица, где люди руками делают что угодно — готовят, собирают, хватают. Но использовать их в сыром виде для обучения роботов пока невозможно. MWS разработала AgenticFocus — пайплайн, который превращает такие FPV-видео в полноценный датасет.
Ключевая идея — разделить видеоряд на несколько информационных слоёв: фон, объекты и кинематику конкретного робота. Это позволяет обучать гуманоидных роботов тонкой моторике на основе реальных человеческих действий.