OM-1 от Reward AI: робот учится только с рук человека — без джойстиков и пробных запусков
Reward AI, команда которой известна по проектам DexCap, HumanPlus и ALOHA, выпустила модель OM-1 (Omnibody Model 1). Это универсальный алгоритм управления манипуляциями, который обучается на движениях человека в специальной перчатке и затем запускается на промышленных роборуках и человекоподобных роботах на человеческой скорости. Принцип: «Одна модель, один интерфейс данных, любое тело». Ключевое отличие — в обучении не используются ни данные с телеоперации, ни собственные данные робота.
Разработчики считают, что человеческий уровень манипуляций не достигается простым накоплением большего объёма данных или вычислительных мощностей, ссылаясь на принцип Андерсона «Больше — это иное». Вместо этого сбор, обучение и управление спроектированы как единый конвейер: демонстрации, записанные сегодня, смогут обучать тела роботов, которые ещё не существуют.
Перчатка Omnibody Hand имеет семь степеней свободы и фиксирует важные функции: контактные точки, перемещение объекта в руке, смену точного и силового захвата. Эргономика рассматривается как проблема качества данных — неудобная перчатка даёт компенсированные движения. Датчики включают тактильные, сенсоры приближения и камеры. Система отслеживания использует электромагнитные датчики с компенсацией помех: на скорости 67 см/с средняя ошибка перелёта — 9,5 мм (против 24,9 мм у визуально-инерциального трекера), улучшение на 60%.
Модель OM-1 обучается в один этап, без разделения на предобучение и дообучение: все демонстрации, от первой до последней, идут в единый поток. Входные данные — мультимодальные потоки с перчатки, каждый в своём темпе (высокочастотные тактильные сигналы не подвергаются даунсемплингу). Выходные — направление, скорость, усилие и тайминг действий. Архитектура и количество параметров не раскрыты. Роботом управляет слой RL, работающий по собственному тактовому генератору. Веса, код, датасет и API не опубликованы — запустить на своём железе пока нельзя.