Generalist AI выпустила GEN-1.5: робот учится новой задаче с одного 3–12-секундного показа
Generalist AI представила GEN-1.5 — фундаментальную модель для роботов, которая учится новой физической задаче с одного показа. Достаточно загрузить 3–12 секунд сенсомоторных данных в 30-секундное окно контекста — и робот выполняет задачу. Никаких градиентных шагов, дообучения или специального программирования не требуется.
На 10 разнообразных задачах манипуляции one-shot in-context prompting показал в среднем 59% успеха (±10% std. dev.) прямо из предобученной модели. Десять градиентных шагов на пяти минутах данных на задачу (примерно 50 демонстраций) подняли результат до 83% (±9%). В экстремальном случае один градиентный шаг на одной минуте данных дал 66,5% на новой задаче без подбора гиперпараметров.
Ключевая особенность — механизм physical prompting, который не закладывался разработчиками. Не было архитектурных изменений для поддержки обучения в контексте, не было цикла мета-обучения и вспомогательных функций. Способность возникла из масштаба претренировки, как one-shot prompting в GPT-3. Модель также показала композиционную генерализацию (соединение двух независимых демонстраций в одно поведение), zero-shot перенос из симуляции на реального робота и имитацию движений человека.
Пока GEN-1.5 — исследовательский релиз. Открытых весов, API и прайсинга нет. Модель работает на собственном флоте и дата-движке Generalist AI. Получить доступ можно только через прямое партнёрство.