Бывший сотрудник Google DeepMind запустил стартап с человекоподобными роботами, которые учатся действовать в незнакомой обстановке через «миры-модели»
Данижар Хафнер, 31-летний ветеран Google Brain и DeepMind, открыл стартап в стелс-режиме. В его офисе в Со-Ма почти нет мебели, зато полно человекоподобных роботов из Китая. Задача — научить их действовать в сценариях, которых не было в обучении: например, заходить в незнакомую квартиру и ориентироваться по новой планировке.
В основе подхода — model-based reinforcement learning. Хафнер строит «миры-модели» — симуляции физической реальности, внутри которых агент учится действовать методом проб. Затем он использует накопленный опыт, чтобы предсказывать (или, как говорит сам Хафнер, «воображать») исходы в реальном мире. Это позволяет обойтись без традиционного обучения на реальных ошибках, которое требует тысяч попыток.
Предыдущие проекты Хафнера — PlaNet, Dreamer 2, Dreamer 3, Dreamer 4 — уже доказали эффективность подхода. Dreamer 2 первым среди агентов на world models достиг человеческого уровня в Atari 2600, Dreamer 3 сам добыл алмазы в Minecraft, а Dreamer 4 сделал то же, но глядя на видеозаписи игры, без прямого взаимодействия. Теперь он запустил проект DayDreamer, переносящий агентов в физические тела.
Хафнер учился программированию у соседа в немецкой деревне, а в 2015 году, будучи второкурсником, попал в Google Brain. Работал с Джеффри Хинтоном и Ашвишем Васвани (соавтором «Attention Is All You Need»). Его бывший руководитель Тимоти Лилликрап говорит, что Хафнер в одиночку делал то, на что у других уходили команды инженеров.