CUA-Lite: открытая платформа от UC Berkeley объединяет песочницы, данные и обучение для компьютерных агентов
Проблема компьютерных агентов (CUA) — инфраструктурная: для их обучения и бенчмаркинга нужны агенты, окружения, трейсы и фреймворк, но всё это разбросано по разным репозиториям с несовместимыми интерфейсами. CUA-Lite решает это, объединяя всё за одним action space, одной схемой данных и одной командой — для десктопа, браузера и мобильных устройств. Стек ставится одной командой uv sync --all-extras на Python 3.12, а лёгкие песочницы работают на любом Docker-хосте без /dev/kvm, включая облачные инстансы и CI-раннеры.
Главный вклад — Lite.OSWorld. Оригинальный OSWorld использует полноценную QEMU/KVM-виртуалку на каждую задачу, что требует вложенной виртуализации, недоступной в большинстве managed-инфраструктур. CUA-Lite воспроизводит тот же набор задач и те же evaluator'ы на GNOME-десктопе внутри обычного Docker-контейнера. Результат: память снижена с 4,1 ГБ до 0,9 ГБ, холодный старт — с 29,9 с до 23,8 с, а параллельно можно запустить в ~4,6 раза больше инстансов. При этом на 13 моделях оценки Lite.OSWorld совпадают с VM-версией, так что результаты переносимы. Платформа также включает Lite.ScaleCUA, Lite.CUAGym и Lite.CUAWorld (около 40 приложений, включая Blender, QGIS и VS Code) — всего более 30 000 верифицируемых задач.
Второй слой — LiteSample: единая supervised-learning-схема для всех окружений, агентов и типов задач, опубликованная как parquet + изображения. Более десяти существующих CUA-датасетов (Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey, Multimodal-Mind2Web и другие) уже предобработаны в этот формат и выложены на Hugging Face. Также сгенерированы свежие rollout-датасеты с помощью frontier-модели для дистилляции в меньшие студенты. Для каждой семейства моделей есть адаптер, упаковывающий LiteSample в нужный формат, включая collapse истории для одного forward pass на несколько шагов.
Агенты и окружения встречаются в lite.gym: скриншоты на вход, действия на выход, единое action space на платформу. Встроено 10+ агентов (GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI и другие) и 15+ бенчмарков (ScreenSpot-Pro, OSWorld-G, OSWorld, OSWorld-2, WindowsAgentArena, CUABench, WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym, AndroidWorld, AndroidLab, MobileWorld, MobileGym). Переключение между моделями и окружениями — смена --model-id и --env-id в scripts/rollout.py. Для SFT задокументирована тонкая настройка Qwen3-VL-2B-Instruct на Lite.ScaleCUA: mean episode return вырос с 0,138 до 0,237 на 332 задачах lite.osworld (одна конфигурация на двух GPU, не независимое воспроизведение). Для RL — GRPO-обновления поверх Slime с примером MobileGym на 416 мобильных задач в 28 приложениях.