Moonshot AI открыла AgentENV: «движок» для RL-тренировки агентов с Firecracker-микроVM под капотом
Moonshot AI и kvcache-ai открыли код платформы AgentENV (AENV) под лицензией MIT. Это распределённая инфраструктура для запуска агентных сред в масштабе, предназначенная для тренировки агентов через reinforcement learning (RL). Именно на AENV обучали Kimi K3 — 2,8-триллионную Mixture-of-Experts модель.
Ключевая проблема агентного RL — среда исполнения. Модель должна действовать в реальной компьютерной системе: с файловой системой, сетевым стеком и живыми процессами. Контейнеры быстры, но слабо изолированы. Полные виртуальные машины — наоборот, но медленно стартуют и держат память в простое. AENV использует Firecracker microVM: каждая «песочница» получает собственное ядро Linux, файловую систему и сетевой неймспейс.
Архитектура включает Axum HTTP API, оркестратор, ublk-блочное устройство на overlaybd-образах (общие read-only слои и верхний слой для записи), демон envd внутри гостя и реверс-прокси для HTTP/WebSocket. Управление памятью — через общий page cache и memory ballooning, что позволяет удерживать overcommit по мере расхождения сред.
Проект адресует конкретный инженерный gap: запуск, перезапуск и ветвление microVM становятся дешёвыми на тренировочных масштабах. Код уже доступен на GitHub. Это не готовая платформа для всех, но мощный референс для тех, кто строит свою инфраструктуру агентного RL.