Волна ИИПодписаться
← Назад
Инструменты

NVIDIA выпустила Molt: компактный RL-фреймворк для агентов на 8,6K строк кода

02.08.2026 · marktechpost.com ↗

NVIDIA из команды NeMo выпустила Molt — фреймворк для агентного reinforcement learning, написанный на чистом PyTorch. Главная цель — радикально сократить объём кода, с которым приходится работать исследователю. Размер RL-части — 8,6K строк (для сравнения: у verl — 62K, у slime — 25K, у OpenRLHF — 7,2K). Molt распространяется под лицензией Apache 2.0, включает скрипты для Slurm и готовый контейнер.

Архитектура строится на трёх компонентах: Ray отвечает за размещение и асинхронные очереди, vLLM — за роллаут, NVIDIA AutoModel с FSDP2 — за обучение. Ни один из них не форкнут — обновления приходят через контейнер. Runtime — пул агентов, набор vLLM-движков за роутером запросов и один обучаемый policy-актор. Частичный роллаут приостанавливает движки, передаёт шарды актора через NCCL напрямую каждому движку и возобновляет запросы без сброса.

Агент — обычная Python-программа: RL-запуск указывает один модуль с AgentRunner. Поддерживаются два режима: Env (фреймворк владеет LLM-циклом через step() в стиле Gymnasium) и ChatAgent (пользователь владеет циклом через OpenAI или Anthropic SDK). Для второго запускается loopback-сервер, который говорит на обоих протоколах и автоматически уплотняет контекст при длинных горизонтах.

Три инварианта корректности: идентичность токенов (траектория строится по сэмплированным id, а не по ретокенизированному транскрипту), семантика policy-версии (логарифмические вероятности сохраняются за поведенческой политикой, асинхронность корректируется за токеном через sequence-level gate) и согласованность forward (роллаут и актор должны совпадать по семантике модели). Для MoE-политик последнее критично — Molt применяет rollout routing replay, где vLLM возвращает expert-ids, а обучение воспроизводит их при forward.

Источник: marktechpost.com
← Все новости AI Wave