Кодовую модель научили рисовать акварели: эксперимент с TRL и OpenEnv
Команда Hugging Face опубликовала демонстрацию нестандартного применения библиотеки TRL (Transformer Reinforcement Learning) и среды OpenEnv. Они взяли кодовую модель — изначально предназначенную для генерации программного кода — и переобучили её на задачу рисования акварельных изображений. Для этого использовался пайплайн RL: модель генерирует изображение, а в качестве награды выступает оценка CLIP, сравнивающая результат с текстовым описанием желаемой акварели.
Эксперимент показывает гибкость инструментов Hugging Face: TRL позволяет применять методы подкрепления не только к языковым моделям, но и к любым генеративным задачам. OpenEnv предоставляет готовое окружение для взаимодействия агента с внешними сервисами (например, рендеринг изображений). Авторы подчеркивают, что это proof-of-concept, а не production-ready решение, но он демонстрирует потенциал crossover — использования кодовых моделей для творческих задач.
Код и описание эксперимента доступны на Hugging Face. Это ещё один шаг к универсальным моделям, способным решать как логические, так и креативные задачи без дополнительной архитектурной специализации.