Исследования
Как дообучить 350M модель для структурированных ответов всего за 100 шагов GRPO
Команда разработчиков опубликовала результаты эксперимента по дообучению 350-миллионной модели (350M) с использованием метода GRPO (Group Relative Policy Optimization). Всего за 100 шагов обучения модель научилась выдавать структурированные выходные данные в формате JSON, что обычно требует значительно больше ресурсов и времени.
Эксперимент показал, что даже небольшая модель может эффективно справляться с задачей генерации строгих форматов, если правильно настроить процесс обучения. Результаты приближаются к качеству работы моделей с миллиардами параметров, что открывает возможности для использования компактных решений в продакшене без потери точности.
Источник: huggingface.co