Волна ИИПодписаться
← Назад
Исследования

Как дообучить 350M модель для структурированных ответов всего за 100 шагов GRPO

03.09.2026 · huggingface.co ↗

Команда разработчиков опубликовала результаты эксперимента по дообучению 350-миллионной модели (350M) с использованием метода GRPO (Group Relative Policy Optimization). Всего за 100 шагов обучения модель научилась выдавать структурированные выходные данные в формате JSON, что обычно требует значительно больше ресурсов и времени.

Эксперимент показал, что даже небольшая модель может эффективно справляться с задачей генерации строгих форматов, если правильно настроить процесс обучения. Результаты приближаются к качеству работы моделей с миллиардами параметров, что открывает возможности для использования компактных решений в продакшене без потери точности.

Источник: huggingface.co
← Все новости AI Wave