Волна ИИПодписаться
← Назад
Исследования

GRPO: как дообучить локальную LLM рассуждать как DeepSeek без SFT

16.09.2026 · habr.com ↗

Модели вроде DeepSeek показали, что способность к последовательному рассуждению можно заметно улучшить на этапе дополнительного обучения. Если задача — получить похожее поведение от локальной LLM, один из вариантов — Group Relative Policy Optimization (GRPO).

В отличие от Supervised Fine-Tuning (SFT), где модель в основном учится воспроизводить шаблоны из обучающих примеров, GRPO использует обучение с подкреплением. Модель получает сигнал о качестве сгенерированных ответов и постепенно увеличивает вероятность более удачных вариантов.

GRPO тесно связан с современными подходами RLHF, но вместо оценки отдельного ответа сравнивает группы сгенерированных вариантов. Это позволяет эффективнее использовать сигнал вознаграждения и избегать переобучения под одну целевую метрику.

Во время такого обучения модель не просто запоминает правильные ответы, а учится выстраивать цепочки рассуждений, которые с большей вероятностью приводят к верному результату. Метод особенно полезен для задач, где важна логика и многошаговые выводы.

Источник: habr.com
← Все новости AI Wave