GRPO: как дообучить локальную LLM рассуждать как DeepSeek без SFT
Модели вроде DeepSeek показали, что способность к последовательному рассуждению можно заметно улучшить на этапе дополнительного обучения. Если задача — получить похожее поведение от локальной LLM, один из вариантов — Group Relative Policy Optimization (GRPO).
В отличие от Supervised Fine-Tuning (SFT), где модель в основном учится воспроизводить шаблоны из обучающих примеров, GRPO использует обучение с подкреплением. Модель получает сигнал о качестве сгенерированных ответов и постепенно увеличивает вероятность более удачных вариантов.
GRPO тесно связан с современными подходами RLHF, но вместо оценки отдельного ответа сравнивает группы сгенерированных вариантов. Это позволяет эффективнее использовать сигнал вознаграждения и избегать переобучения под одну целевую метрику.
Во время такого обучения модель не просто запоминает правильные ответы, а учится выстраивать цепочки рассуждений, которые с большей вероятностью приводят к верному результату. Метод особенно полезен для задач, где важна логика и многошаговые выводы.