AllenAI выложила готовый пайплайн пост-тренинга Tulu 3: SFT, DPO и GRPO для одного GPU с 16 ГБ
Разработчики AllenAI представили полный пайплайн дообучения компактной инструкционной модели, используя собственный фреймворк Open Instruct. В туториале последовательно разбираются три этапа: Supervised Fine-Tuning (SFT) на GSM8K, Direct Preference Optimization (DPO) и Reinforcement Learning with Verifiable Rewards через GRPO. Весь код заточен под окружение с 16 ГБ видеопамяти — вместо многоузловых стека DeepSpeed и vLLM используются лёгкие реализации на Hugging Face и PyTorch.
Вместо оригинальных распределённых компонентов (Ray, vLLM, DeepSpeed) авторы применили LoRA-адаптеры и упростили загрузку данных. Для оценки ответов на математические задачи используются детерминированные верификаторы. Все вспомогательные функции (dpo_loss, compute_grpo_loss, masked_mean) импортируются прямо из репозитория Open Instruct, но для совместимости с Colab исходные модули заменены на кастомные обёртки.
Туториал доступен с полным кодом на GitHub и рассчитан на инженеров, которые хотят повторить пост-тренинг AllenAI Tulu 3, но без доступа к большому кластеру. Пайплайн можно запускать прямо в Colab, что делает методику доступной для широкого круга разработчиков.