Исследования
Своя GPT-like LLM по WH40K с нуля. Часть 4: Дообучение на вопрос–ответ (SFT)
Владимир продолжает цикл о написании и обучении собственной небольшой decoder-only LLM. В четвёртой части он целиком сосредоточился на этапе SFT (Supervised Fine-Tuning) — дообучении на датасете «вопрос-ответ». Цель — превратить модель из простого автодополнителя в полноценного собеседника, способного поддерживать диалог.
Статья носит практический характер и будет полезна тем, кто хочет разобраться в процессе SFT на реальном примере. Автор делится деталями реализации, включая подготовку датасета и настройку обучения, без лишней теории.
Источник: habr.com