Волна ИИПодписаться
← Назад
Инструменты

Как настроить LLM на предпочтения: аудит смещений и DPO с LoRA на примере Anthropic HH-RLHF

20.08.2026 · marktechpost.com ↗

В туториале разбирается end-to-end пайплайн preference learning на датасете Anthropic HH-RLHF. Сначала авторы готовят окружение, загружают пары «выбранный–отклонённый» ответ и проверяют датасет на структурные и длинновые смещения — например, нет ли систематического предпочтения более длинных ответов.

Затем проводится лексический shortcut-анализ: с помощью TF-IDF и логистической регрессии проверяется, можно ли разделить предпочтительные и нежелательные ответы только по поверхностным лингвистическим паттернам. После этого данные фильтруются по длине с учётом токенизатора, и строится пайплайн DPO-обучения с использованием библиотек TRL и опциональной LoRA-адаптации.

Финальный этап — тонкая настройка модели Qwen2.5-0.5B-Instruct, оценка точности награды (reward accuracy), анализ поведения на разных подмножествах HH-RLHF (helpful-base, helpful-rejection-sampled, helpful-online, harmless-base), проверка остаточного length bias и генерация примеров ответов. Полученная политика сохраняется для дальнейших экспериментов.

Код полностью открыт и воспроизводится в Colab — подходит для тех, кто хочет углубиться в практику alignment LLM с минимальными вычислительными затратами.

Источник: marktechpost.com
← Все новости AI Wave