Волна ИИПодписаться
← Назад
Исследования

Почему рекомендательные модели не воспроизводятся: ловушки подготовки данных

04.09.2026 · habr.com ↗

Многие команды, столкнувшись с невоспроизводимостью результатов, ищут баги в модели — архитектуре, функции потерь, сэмплировании. Однако опыт Sber AI Lab показывает, что ключевая причина кроется в подготовке данных.

Например, формулировка «датасет Zvuk, global temporal split с квантилем 0,9» не раскрывает, какие фильтры применялись, как обрабатывали повторные взаимодействия и одинаковые временные метки, удаляли ли холодные объекты. Из-за этого два пайплайна с одинаковым названием разбиения могут оценивать разные задачи.

Sber AI Lab разработала фреймворк SplitLight, который стандартизирует этапы подготовки данных и позволяет устранить расхождения. Это поможет точнее сравнивать модели и воспроизводить эксперименты.

Источник: habr.com
← Все новости AI Wave