Исследования
Три проверки, обнулившие рейтинг эмбеддингов: как ошибается не модель, а измерение
В статье на Habr проанализировали 13 способов векторизации и составили аккуратную таблицу с победителем. Однако три последовательные проверки показали, что причина ложных выводов — не в алгоритмах, а в ошибках измерения.
Первая засада: подсунутая разметка, когда тестовые данные содержат неявные подсказки. Вторая: документы-близнецы — почти одинаковые тексты, которые сбивают метрики. Третья: метрика-шум — стандартные показатели оказались чувствительны к артефактам данных.
Каждая проверка обнуляла предыдущий рейтинг, заставляя пересматривать всю методологию сравнения. Автор подчёркивает: в задачах эмбеддингов чаще ошибается не модель, а то, как мы её оцениваем.
Источник: habr.com