Один текст — разные оценки: разбор ошибки в тесте humanizer-ru
В ходе тестирования humanizer-ru выяснилось, что оценка «машинности» ответа может кардинально меняться при неизменном тексте. Например, фраза «Столица Австралии - Канберра» получила 0,95, а после удаления строк вокруг неё — 0,10. В другом случае разница в переводе строки в конце файла дала оценки 0,9 и 0,3.
Эти пары лежат в открытых данных проекта. Автор признаёт, что ранее на основе общей таблицы делал выводы о качестве редактирования, но теперь эта интерпретация отозвана. Он разбирает, что именно измерял на самом деле и как проверить результаты самостоятельно.
Проблема, судя по всему, в том, что оценка зависит не только от самого текста, но и от контекста — соседних строк, форматирования. Это ставит под сомнение надёжность метрики и требует пересмотра методологии тестирования.