Волна ИИПодписаться
← Назад
Исследования

Один текст — разные оценки: разбор ошибки в тесте humanizer-ru

17.09.2026 · habr.com ↗

В ходе тестирования humanizer-ru выяснилось, что оценка «машинности» ответа может кардинально меняться при неизменном тексте. Например, фраза «Столица Австралии - Канберра» получила 0,95, а после удаления строк вокруг неё — 0,10. В другом случае разница в переводе строки в конце файла дала оценки 0,9 и 0,3.

Эти пары лежат в открытых данных проекта. Автор признаёт, что ранее на основе общей таблицы делал выводы о качестве редактирования, но теперь эта интерпретация отозвана. Он разбирает, что именно измерял на самом деле и как проверить результаты самостоятельно.

Проблема, судя по всему, в том, что оценка зависит не только от самого текста, но и от контекста — соседних строк, форматирования. Это ставит под сомнение надёжность метрики и требует пересмотра методологии тестирования.

Источник: habr.com
← Все новости AI Wave