Исследования
Статистический тест показал различие там, где его нет: разбор типичной ошибки в A/A-тестах и бенчмарках LLM
Спекулятивное декодирование обещает ускорить языковую модель без изменения распределения ответов. Автор решил проверить это на практике и получил от статистического теста уверенный сигнал, что распределения различаются. Проблема оказалась не в модели и не в ускорении, а в самом тесте — он дал ложное срабатывание.
По одному выводу ошибку было не заметить: числа выглядели нормально. Статья разбирает, как статистический тест может показать различие там, где его нет, и как такую поломку отловить. Механика универсальна: та же проблема встречается в A/B-тестах, при проверке после квантизации модели и в регрессионных тестах, сравнивающих распределение времени ответа до и после релиза.
Источник: habr.com