Qwen обошла Claude в Code Arena WebDev, но победа может оказаться призрачной
Модель Qwen3.8-Max-0902 от Alibaba неожиданно возглавила общий зачёт Code Arena WebDev. На момент первого отчёта она набрала 1691 очко — на три больше, чем у Claude Opus 5 Max. Красивая цифра, которая мгновенно разлетелась по новостям, но при ближайшем рассмотрении всё не так однозначно.
В Code Arena рейтинг строится на голосовании пользователей, которые сравнивают ответы двух моделей вслепую. У Qwen на тот момент было в несколько раз меньше голосов, чем у конкурента, а её результат помечен как предварительный. Главное: доверительные интервалы двух моделей перекрываются — то есть статистически они могут быть равны. Пока автор разбирал методику, отрыв уже успел измениться.
Это не значит, что Qwen слабая — скорее, что спешить с выводами не стоит. Для смены рабочего инструмента одного такого «первого места» недостаточно, особенно если выборка маленькая. Автор не проводил собственного теста, а лишь разобрал открытую методику бенчмарка и документацию Alibaba.