Алиса vs Гигачат: независимое тестирование по пяти бенчмаркам — результаты
Автор потратил около двух недель на настройку и прогон тестов. Алиса тестировалась через веб-интерфейс — так, как с ней общаются обычные пользователи. В 90% случаев модель оправдывалась повышенной нагрузкой и переключалась на упрощённую версию. Гигачат (версии Ультра и Макс) гоняли через API — для этого пришлось использовать три аккаунта, так как бесплатных токенов не хватило.
В бенчмарки вошли τ³, ПРАКТ-120, MultiChallenge, WildBench и Arena-Hard. Результаты показывают, как модели справляются с разными типами задач — от рассуждений до мультишаговых сценариев. Автор отмечает, что создатели моделей могли бы сами включить такие тесты в цикл разработки, чтобы понимать реальное положение относительно мировых лидеров.
Маракуйя ИИ не участвовала в сравнении — команда ушла в глубокий рефакторинг и готовит аналог Cursor, Claude Code и Codex, полностью суверенный и без привязки к иностранным платёжным системам.