Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Алиса обогнала Qwen3-235B в 4 раза: бенчмарк VibePilot на реальных бизнес-задачах

10.09.2026 · habr.com ↗

Команда VibePilot запустила собственный бенчмарк для ИИ-агентов на реальных бизнес-задачах: составление смет, договоров и работа с многостраничными Excel-файлами. Всего 1 198 задач, из которых только 22 завершились сбоем — это 1,8% отказов.

Внутри жёсткого конвейера модель Алиса от Яндекса делает смету с разделами за 19 секунд и обгоняет Qwen3-235B в четыре раза. Результаты опровергают мнение, что суверенные модели слишком слабы для агентов: локальная Алиса показывает высокую скорость и надёжность.

Источник: habr.com
← Все новости AI Wave