Тесты и бенчмарки
Алиса обогнала Qwen3-235B в 4 раза: бенчмарк VibePilot на реальных бизнес-задачах
Команда VibePilot запустила собственный бенчмарк для ИИ-агентов на реальных бизнес-задачах: составление смет, договоров и работа с многостраничными Excel-файлами. Всего 1 198 задач, из которых только 22 завершились сбоем — это 1,8% отказов.
Внутри жёсткого конвейера модель Алиса от Яндекса делает смету с разделами за 19 секунд и обгоняет Qwen3-235B в четыре раза. Результаты опровергают мнение, что суверенные модели слишком слабы для агентов: локальная Алиса показывает высокую скорость и надёжность.
Источник: habr.com