Волна ИИПодписаться
← Назад
Тесты и бенчмарки

GigaChat 2 Max и YandexGPT Pro 5.1 обошли Claude Opus 5 в тесте на поиск причин изменений — 57% и 61% против 41%

24.08.2026 · habr.com ↗

На Habr опубликовали замер семи моделей на специфическом классе задач: нужно определить, какое из прошлых изменений в коде или конфигурации уже решало возникшую проблему. GigaChat 2 Max (с памятью на связях) дал верный ответ в 57% случаев, YandexGPT Pro 5.1 — в 61%, а Claude Opus 5 с обычным поиском — только в 41%. Модели не дообучали — разница исключительно в том, доехал ли до модели нужный контекст.

Автор статьи подчёркивает, что память на связях (memory on connections) позволяет модели не просто искать факты, а выстраивать причинно-следственные цепочки между изменениями. Без такого механизма даже сильная модель вроде Claude Opus 5 теряется, если релевантная информация не попадает в окно контекста в нужной форме.

В материале приведены подробные результаты, рассуждения о применимости подхода и ссылки на проверочные данные. Тест показывает, что в задачах, где важна трассировка изменений, архитектура с памятью даёт существенное преимущество.

Источник: habr.com
← Все новости AI Wave