Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Opus 5 почти в 4 раза превзошёл рекорд на ARC-AGI-3: модель сама учится формулировать уравнения

26.07.2026 · the-decoder.com ↗

Anthropic снова удивила: её флагманская модель Claude Opus 5 показала 30.2% на тесте ARC-AGI-3 — это почти в четыре раза выше, чем предыдущий рекорд модели GPT-5.6 Sol (7.8%). Бенчмарк ARC-AGI-3 специально разработан для оценки «реального интеллекта»: он проверяет способность к абстрактному мышлению и решению новых задач без подсказок.

Особенно примечательно, что Opus 5 не просто улучшил результат — он продемонстрировал поведение, которого разработчики теста раньше не видели: модель самостоятельно формулировала уравнения отражений (reflection equations) в процессе решения. Это указывает на более глубокое логическое рассуждение, чем простое переборное угадывание.

Пока неизвестно, как именно Anthropic добилась такого скачка, и будет ли этот результат воспроизводиться в других бенчмарках. Но факт остаётся фактом: на задаче, которую многие считают прокси для измерения настоящего интеллекта, Opus 5 ушёл далеко вперёд.

Источник: the-decoder.com
← Все новости AI Wave