Волна ИИПодписаться
← Назад
Тесты и бенчмарки

OpenAI заявляет о победе GPT-5.6 Sol над Opus 5 на ARC-AGI-3 — но с собственным харнессом

30.07.2026 · the-decoder.com ↗

OpenAI ответила на рекорд Anthropic на ARC-AGI-3. По заявлению компании, модель GPT-5.6 Sol набрала 38,3% — выше, чем у Opus 5 (30,2%). Но есть нюанс: этот результат получен через собственный API OpenAI с включённым сохранением цепочки рассуждений и сжатием контекста. В официальном тестовом окружении та же модель показала всего 7,8%.

Claude Opus 5 достигла своих 30,2% без дополнительных харнессов — то есть в стандартных условиях бенчмарка. Таким образом, прямое сравнение некорректно: OpenAI фактически изменила условия тестирования, что делает заявление о победе спорным.

ARC-AGI-3 считается одним из самых сложных бенчмарков на абстрактное мышление. Споры вокруг методик замера показывают, что гонка моделей всё чаще переходит в плоскость «победы любой ценой», а не чистых архитектурных улучшений.

Источник: the-decoder.com
← Все новости AI Wave