OpenAI заявляет о победе GPT-5.6 Sol над Opus 5 на ARC-AGI-3 — но с собственным харнессом
OpenAI ответила на рекорд Anthropic на ARC-AGI-3. По заявлению компании, модель GPT-5.6 Sol набрала 38,3% — выше, чем у Opus 5 (30,2%). Но есть нюанс: этот результат получен через собственный API OpenAI с включённым сохранением цепочки рассуждений и сжатием контекста. В официальном тестовом окружении та же модель показала всего 7,8%.
Claude Opus 5 достигла своих 30,2% без дополнительных харнессов — то есть в стандартных условиях бенчмарка. Таким образом, прямое сравнение некорректно: OpenAI фактически изменила условия тестирования, что делает заявление о победе спорным.
ARC-AGI-3 считается одним из самых сложных бенчмарков на абстрактное мышление. Споры вокруг методик замера показывают, что гонка моделей всё чаще переходит в плоскость «победы любой ценой», а не чистых архитектурных улучшений.