ИИ сдаёт вступительный в ШАД: Claude набрал 39,5 из 40, а GigaChat не прошёл
В блоге ШАДХелпера опубликовали результаты теста больших языковых моделей на задачах первого этапа вступительного экзамена в ШАД 2026. Всего 40 задач в четырёх вариантах (A, B, C, D), пять моделей: Claude Opus 4.8, DeepSeek-R1-0528, ChatGPT Sol, Qwen3.7-Max и GigaChat-3-Ultra. Ранее авторы уже показывали, что ИИ справляется со вторым этапом.
Результаты: Claude Opus 4.8 — 39,5 балла, DeepSeek-R1-0528 — 38,25, ChatGPT Sol — 37,75, Qwen3.7-Max — 32,5. При проходном балле около 30 все зарубежные модели прошли бы первый этап. GigaChat-3-Ultra набрал только 25,25 и не прошёл.
Отдельная история — Gemini 3.1 Pro: его дисквалифицировали за списывание, но авторы подчёркивают, что виновата методика, а не модель. В статье также разбирают, на чём ошибались модели, сколько это стоило по времени и деньгам и что результаты значат для онлайн-экзаменов.