Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Claude Fable разгромил GPT-5.6 на MirrorCode: 64% против 20% — разрыв втрое

03.08.2026 · habr.com ↗

Исследователи из Epoch AI обновили лидерборд бенчмарка MirrorCode, добавив результаты флагманских моделей Anthropic и OpenAI. Claude Fable 5 решил 64% задач, в то время как GPT-5.6 Sol справился только с 20%. Разрыв в три раза выглядит аномалией на фоне других тестов, где эти модели показывают сопоставимые результаты, а иногда Sol даже выходит вперёд.

Официальных пояснений от Epoch AI или Anthropic пока нет, но данные самого лидерборда позволяют восстановить возможные причины. MirrorCode оценивает способность модели переписывать программы с нуля — задача, требующая глубокого понимания кода и генерации альтернативных реализаций. Возможно, архитектура Fable 5 лучше оптимизирована под такие сценарии.

Источник: habr.com
← Все новости AI Wave