Тесты и бенчмарки
Claude Fable разгромил GPT-5.6 на MirrorCode: 64% против 20% — разрыв втрое
Исследователи из Epoch AI обновили лидерборд бенчмарка MirrorCode, добавив результаты флагманских моделей Anthropic и OpenAI. Claude Fable 5 решил 64% задач, в то время как GPT-5.6 Sol справился только с 20%. Разрыв в три раза выглядит аномалией на фоне других тестов, где эти модели показывают сопоставимые результаты, а иногда Sol даже выходит вперёд.
Официальных пояснений от Epoch AI или Anthropic пока нет, но данные самого лидерборда позволяют восстановить возможные причины. MirrorCode оценивает способность модели переписывать программы с нуля — задача, требующая глубокого понимания кода и генерации альтернативных реализаций. Возможно, архитектура Fable 5 лучше оптимизирована под такие сценарии.
Источник: habr.com