Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Младшая Claude Sonnet 5.5 обыграла старших Opus 5.5 и Fable 5.1 в пошаговой стратегии

06.10.2026 · habr.com ↗

Разработчик пошаговой онлайн-стратегии «Стратегикон» решил проверить, как топовые языковые модели справляются с игрой, где нужно строить экономику, воевать и договариваться. Он посадил модели Claude — Sonnet 5.5, Opus 5.5 и Fable 5.1 — играть друг против друга.

Результат удивил: младшая модель Sonnet 5.5 обыграла обеих старших. Это показывает, что расстановка сил в сложных многоходовых сценариях может не совпадать с результатами общепризнанных бенчмарков.

Автор эксперимента считает, что из игрового движка может получиться хороший бенчмарк для оценки способностей LLM к планированию, стратегии и социальной динамике.

Источник: habr.com
← Все новости AI Wave