Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Grok 4.7 против GPT-6 Astra и Claude: кто эффективнее? Сравнение лидеров

25.09.2026 · habr.com ↗

На этой неделе вышли сразу несколько флагманских моделей: SpaceXAI представила Grok 4.7, OpenAI — GPT-6 Astra, Anthropic — Claude Fable 5.1 (а чуть раньше — Claude Opus 5 для тяжёлых задач). Китайские лаборатории не отстают: Qwen3.8 Max и Kimi K3 встали в один ценовой коридор с Grok и показывают близкие результаты на общем индексе.

На тестах, включающих длинный код, терминал, схемы, юридические задачи и счёт, модели идут плотно. Qwen3.8 Max стоит те же $2/$6 за миллион токенов, что и Grok, и отстаёт всего на один балл. Kimi K3 на суточных инженерных задачах работает на уровне свежего Grok. Однако на Terminal‑Bench результаты независимого прогона Artificial Analysis расходятся с заявленными лабораториями почти в полтора раза — доверять одной картинке из анонса бессмысленно.

Китайские модели больше не «дешёвый запасной вариант»: они конкурируют по цене и качеству с лидерами. Выбор конкретной модели теперь упирается не в бенчмарки, а в специфику задачи и доверие к провайдеру.

Источник: habr.com
← Все новости AI Wave