Grok 4.7 против GPT-6 Astra и Claude: кто эффективнее? Сравнение лидеров
На этой неделе вышли сразу несколько флагманских моделей: SpaceXAI представила Grok 4.7, OpenAI — GPT-6 Astra, Anthropic — Claude Fable 5.1 (а чуть раньше — Claude Opus 5 для тяжёлых задач). Китайские лаборатории не отстают: Qwen3.8 Max и Kimi K3 встали в один ценовой коридор с Grok и показывают близкие результаты на общем индексе.
На тестах, включающих длинный код, терминал, схемы, юридические задачи и счёт, модели идут плотно. Qwen3.8 Max стоит те же $2/$6 за миллион токенов, что и Grok, и отстаёт всего на один балл. Kimi K3 на суточных инженерных задачах работает на уровне свежего Grok. Однако на Terminal‑Bench результаты независимого прогона Artificial Analysis расходятся с заявленными лабораториями почти в полтора раза — доверять одной картинке из анонса бессмысленно.
Китайские модели больше не «дешёвый запасной вариант»: они конкурируют по цене и качеству с лидерами. Выбор конкретной модели теперь упирается не в бенчмарки, а в специфику задачи и доверие к провайдеру.