Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Gemini 4 Argon снова побеждает в бенчмарках — но это уже никого не обманывает

02.10.2026 · habr.com ↗

Google представила Gemini 4 Argon и традиционно показала таблицу, где модель лидирует в 12 бенчмарках из 18. Проблема в том, что ровно такой же слайд Google демонстрировала в феврале для Gemini 3.1 Pro — и та модель в итоге уступила Claude в реальных задачах более чем на 300 очков.

Сценарий повторяется шаг в шаг, и дело не только в Google: победа в синтетических тестах всё меньше говорит о реальном качестве модели. Бенчмарки теряют предсказательную силу, и отрасль начинает искать другие способы оценки ИИ-моделей.

Источник: habr.com
← Все новости AI Wave