Тесты и бенчмарки
Gemini 4 Argon снова побеждает в бенчмарках — но это уже никого не обманывает
Google представила Gemini 4 Argon и традиционно показала таблицу, где модель лидирует в 12 бенчмарках из 18. Проблема в том, что ровно такой же слайд Google демонстрировала в феврале для Gemini 3.1 Pro — и та модель в итоге уступила Claude в реальных задачах более чем на 300 очков.
Сценарий повторяется шаг в шаг, и дело не только в Google: победа в синтетических тестах всё меньше говорит о реальном качестве модели. Бенчмарки теряют предсказательную силу, и отрасль начинает искать другие способы оценки ИИ-моделей.
Источник: habr.com