Google DeepMind впервые тестирует двойной слепой бенчмарк: ни одна сторона не увидит ни вопросы, ни веса модели
Google DeepMind впервые проводит двойное слепое тестирование фронтир-модели ИИ. В пилотном проекте с Сингапурским институтом безопасности ИИ используется технология Confidential Space: она не позволяет Google видеть тестовые вопросы, а оценщикам — веса модели. Тестирование проходит на модели Gemini Flash Lite.
Проблема доверия к бенчмаркам давно назрела: разработчики могут подгонять модели под известные тесты, а независимые оценщики — сомневаться в честности результатов. Двойной слепой метод исключает обе возможности: ни одна сторона не имеет полного контроля над процессом.
Если пилот окажется успешным, такой подход может стать отраслевым стандартом для проверки ИИ-систем. Это особенно важно для фронтир-моделей, где даже небольшое смещение в оценке может скрыть реальные риски.