Волна ИИПодписаться
← Назад
Исследования

Google DeepMind впервые тестирует двойной слепой бенчмарк: ни одна сторона не увидит ни вопросы, ни веса модели

28.08.2026 · the-decoder.com ↗

Google DeepMind впервые проводит двойное слепое тестирование фронтир-модели ИИ. В пилотном проекте с Сингапурским институтом безопасности ИИ используется технология Confidential Space: она не позволяет Google видеть тестовые вопросы, а оценщикам — веса модели. Тестирование проходит на модели Gemini Flash Lite.

Проблема доверия к бенчмаркам давно назрела: разработчики могут подгонять модели под известные тесты, а независимые оценщики — сомневаться в честности результатов. Двойной слепой метод исключает обе возможности: ни одна сторона не имеет полного контроля над процессом.

Если пилот окажется успешным, такой подход может стать отраслевым стандартом для проверки ИИ-систем. Это особенно важно для фронтир-моделей, где даже небольшое смещение в оценке может скрыть реальные риски.

Источник: the-decoder.com
← Все новости AI Wave