Волна ИИПодписаться
← Назад
Тесты и бенчмарки

DeepMind впервые в мире запускает двойные слепые тесты для ИИ: оценки станут честнее

27.08.2026 · deepmind.google ↗

DeepMind начала пилотирование двойных слепых тестов (double-blind) для оценки своих ИИ-моделей. Это значит, что ни тестировщик, ни эксперт не знают, какую именно модель оценивают в данный момент — тем самым исключается сознательное или подсознательное влияние ожиданий на результат.

Обычно оценки ИИ проводятся в открытую: разработчики видят, с какой моделью работают. Это может искажать результаты — например, к известной модели относятся строже, а к новой — снисходительнее. Двойной слепой метод, давно применяемый в медицине и психологии, переносится на тестирование ИИ.

Пока проект в стадии пилота, но если подход докажет эффективность, он может стать новым стандартом для бенчмарков. Это особенно важно в условиях, когда модели сравнялись по сырым метрикам и нужны более тонкие, человеческие оценки.

Источник: deepmind.google
← Все новости AI Wave