Новый бенчмарк PerceptionBench: даже лучшие ИИ видят хуже человека — точность ниже 60%
Moonshot AI представила PerceptionBench — новый бенчмарк, измеряющий способность мультимодальных ИИ-моделей воспринимать визуальную информацию, изолированно от логических рассуждений. Тест показал, что даже самые продвинутые модели не достигают 60% точности, а лидером с небольшим отрывом стала GPT-5.6 Sol от OpenAI.
Ключевой вывод исследования: многие ошибки, которые раньше приписывали слабым рассуждениям, на самом деле возникают на стадии «чтения» изображения. Модели неправильно считывают детали — шрифты, расположение объектов, цвета — и затем «логично» ошибаются на основе этих искажённых данных.
PerceptionBench ставит под сомнение прогресс в области визуального понимания: если модели не могут корректно воспринять картинку, все последующие «умные» ответы строятся на песке. Это важный сигнал для разработчиков: без улучшения первичного зрения разговоры о сильном ИИ-ви́дении преждевременны.