Волна ИИПодписаться
← Назад
Исследования

Что видит трансформер: крокодила, лодку или силуэт? Проверили BLIP на визуальных иллюзиях

22.08.2026 · habr.com ↗

Визуальные иллюзии — классический тест для человека: что ты увидел первым? Автор решил проверить, как с такими картинками справится трансформер BLIP (Bootstrapping Language-Image Pre-training). Взяли популярные изображения-тесты с двойными смыслами — например, где можно разглядеть и крокодила, и лодку, и силуэт человека — и скормили их модели.

BLIP описал изображения, перечислив несколько объектов: модель не выбирает что-то одно, а выдаёт список того, что «увидела» с разной вероятностью. Например, на картинке с крокодилом и лодкой трансформер отметил и то, и другое, а на знаменитом тесте с вазой/лицами — распознал оба варианта, но с разной уверенностью.

Автор не просто получил описание, но и проанализировал, на какие участки изображения модель «смотрела» — то есть визуализировал внимание трансформера. Это дало понять, что BLIP может улавливать многозначность, но его «первое впечатление» зависит от контраста и детализации участков, а не от семантической глубины, как у человека.

Эксперимент показывает: в отличие от человека, трансформер не делает мгновенный выбор в пользу одного смысла — он паралелльно оценивает все варианты. Это одновременно и сила (не зацикливается), и слабость (не улавливает контекст, который для человека очевиден). Полный разбор — в статье на Хабре.

Источник: habr.com
← Все новости AI Wave