Волна ИИПодписаться
← Назад
Модели и агенты

От CLIP до MOON3.0: как ИИ научился видеть товар целиком, а не просто картинку

02.10.2026 · habr.com ↗

Ранние системы электронной коммерции искали товары по одной фотографии — модель просто сравнивала картинки. Но товар — это не только внешний вид: важны описание, характеристики, бренд, цена. CLIP от OpenAI стал первым шагом к объединению изображений и текста, но он не учитывал специфику товарных атрибутов.

Следом появились специализированные архитектуры: e-CLIP адаптировал CLIP под задачи e-commerce, MOON (Multimodal Object Oriented Network) учился связывать фото с текстовыми описаниями и категориями. MOON2.0 и AFMRL (Attribute-Focused Multimodal Representation Learning) добавили фокус на атрибуты — цвет, размер, материал. Наконец, MOON3.0 объединил все подходы в единое мультимодальное представление, которое понимает товар как целостную сущность.

Такие модели позволяют точнее искать товары по описанию, рекомендовать аналоги и автоматически заполнять карточки. Для интернет-магазинов это снижает долю ручной модерации и улучшает конверсию. Эволюция от простого сравнения картинок к глубокому пониманию товара — ключевой тренд в e-commerce AI.

Источник: habr.com
← Все новости AI Wave