От CLIP до MOON3.0: как ИИ научился видеть товар целиком, а не просто картинку
Ранние системы электронной коммерции искали товары по одной фотографии — модель просто сравнивала картинки. Но товар — это не только внешний вид: важны описание, характеристики, бренд, цена. CLIP от OpenAI стал первым шагом к объединению изображений и текста, но он не учитывал специфику товарных атрибутов.
Следом появились специализированные архитектуры: e-CLIP адаптировал CLIP под задачи e-commerce, MOON (Multimodal Object Oriented Network) учился связывать фото с текстовыми описаниями и категориями. MOON2.0 и AFMRL (Attribute-Focused Multimodal Representation Learning) добавили фокус на атрибуты — цвет, размер, материал. Наконец, MOON3.0 объединил все подходы в единое мультимодальное представление, которое понимает товар как целостную сущность.
Такие модели позволяют точнее искать товары по описанию, рекомендовать аналоги и автоматически заполнять карточки. Для интернет-магазинов это снижает долю ручной модерации и улучшает конверсию. Эволюция от простого сравнения картинок к глубокому пониманию товара — ключевой тренд в e-commerce AI.