Волна ИИПодписаться
← Назад
Исследования

Яндекс научил нейросети одновременно смотреть на картинку и читать текст для поиска

10.08.2026 · habr.com ↗

Инженеры Яндекс Картинок поделились опытом внедрения мультимодальных нейросетей в поиск изображений. Ранее релевантность определялась по двум независимым сигналам — визуальному сходству и текстовому описанию, что приводило к ошибкам в «серых зонах», когда эти сигналы противоречили друг другу. Решением стало использование VLM (Vision-Language Model), которая одновременно обрабатывает и картинку, и текст.

Чтобы обеспечить realtime-поиск при десятках тысяч запросов в секунду, команда применила дистилляцию: тяжёлую VLM обучили на эталонных парах, а затем её знания перенесли в набор лёгких моделей — по одной на каждый этап пайплайна. Это позволило сохранить качество мультимодального анализа при радикальном снижении вычислительных затрат. В результате доля релевантных изображений в топе выдачи выросла на 5%.

Источник: habr.com
← Все новости AI Wave