Яндекс открыл претрейн Alice AI Search: быстрые ответы Алисы с MoE-архитектурой и RL на пользователях
Яндекс раскрыл внутреннюю кухню быстрых ответов Алисы в Поиске — самого массового генеративного продукта компании. В основе лежит собственная модель Alice AI‑T5-35B‑A0.6B Base, обученная с нуля с кастомной архитектурой. Ключевые фишки: совмещение Encoder-Decoder с разреженной MoE (Mixture of Experts) для эффективности и короткие инфоконтексты, которые позволяют удерживать ответ за считаные секунды даже в пиковую нагрузку.
Важный этап — онлайн‑RL на реальных поведенческих сигналах пользователей. По словам команды, это напрямую повлияло на качество генерации и востребованность продукта. Модель уже работает в продакшене, и июньский релиз принёс заметное ускорение ответов.
Для внешних пользователей модель доступна через Hugging Face Transformers (инференс), но оптимизированный production‑инференс пока остаётся внутри Яндекса. Это первый открытый претрейн такого масштаба от команды Alice AI Search, и он даёт сообществу возможность изучить архитектуру, которую Яндекс адаптировал под высоконагруженный поисковый сценарий.