STRIZH: 24-миллионный русский эмбеддер, который не тормозит RAG на AMD Strix Halo
Разработчик локального RAG на AMD Strix Halo столкнулся с нехваткой GPU-ресурсов: эмбеддер, реранкер и генеративная LLM делят один iGPU. Чтобы не жертвовать скоростью генерации, он создал STRIZH — 12-слойный эмбеддер на базе RuModernBERT-small (24 млн параметров), который в 12,6 раза быстрее индексирует данные, чем bge-m3, и почти не влияет на throughput Qwen3.6-35B-A3B.
Для обучения автор сначала безуспешно пытался повторить пространство большого учителя через MSE, затем обучил retrieval-донор на контрастивной задаче, выбрал из него четыре слоя [0, 5, 9, 11] и доучил student на русских, английских и смешанных парах с hard negatives от BGE-M3. В полном RAG-конвейере с четырьмя потоками STRIZH удержал 14,0 транзакции в минуту против 6,0 у bge-m3 и индексировал 46 батчей в секунду против 4,9.
При фиксированных 200 онлайн-запросах в секунду генерация проседала на 2% со STRIZH и на 7% с bge-m3. Без фоновой индексации преимущества не было — в этом профиле bge-m3 оказался немного быстрее, а пропускную способность определяли реранк (0,6–0,7 с на транзакцию), prefill и генерация. Полный код и веса модели автор выложил в открытый доступ.