Волна ИИПодписаться
← Назад
Модели и агенты

Linkup Research выпустила SPARSEUP — открытую sparse-модель на 149 млн параметров

19.09.2026 · marktechpost.com ↗

Linkup Research выпустила SPARSEUP — открытую разреженную модель для семантического поиска. Модель работает на базе ModernBERT (149 млн параметров) и распространяется под лицензией Apache 2.0. На тесте BEIR-13 она достигает среднего nDCG@10 56,4, что, по заявлению команды, делает её сильнейшим публичным разреженным энкодером на словарной основе с размером до 150 млн параметров. Веса уже загружены на Hugging Face, модель можно использовать через Transformers или Sentence Transformers с флагом trust_remote_code=True.

В отличие от плотных моделей, которые представляют каждый текст одним вектором, разреженные модели выдают веса на всём словаре. Каждое измерение соответствует реальному токену, что позволяет использовать инвертированные индексы и делает векторы интерпретируемыми для человека. Такие модели особенно хорошо обрабатывают редкие термины. Поводом для создания SPARSEUP стал выход LightOn с моделями DenseOn и LateOn — тогда открылись данные, рецепт обучения и плотная модель. SPARSEUP заполняет недостающую разреженную ячейку, используя ту же архитектуру и данные, чтобы все три стиля поиска можно было сравнить напрямую.

Обучение стартовало с контрольной точки LateOn-unsupervised. Поскольку в ней не было MLM-головы, исследователи обратно прикрепили оригинальную голову ModernBERT. Тренировку проводили на смеси LightOn с контрастивным обучением: на каждый запрос — 7 жёстких негативов из пула 50 и негативы внутри батча. Дистилляции кросс-энкодером не было, обучение помещается на одну H100. Авторы также исправили проблему «мешков стоп-слов» у наивного SPLADE с помощью трёх приёмов: сдвиг логитов, per-position top‑k (каждый токен оставляет только 12 сильнейших значений словаря перед max-pooling) и сведение регистров (byte‑level BPE дробит одинаковые слова, итоговое измерение уменьшилось с ~50k до ~34k). Запросы и документы маркируются префиксами [Q] и [D], скоринг — скалярное произведение. Максимальная длина: 128 токенов для запросов, 512 для документов.

Источник: marktechpost.com
← Все новости AI Wave