NeoMME: мультимодальные энкодеры, которые выкинули Vision Tower и Causal Decoder
Большинство современных визуальных ретриверов — это переделанные генеративные модели: они тащат с собой предобученную vision tower и causal decoder, который никогда не генерирует токены. H Company решила избавиться от этого балласта. NeoMME — это семейство одно-трансформерных энкодеров, которые с нуля обучаются обрабатывать и текст, и сырые RGB-патчи 32×32 через одни и те же слои. Выходит две версии: 262,9M и 793,7M параметров.
Архитектура использует факторизованные эмбеддинги текста в стиле ALBERT, проекцию изображений через двухслойный MLP, скользящее внимание с глобальными слоями каждые шесть, grouped-query attention, 2D RoPE и squared-ReLU. Контекст — 16384 токена, хватает на два 4K UHD-изображения после патчинга. Токенизатор — BPE со словарём 131072, обученный с нуля: на 14 языках FLORES-200 он генерирует на 44.4% меньше токенов, чем ModernBERT.
Предобучение — дискретная маскированная диффузия. На мультимодальных сегментах маскировка от 30% до 100% заставляет модель читать страницу, а не полагаться на текст. Результат подтверждается аблирующим тестом: при 90% маскировки видимые патчи повышают точность на 38.4 и 40.5 пункта для 260M и 800M моделей. На ViDoRe v3 NeoMME-Retriever (260M) даёт 0.523 nDCG@10 — это на 0.002 хуже ColQwen2.5 при 3.75B параметров и на 26.1 пункта лучше любого другого ретривера до 300M. 800M-версия получает 0.556, отставая от Vultron Retriever Flash на 0.9 пункта.
Для продакшна модель индексирует 51.3 страницы в секунду на одном NVIDIA L40S и кодирует запрос за 78.3 мс на CPU. Индексы late-interaction можно сжимать: при pool factor 10 и int8 — 39.0 кБ на страницу с сохранением 99.16% nDCG@10, а pool factor 8 с бинарными документами — 6.0 кБ (255.5× сжатие). Все чекпоинты выложены под Apache 2.0, с первого дня работают в Hugging Face Transformers.