CLM-8B: открытая модель-судья, которая в 9 раз быстрее Jev, но чуть уступает в точности
CLM-8B — это не обычная языковая модель. Она обучена с помощью bidirectional InfoNCE loss: кодирует состояние и набор возможных действий, а затем через скалярное произведение и softmax выдаёт вероятности для каждого варианта. На этапе инференса пересчитывает только те действия, которые изменились — за счёт кеширования векторов на GPU (аналог KV cache) время на повторном вызове падает с 1,7 мс до 0,6 мс на RTX 4090.
Архитектура состоит из замороженного Qwen3-8B и тренируемого проекционного слоя на 20 млн параметров. Обучение проходило в три этапа: предобучение на 60 млн пар Nemotron DQA, дообучение на 30 млн синтетических hard negative от Gemini 2.5 Flash-Lite и финальная настройка на 1 млн агентных траекторий. Топ-1 точность на закрытом датасете выросла с 52,1% (только предобучение) до 69,2% после второго этапа.
По скорости CLM-8B уверенно обходит Jev: в игре T-Rex зафиксирована разница в 9 раз (16,5 мс против 149,8 мс), на вызове инструментов — в 1,6 раза, на WikiRacing — в 2,8 раза. Однако успешность уступает: на BFCL v4 — 95,2% против 99,2%, на WikiRacing — 26/30 против 30/30. При этом на простых задачах (T-Rex и Super Mario) обе модели показывают одинаковый результат 5/5.
В режиме верификатора для кода (выбор лучшего кандидата из нескольких) CLM-8B после тонкой настройки даёт pass@1 73,7% на DeepSWE и 84% на Terminal-Bench 2.1, что ниже Jev, но скорость в 4–6 раз выше. Авторы подчёркивают, что это первый открытый контрастивный языковой модуль, совместимый с API TypeSafe. Код и модель доступны под лицензией Apache-2.0, весит всего 75 МБ.