MiniCPM5-2B: компактная модель OpenBMB обходит Qwen3.5-4B в 34 бенчмарках и работает на устройстве
MiniCPM5-2B — второй чекпойнт серии MiniCPM5 и наследник MiniCPM5-1B. Это плотная каузальная модель на 2 516 756 480 параметров, с 42 слоями, grouped-query attention (16 query-голов и 2 key/value) и нативным контекстом на 131 072 токена. Архитектура — стандартный LlamaForCausalLM, так что для запуска не нужны кастомные ядра или форки кода: веса распространяются под Apache 2.0 и работают в vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX и FlagOS.
По 34 бенчмаркам модель набирает в среднем 53,9 балла. Для сравнения: Qwen3.5-4B — 51,1, granite-4.2-3B — 42,7, LFM2.5-2.6B — 33,2. Сильнее всего видно отрыв в коде и работе с инструментами: 69,1 на LiveCodeBench v6 против 56,4 у ближайшего конкурента, 97,1 на Tau2-Bench Telecom, 66,6 на BFCL v4 и 20,8 на Tau3-Bench Banking против 6,8. С длинным контекстом ситуация смешанная: 68,1 на NoLiMa против 43,5, но на AA-LCR и LongBench v2 модель слегка уступает. На общих знаниях сказывается размер: 70,8 на MMLU-Pro против 78,0 у Qwen3.5-4B.
Обучение шло по схеме SFT → RL → on-policy дистилляция. Сначала базовая фаза со стабильным и decay-этапами и mid-training под целевое распределение данных, затем 400 млрд токенов deep-thinking SFT. После этого обучали специализированных RL-учителей для математики, кода, агентных задач и текстов на основе алгоритма JustRL II. Финальный шаг — OPD, который объединяет 16 RL-экспертов в одну модель. Вместо проверочного преимущества здесь считают reverse KL-дивергенцию между логитами студента и учителя на каждой позиции ответа. По оценке OpenBMB, этап RL+OPD даёт в среднем 10,96 балла на reasoning-бенчмарках и 6,96 на агентных.