BottleCap AI представила ThinkingCap-Qwen3.8-27B: на 37,2% меньше размышлений при потере точности в 0,86 п.п.
BottleCap AI выпустила ThinkingCap-Qwen3.8-27B — вторую модель серии ThinkingCap. Это тонкая настройка Qwen3.8-27B, нацеленная исключительно на сокращение длины цепочки рассуждений. На 12 бенчмарках модель в среднем использует на 37,2% меньше «думающих» токенов, а макро-усреднённая точность снизилась с 86,65% до 85,79% — потеря 0,86 п.п.
Сокращение токенов варьируется от 10,7% до 65,5% по тестам. Сильнее всего упало потребление токенов на MMMLU (65,5%) и MMLU-Pro (57,3%). При этом на long-context извлечении (AA-LCR) точность выросла на 2,25 п.п. при сокращении токенов на 38,6%. Самый заметный компромисс — AIME 2026: точность снизилась на 3,85 п.п. (с 98,13% до 94,27%) при сокращении токенов на 30,2%.
Модель совместима с vLLM и SGLang, доступны сборки FP8, NVFP4, GGUF и MLX. Репозиторий закрыт; для коммерческого использования за пределами лицензии для малого бизнеса требуется отдельное соглашение с BottleCap.