Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Вредно много думать: почему максимальный reasoning у Qwen3.8-27B не спасает квантизацию

07.09.2026 · habr.com ↗

После теста скорости Qwen3.8-27B на Mac Studio я поспешил с выводами: модель не смогла решить handoff-задачу по SwiftUI-проекту, ушла в постоянные размышления, и я закрыл её. Оказалось, дело может быть не в самой модели, а в настройке её режима рассуждений.

В новом эксперименте я сравнил качество ответов эталонной BF16-версии с 8-bit и 4-bit квантизацией. Ранее в связке с DFlash2 8-bit версия выдавала 38 токенов в секунду, но быстро отвечать и хорошо работать — не одно и то же. Чтобы квантизованные модели не потеряли в сложных задачах, я включил им максимальный reasoning_effort=xhigh. Логика была простая: больше размышлений — выше точность.

Гипотеза не подтвердилась. Вместо улучшения качества максимальный уровень рассуждений заставил модель «передумывать» и вязнуть в бесполезных размышлениях. Так что предыдущий вывод про скорость и квантизацию нуждается в дополнении: быстрый ответ ещё не означает правильный.

Источник: habr.com
← Все новости AI Wave