Волна ИИПодписаться
← Назад
Фичи и апдейты

M3 Ultra и 12 токенов в секунду: почему топовый Mac Studio не разогнал Qwen 3.8-27B

28.08.2026 · habr.com ↗

Пользователь habr.com решил запустить Qwen3.8-27B в полной точности BF16 локально на Mac Studio 2025 года с M3 Ultra (32 ядра CPU, 80 ядер GPU, 512 ГБ памяти, пропускная способность 819 ГБ/с). Модель взял в формате MLX — оптимизированном для Apple Silicon. Ожидания были высоки, но результат разочаровал: всего 12 токенов в секунду.

Автор отмечает, что модель полностью помещается в память, использован нативный фреймворк, железо — максимальная конфигурация. Такая скорость не соответствует характеристикам топового GPU. Он начал искать причину — узкое место может быть в шине памяти, распределении ядер или настройках MLX. Подробности расследования — в полном тексте статьи.

Источник: habr.com
← Все новости AI Wave