MTPLX vs oMLX: локальный сервер для Mac оказался быстрее в 6 раз
Практический эксперимент: на MacBook Pro с M4 Max запустили одну и ту же модель Qwen3.8-27B через два разных сервера — MTPLX и oMLX. Задача и режимы размышлений были идентичны тем, что автор использовал в первой части статьи про локального кодового агента.
Результат однозначный: MTPLX завершал задачу в 2,8–6,4 раза быстрее. По скрытым тестам связки сравнялись, но по времени выполнения разница колоссальная. Автор отмечает, что сборки модели были разными, а каждый режим на oMLX запускался однократно, но вывод очевиден: совет ChatGPT не подтвердился.
Статья также отвечает на вопросы из комментариев к первой части — про режим по умолчанию, шум вентиляторов и потребление памяти. Для тех, кто запускает LLM локально на Mac, это практическое сравнение двух популярных серверов.