Запускаем LLM на iPhone: гид по памяти, Core ML и MLX
Из-за архитектуры Unified Memory и ограничений iOS на iPhone нельзя использовать всю доступную память. Автор объясняет, как рассчитать реальный бюджет памяти, где приложения начинают падать и как это отловить с помощью квантования и управления KV Cache.
Core ML и MLX — два основных фреймворка для запуска моделей на Apple Silicon. Они отличаются по скорости и поддержке: Core ML лучше задействует нейронный процессор (ANE), но не всё можно на нём запустить, а MLX даёт больше гибкости, но может быть медленнее на некоторых операциях.
Длительные сессии генерации приводят к нагреву и троттлингу — телефон снижает производительность. Автор предлагает гибридный пайплайн, который комбинирует сильные стороны обоих фреймворков для стабильной работы без крашей.