Волна ИИПодписаться
← Назад
Инструменты

Запускаем LLM на iPhone: гид по памяти, Core ML и MLX

30.07.2026 · habr.com ↗

Из-за архитектуры Unified Memory и ограничений iOS на iPhone нельзя использовать всю доступную память. Автор объясняет, как рассчитать реальный бюджет памяти, где приложения начинают падать и как это отловить с помощью квантования и управления KV Cache.

Core ML и MLX — два основных фреймворка для запуска моделей на Apple Silicon. Они отличаются по скорости и поддержке: Core ML лучше задействует нейронный процессор (ANE), но не всё можно на нём запустить, а MLX даёт больше гибкости, но может быть медленнее на некоторых операциях.

Длительные сессии генерации приводят к нагреву и троттлингу — телефон снижает производительность. Автор предлагает гибридный пайплайн, который комбинирует сильные стороны обоих фреймворков для стабильной работы без крашей.

Источник: habr.com
← Все новости AI Wave