Волна ИИПодписаться
← Назад
Инструменты

Perplexity открыла исходники Lily: Rust + Metal движок для Qwen на Apple Silicon

03.09.2026 · marktechpost.com ↗

Perplexity выложила в открытый доступ Lily — локальный движок инференса, который питает функцию Hybrid Compute в Perplexity Computer. Это однопроцессный рантайм: слой на Rust загружает чекпоинт и управляет генерацией, OpenAI-совместимый API стримит токены, а кастомные Metal-ядра выполняют модель. Ни PyTorch, ни MLX в цепочке исполнения не участвуют.

Lily намеренно узко заточен под одну модель — Qwen3.6-35B-A3B — и одно семейство железа (Apple Silicon). Чекпоинт в 4-битном квантовании весит 19.4 ГБ, так что минимальные требования — Mac с 32 ГБ унифицированной памяти. Perplexity указывает macOS 15+, 24 ГБ минимум и 32 ГБ для лучшего результата.

Специализация даёт выигрыш в производительности: на 40-ядерном M5 Max с 128 ГБ памяти Lily набрал в среднем 4156 токенов/с на префилле против 3388 у MLX-LM (1.23x) и 170.0 токенов/с на декоде против 126.4 (1.35x). На промпте в 4K токенов и контексте 4K — 5749.9 и 186.6 токенов/с соответственно. Демо доступно в репозитории pplx-garden.

Источник: marktechpost.com
← Все новости AI Wave