Splash ускоряет локальные LLM на Mac: разбор спекулятивного декодирования DFlash 2
Splash — это движок для запуска LLM локально на Mac, который обещает прирост скорости за счёт спекулятивного декодирования DFlash 2. Вместо того чтобы генерировать токены последовательно, движок предсказывает несколько вариантов сразу и проверяет их, что сокращает задержки.
В тестах разработчиков Splash показал ускорение в несколько раз по сравнению со стандартным инференсом. Однако есть нюансы: эффективность сильно зависит от квантования (Q4 vs Q8), объёма оперативной памяти и свободного места на диске. Авторы рекомендуют учитывать эти параметры при выборе модели.
Запустить Splash на macOS можно через готовые скрипты — инструкция прилагается. Инструмент ориентирован на тех, кто хочет получить максимальную производительность от локальных LLM на Apple Silicon.