LFM2.5-DSpark: до 3,18x быстрее декодинг без изменения выхода модели
Liquid AI представила DSpark — черновики (drafter) для трёх моделей семейства LFM2.5: LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B. Каждый такой драфтер добавляет к целевой модели путь спекулятивного декодинга: небольшой модуль (~300M параметров) предлагает блок из девяти кандидатных токенов, а большая модель проверяет весь блок за один прямой проход. Взамен небольшого роста памяти — значительное ускорение: до 3,18x на H100 и до 2,87x на M4 Max MacBook Pro. Результат (при жадном декодинге) идентичен работе одной только целевой модели, поэтому бенчмарки не меняются.
DSpark опирается на три механизма: параллельный бэкбон в стиле DFlash, который формирует скрытые состояния для всех черновых токенов за один проход; лёгкая последовательная голова (марковская цепь), восстанавливающая зависимости между соседними токенами; и верификатор с планированием достоверности, который отсекает низкоуверенные суффиксы, когда проверка обходится дороже ускорения. Практические результаты различаются в зависимости от задачи: например, LFM2.5-8B-A1B на MATH500 принимает 8,27 из 10 токенов за шаг (ускорение 3,18x), а на GSM8K — лишь 4,02 (ускорение 1,29x). На M4 Max MoE-модель даёт всего 1,18x из-за текущей реализации llama.cpp на Metal.
Все веса распространяются в форматах Safetensors и GGUF, с первого дня поддерживаются в llama.cpp и SGLang. Лицензия LFM Open License v1.0 разрешает бесплатное коммерческое использование только для компаний с годовым доходом до $10 млн; крупным предприятиям нужно обращаться за отдельной лицензией. Решение подходит для локальных ИИ-помощников, агентов на устройстве, однопользовательских чатов и офлайн-копилотников на ноутбуках — при условии самостоятельного хостинга.