Liquid AI выпустила LFM2.5-VL-3B-DSpark: ускорение VLM до 3,13x без изменения выхода
Liquid AI анонсировала LFM2.5-VL-3B-DSpark — экспериментальную модель-черновик для спекулятивного декодирования своей мультимодальной модели LFM2.5-VL-3B. Драфтер добавляет около 280M параметров и ускоряет декодирование без изменения выходных данных модели. Команда сообщает об ускорении до 3,13x на Apple Silicon и до 2,66x на NVIDIA H100.
Спекулятивное декодирование работает так: небольшая модель-черновик предлагает несколько токенов вперёд, а основная модель проверяет весь блок за один проход и оставляет согласованные токены. DSpark использует ту же архитектуру, что и текстовые драфтеры Liquid AI, описанные в статье DSpark. Ключевая особенность — модальность не важна для драфтера; к моменту достижения скрытых слоёв текст и изображения — просто тензоры, поэтому алгоритм одинаков для текстовых и мультимодальных моделей.
Модель уже доступна на Hugging Face в форматах Safetensors и GGUF, с первого дня поддерживается в SGLang, MLX-VLM и llama.cpp. Релиз помечен как экспериментальный и распространяется под лицензией LFM Open License v1.0, которая разрешает бесплатное коммерческое использование только компаниям с годовой выручкой менее $10 млн.