Исследования
Запуск LLM на 2,8 трлн параметров на ноутбуке: эксперимент с Kimi K3 и MoE
Локальный запуск больших LLM сталкивается с ограничениями памяти: веса не помещаются, оффлоад режет скорость, а бенчмарки не показывают реальную картину. В эксперименте с Kimi K3 на 2,8 трлн параметров автор тестирует комбинацию MoE, квантования, стриминга и иерархии памяти, чтобы понять, как эти техники меняют пределы потребительского железа.
Результаты показывают, что даже на ноутбуке можно запустить такую модель, но с серьёзными компромиссами по скорости и качеству. Ключевые выводы: MoE снижает активные параметры, квантование уменьшает размер весов, а стриминг и иерархия памяти помогают управлять загрузкой. Однако реальная производительность сильно зависит от конкретной задачи и конфигурации.
Источник: habr.com