Инструменты
SGLang без магии: гид по настройкам инференса LLM — от параллелизма до спекулятивного декодирования
Автор разбирает пять групп настроек SGLang: параллелизм (TP, DP, CP, PP, EP), управление KV-кэшем (Radix Cache, HiCache), вычисления и коммуникации в MoE, выбор attention-бекенда и спекулятивное декодирование. Цель — не просто перечислить CLI-флаги, а объяснить, что именно меняет каждая опция в пайплайне инференса и в каких ситуациях её стоит трогать.
Материал будет полезен тем, кто уже столкнулся с проблемами: модель не влезает в одну GPU, длинные промпты съедают кэш, GPU простаивают при обмене данными. Статья помогает системно подойти к настройке инференса, а не гадать методом тыка.
Источник: habr.com