Инструменты
Инференс LLM для 25 разработчиков: 452:1, KV-пул и грабли с экономией
Автор публикует практический разбор инференса LLM для команды из 25 разработчиков. В статье — пять последовательных конфигураций с реальными цифрами и затратами, рабочий набор флагов vLLM под одну карту Blackwell, а также три специфических бага и обходы. Отношение входных токенов к выходным составило 452:1 — крайне асимметричная нагрузка.
Главный вывод, к которому пришли через четыре промежуточных стенда: на агентской нагрузке кэш префикса (KV-пул) даёт больший выигрыш, чем выбор модели, размер видеокарты и всё остальное вместе взятое. Авторы потратили лишние месяцы, потому что не понимали, что именно нужно измерять. Статья будет полезна тимлидам, DevOps и архитекторам, которые держат LLM внутри контура.
Источник: habr.com