Волна ИИПодписаться
← Назад
Инструменты

Инференс LLM для 25 разработчиков: 452:1, KV-пул и грабли с экономией

22.08.2026 · habr.com ↗

Автор публикует практический разбор инференса LLM для команды из 25 разработчиков. В статье — пять последовательных конфигураций с реальными цифрами и затратами, рабочий набор флагов vLLM под одну карту Blackwell, а также три специфических бага и обходы. Отношение входных токенов к выходным составило 452:1 — крайне асимметричная нагрузка.

Главный вывод, к которому пришли через четыре промежуточных стенда: на агентской нагрузке кэш префикса (KV-пул) даёт больший выигрыш, чем выбор модели, размер видеокарты и всё остальное вместе взятое. Авторы потратили лишние месяцы, потому что не понимали, что именно нужно измерять. Статья будет полезна тимлидам, DevOps и архитекторам, которые держат LLM внутри контура.

Источник: habr.com
← Все новости AI Wave