Почему LLM-инференс деградирует под нагрузкой: четыре механизма, которые убивают p99
Демо-нагрузка и реальная продакшн-среда — это два разных мира. Если прогнать пару запросов на свежей модели, latency и TTFT радуют. Но когда сервис живёт неделю под реальным трафиком, p99 неумолимо растёт, память утекает, а однажды запрос, который вчера проходил без проблем, валится с OOM.
Стас Погоржельский, технологический евангелист VK Cloud, разбирает четыре механизма деградации, которые проявляются на длинных интервалах: фрагментация KV-кэша, нехватка памяти при работе с длинным контекстом, head-of-line blocking внутри батча и расхождение метрик p50 и p99. Для каждого случая описано внутреннее поведение системы, способы воспроизведения проблемы и метрики-предвестники инцидента.
Инференс редко выходит из строя мгновенно — он постепенно ухудшается, оставаясь незаметным до критической точки. Статья будет полезна всем, кто запускает LLM в продакшн и хочет избежать внезапных падений.