Авито построила собственную Inference-платформу вместо доработки PaaS — почему open-source ядро оказалось лучше
PaaS отлично справляется с веб-сервисами, но для ML-инференса он не годится: высокие требования к GPU, латентности и управлению моделями не укладываются в абстракции платформы для обычных микросервисов. Команда Авито столкнулась с типовыми проблемами крупных компаний — долгая инициализация, неэффективное использование ресурсов, сложности с канареечным деплоем и A/B-тестами.
Вместо того чтобы «допиливать» PaaS под нужды машинного обучения, инженеры решили строить отдельную Inference-платформу. Взяли за основу готовое open-source ядро — это позволило быстро получить специализированные возможности: динамическое батчирование, управление GPU-памятью, автомасштабирование по нагрузке и поддержку разнородных моделей (от классических ML до LLM).
Выбор в пользу отдельного решения дал Авито гибкость и изоляцию: инференс не мешает обычным сервисам, а команды ML получают инструменты, заточенные под их задачи. Статья подробно разбирает критерии этого выбора — он может быть полезен всем, кто строит внутренние AI-продукты в масштабе.