Волна ИИПодписаться
← Назад
Инструменты

Kubernetes 1.36 научили чинить GPU без вечного Pending — под не перезапускается на мертвом устройстве

31.07.2026 · habr.com ↗

При обучении больших моделей отказы GPU — обычное дело: за 54 дня обучения Llama 3 405B кластер Meta из 16 384 H100 пережил 419 прерываний, 58,7% из которых пришлись на GPU. Проблема в том, что Kubernetes по умолчанию пытается «лечить» такие отказы рестартом пода — но на том же самом мёртвом устройстве, что приводит к бесконечному циклу и вечному состоянию Pending.

В свежей версии Kubernetes 1.36 появились механизмы, которые впервые позволяют выйти из этой ситуации без убийства всей ноды. Теперь можно отобрать у пода сломанный GPU и перераспределить нагрузку, не оставляя задачу в подвешенном состоянии. Статья с пошаговым разбором и демонстрацией на тестовом стенде — от технологического евангелиста VK Cloud.

Источник: habr.com
← Все новости AI Wave