Как гарантировать завершение вычислений на арендных GPU без личного кластера
Автор столкнулся с проблемой запуска вычислительных задач на арендных GPU: каждая платформа имеет свои лимиты, инструменты и, что важнее, не гарантирует завершение вычислений. Спотовые машины могут быть отозваны, а бесплатные квоты — исчерпаны. Идея собрать «кластер» из нескольких площадок требует грамотной оркестрации, а не просто списка аккаунтов.
В статье подробно разбираются инженерные решения, которые позволили добиться гарантии выполнения. Многие из них оказались неочевидны — простой вариант сломался, и пришлось искать обходные пути. Основной фокус — на архитектуре распределённых вычислений, а не на конкретной платформе.
Хотя пример в статье построен вокруг арендных GPU, описанные принципы оркестрации переносимы на другие сценарии. Это практический материал для разработчиков, которые хотят эффективно использовать ресурсы нескольких провайдеров, не привязываясь к одному.