Разбираем cuDNN Frontend: как вручную управлять графами операций и фьюжном на GPU
В новом туториале разбирается работа с cuDNN Frontend на уровне ниже фреймворка. Автор показывает, как описать вычисление в виде графа операций, доверить выбор движка cuDNN, а затем взять этот выбор под контроль. Каждый пример строится одинаково: объявляются тензоры с размерами и шагами, операции цепляются в граф, затем проходит пятишаговый конвейер — валидация, построение графа, создание планов выполнения, проверка поддержки и сборка планов.
Все примеры запускаются на одной GPU в Colab, а результаты сверяются с эталоном PyTorch — так видно и корректность фьюжна, и его стоимость. Темы идут по нарастающей: от одиночной свёртки до автоподбора конфигураций движка, FP8-эпилогов, внимания, сериализации планов, динамических форм и захвата графов CUDA.
Материал будет полезен тем, кто хочет выжать максимум из cuDNN, не полагаясь на магию фреймворка. Это практический разбор с кодом, который можно адаптировать под свои задачи.