Инструменты
Пишем первое ядро на Triton: сложение векторов для GPU
В эпоху моделей с миллиардами параметров даже 1% оптимизации может сэкономить более миллиона долларов — обучение GPT-4 обходится в $100 млн. Один из способов выжать максимум — писать части моделей напрямую для GPU, но CUDA-ядра печально известны своей сложностью.
Triton предлагает более простой путь. В статье на примере сложения векторов разбирается, как написать своё первое ядро: от настройки окружения до запуска. Материал ориентирован на тех, кто хочет освоить низкоуровневую оптимизацию без боли CUDA.
Источник: habr.com