ByteDance и Tsinghua представили CUDA Agent: ИИ-агент, который пишет GPU-код быстрее компилятора
Исследователи из ByteDance Seed и Университета Цинхуа (AIR) разработали CUDA Agent — агентную систему с подкреплением (RL), которая обучает большую языковую модель генерировать эффективные ядра GPU. Проблема в том, что современные модели уже умеют писать корректный CUDA-код, но он часто оказывается медленнее, чем результаты оптимизирующего компилятора. На начальном этапе модель Seed1.6 (23B активных параметров, 230B всего) проходила 74,0% задач KernelBench, но обгоняла torch.compile только в 27,2% случаев, со средним замедлением 0,69x.
CUDA Agent решает эту задачу, помещая модель в реальную среду разработки CUDA с профилированием, проверками корректности и изолированным sandbox. После 150 шагов PPO с контекстом 131 072 токена результаты резко улучшились: 98,8% прохождения задач, 96,8% случаев быстрее torch.compile, среднее ускорение 2,11x. На сложнейшем уровне Level-3 показатель «быстрее компилятора» достиг 90,0%, что примерно на 40 пунктов выше, чем у Claude Opus 4.5 (50,0%) и Gemini 3 Pro (52,0%).
Система использует дискретную награду (от -1 до 3): -1 за ошибку корректности, 3 — если ядро обгоняет и eager-режим, и torch.compile более чем на 5%. Для предотвращения «взлома» награды внедрены пять контрмер, включая блокировку torch.nn.functional и проверку на пяти случайных входах. Обучение проходило на 128 NVIDIA H20, а для синтеза данных использовался датасет CUDA-Agent-Ops-6K, где 83,77% примеров — композиции из двух операторов.
Готовая обученная модель не опубликована — она построена на проприетарной Seed1.6. В открытом доступе: датасет, спецификация SKILL.md и рецепты награды. Полное воспроизведение требует значительных ресурсов, но отдельные компоненты (датасет, правила награды, защита от reward hacking) могут быть адаптированы на открытых базовых моделях. Применение — AI-инфраструктура, инференс, автономное вождение, трейдинг, медицинская визуализация — везде, где нужны слитые ядра на критическом пути задержки.