KwaiKAT выпустила KAT-Coder-V2.5: агентная модель для кода, обученная на 100 000+ проверяемых репозиториев
KAT-Coder-V2.5 — это агентная модель кодирования, обученная решать задачи в полноценных репозиториях с проверкой через тесты. Исследователи построили пайплайн, который превращает реальные pull request и коммиты в 100 000+ проверяемых окружений на 12 языках. Каждая задача — это триплет: точное описание, исполняемое окружение и набор валидационных тестов. Патч считается корректным, только если проходит все тесты.
Ключевая проблема — создание надёжных окружений. AutoBuilder анализирует репозиторий, пишет скрипт конфигурации и запускает тесты в изолированной песочнице. Приёмка не по exit-кодам, а по структурированному выводу тестового фреймворка: окружение принимается, если собрано более 90% ожидаемых тестов и результаты повторяемы. Комбинация шаблонов и библиотеки рецептов повысила успешность сборки с 16,5% до 57,2%.
Для фильтрации данных применили process-level filtering: не просто отбрасывали неудачные прогоны, а давали подсказки-хинты, что повысило проходимость с нуля до ~20%. Затем хинты удаляли и проверяли, что модель не «подглядывает». Для успешных прогонов — отсеивали жёсткое кодирование и нестабильные решения, а также оценивали исследовательское поведение, локализацию, минимальность патча и честность. Для борьбы с переобучением на harness рандомизировали имена инструментов, форматы вывода и шаблоны промптов, сохраняя функциональность.
Модель доступна через StreamLake, а открытая версия KAT-Coder-V2.5-Dev выложена на Hugging Face под лицензией Apache-2.0. Разработчики подчёркивают, что из данных удалили историю Git и метаданные коммитов, чтобы агент не мог «прочитать» правильное решение напрямую.