AI-агенты ускоряют научный код в 60 раз, но не понимают, правильна ли наука
OpenAI совместно с академическими партнёрами опубликовала полевой отчёт об использовании AI-кодинг-агентов для модернизации устаревшего исследовательского ПО. Агенты смогли ускорить выполнение научного кода до 60 раз, что впечатляет, но выявило серьёзную проблему: системы «красноречивы, убедительны и уверенно неверны способами, которые легко пропустить».
Участники эксперимента отметили, что основная нагрузка сместилась с написания кода на трудоёмкую проверку научной корректности результатов. Агенты не способны оценить, правильна ли наука, которую они автоматизируют, что требует от исследователей глубокого погружения в верификацию.
Выводы отчёта подчёркивают, что AI-агенты — мощный инструмент для рефакторинга и оптимизации, но не заменяют экспертизу учёного. Пока агенты не научатся понимать научный контекст, их применение в исследованиях будет ограничено необходимостью ручной проверки.