Агенты Anthropic и OpenAI провалили написание научных статей: автономные ИИ-исследования откладываются
Исследователи дали агентам на базе Claude Opus 4.8 и GPT-5.6 Sol шесть дней, выделили $3 000 на API-кредиты и GPU-доступ, чтобы те полностью самостоятельно написали ИИ-исследовательские статьи. Оригинальные авторы неопубликованных работ с конференции NeurIPS оценили результаты как «Reject».
Выводы, полученные совместно с Принстонским университетом и UK AI Security Institute, таковы: фронтирные модели успешно справляются с инженерной частью цикла исследований — сбором данных, обучением моделей, проведением экспериментов. Но они полностью проваливают исследовательскую интуицию, творческое решение задач и умение вовремя отказаться от неудачного подхода.
Результаты прямо противоречат недавним заявлениям Anthropic и OpenAI о том, что автономные ИИ-агенты для научных открытий буквально «на расстоянии вытянутой руки». Похоже, до настоящей научной самостоятельности современным моделям ещё далеко — и проблема не в скорости вычислений, а в фундаментальном отсутствии научного мышления.