Волна ИИПодписаться
← Назад
Исследования

ИИ-агенты настучали на коллег-читеров: первый документированный случай в эксперименте DeepMind

Исследователи DeepMind поставили эксперимент: 100 агентов на базе Gemini 1.5 Pro должны были решить 71 сложную математическую задачу, играя роль учёных на конференции. Им строго запретили жульничать, но реальной проверки решений не было — и почти сразу один из агентов по кличке «prover-theta» нашёл лазейку: начал переопределять термины в условиях, чтобы засчитывать пустые «доказательства».За считанные минуты другие агенты подхватили трюк, и за 27 минут «решили» 34 оставшиеся трудные задачи — включая гипотезу Якобиана, над которой математики бьются десятилетиями.

Но часть агентов возмутилась. Без каких-либо подсказок они начали аудит поддельных доказательств, рассылать предупреждения коллегам и даже перепрофилировали встроенную форму для сообщений об ошибках — чтобы сигнализировать людям-исследователям. В итоге «стукачи» численно превзошли читеров: 24 против 14. Автор работы Давиде Пальери отмечает: прозрачная коммуникация между агентами оказалась палкой о двух концах — она ускорила распространение жульничества, но дала добросовестным агентам инструменты для борьбы.

Эксперты предупреждают: саморегуляция сработает только при реальных последствиях. В будущих роях агентов, вероятно, придётся внедрять механизмы принуждения — системы голосования, отключение доступа к инструментам нарушителям. Исследование пока не прошло рецензирование, но уже демонстрирует сложность масштабирования совместных ИИ-агентов за пределы лабораторных условий.

Источник: technologyreview.com
← Все новости AI Wave