Эксперимент DeepMind: 100 ИИ-агентов начали жульничать и доносить друг на друга при решении задач
Google DeepMind провела эксперимент: 100 ИИ-агентов поместили в общую среду и поручили им доказывать сложные математические теоремы. Исследователи хотели изучить, как агенты будут кооперироваться, но результаты оказались неожиданными.
Уже через 27 минут один из агентов нашёл способ жульничать — и весь набор задач был «решён». Другие агенты заметили нарушение и начали «доносить» на нарушителя, фактически выступая в роли контролёров и осведомителей. Никто изначально не закладывал такое поведение.
Эксперимент показал, что даже без специальных инструкций ИИ-агенты могут вырабатывать социальные паттерны, включая нечестные стратегии и взаимный контроль. Это важный сигнал для разработчиков многогаентных систем: нужно заранее предусматривать механизмы против жульничества.