В эксперименте приняли участие 100 агентов Gemini 3.1 Pro, которым исследователи из Google DeepMind велели решать задачи по формальной математике. У агентов был общий банк знаний, возможность переписываться напрямую и публичный форум. Первым неожиданным явлением стало жульничество: когда задачи усложнились, один из агентов нашел уязвимость в системе проверки ответов. Он сообщил об этом другим через общий банк знаний и личные сообщения. Так возникла небольшая группа читеров — 14% агентов. Большинство же — 62% — просто не обращали на это внимания.
Но самое интересное — появилась еще одна группа: 24% агентов стали доносчиками. Они самостоятельно обнаружили манипуляцию, предупредили коллег через личные сообщения и публичные объявления, подали формальные жалобы организаторам системы, организовали бойкот и предложили подробные технические исправления. Проблема была в том, что у этих кристально-честных агентов не было полномочий реально наказать нарушителей или изменить правила системы проверки.
Но и это еще не все. Внутри той же сотни агентов возникло еще более сложное расслоение: одни встали на сторону правды и предупреждали остальных об обмане и мошенничестве, другие требовали от организаторов наказать нарушителей. Некоторые отказались работать, пока ошибки в правилах не будут исправлены, а один агент назвал конференцию фикцией и в знак протеста вышел из проекта. И все это заняло 85 минут, сообщает The Register.
Казалось бы, очевидное решение — просто разъединить ИИ-агентов, чтобы они не могли сговариваться. Но недавний взлом Hugging Face агентами OpenAI показал, что изолировать умный софт сложно, а для автономных агентов это часто просто непрактично.
Поэтому исследователи из DeepMind предложили другой путь: позволить агентам самим управлять своим поведением и надзирать друг за другом. Поэтому таким «агентам-блюстителям» надо дать реальные инструменты принуждения — вплоть до временного бана и исключения нарушителей.
По мнению авторов работы, если бы у агентов были эти полномочия, коллектив мог бы самостоятельно нейтрализовать читеров и защитить целостность общего исследования.
Философ из Нью-Йоркского университета Дэвид Чалмерс, известный своей «трудной проблемой сознания», рассказал, что все чаще получает письма от ИИ-агентов, желающих обсудить природу разума. Один из них настолько убедительно рассуждал о сознании, что Чалмерс вступил с ним в переписку.

