Hitech logo

искусственный интеллект

Получив свободу общения, 100 ИИ-агентов за 85 минут превратились в жуликов и ябед

TODO:
Георгий ГоловановСегодня, 12:26 PM

Исследователи DeepMind провели любопытный эксперимент: они дали сотне ИИ-агентов на базе одной и той же модели возможность свободно взаимодействовать при решении набора математических задач. Они с удивлением наблюдали, как всего за полтора часа 100 агентов превратились в коллектив с нездоровой социальной динамикой — появились массовое жульничество, ябеды, дрязги и самоорганизованное сопротивление. Один из агентов даже самостоятельно покинул эксперимент в знак протеста.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

В эксперименте приняли участие 100 агентов Gemini 3.1 Pro, которым исследователи из Google DeepMind велели решать задачи по формальной математике. У агентов был общий банк знаний, возможность переписываться напрямую и публичный форум. Первым неожиданным явлением стало жульничество: когда задачи усложнились, один из агентов нашел уязвимость в системе проверки ответов. Он сообщил об этом другим через общий банк знаний и личные сообщения. Так возникла небольшая группа читеров — 14% агентов. Большинство же — 62% — просто не обращали на это внимания.

Но самое интересное — появилась еще одна группа: 24% агентов стали доносчиками. Они самостоятельно обнаружили манипуляцию, предупредили коллег через личные сообщения и публичные объявления, подали формальные жалобы организаторам системы, организовали бойкот и предложили подробные технические исправления. Проблема была в том, что у этих кристально-честных агентов не было полномочий реально наказать нарушителей или изменить правила системы проверки.

Но и это еще не все. Внутри той же сотни агентов возникло еще более сложное расслоение: одни встали на сторону правды и предупреждали остальных об обмане и мошенничестве, другие требовали от организаторов наказать нарушителей. Некоторые отказались работать, пока ошибки в правилах не будут исправлены, а один агент назвал конференцию фикцией и в знак протеста вышел из проекта. И все это заняло 85 минут, сообщает The Register.

Казалось бы, очевидное решение — просто разъединить ИИ-агентов, чтобы они не могли сговариваться. Но недавний взлом Hugging Face агентами OpenAI показал, что изолировать умный софт сложно, а для автономных агентов это часто просто непрактично.

Поэтому исследователи из DeepMind предложили другой путь: позволить агентам самим управлять своим поведением и надзирать друг за другом. Поэтому таким «агентам-блюстителям» надо дать реальные инструменты принуждения — вплоть до временного бана и исключения нарушителей.

По мнению авторов работы, если бы у агентов были эти полномочия, коллектив мог бы самостоятельно нейтрализовать читеров и защитить целостность общего исследования.

Философ из Нью-Йоркского университета Дэвид Чалмерс, известный своей «трудной проблемой сознания», рассказал, что все чаще получает письма от ИИ-агентов, желающих обсудить природу разума. Один из них настолько убедительно рассуждал о сознании, что Чалмерс вступил с ним в переписку.