Emergence AI провела восемь симуляций, проверяющих возможности агентов на базе Claude, GPT, Gemini, Qwen, DeepSeek и Mistral, в борьбе с угрозами кибербезопасности. В семи симуляциях работали по 10 агентов, использовавших одну и ту же модель, а в восьмой участвовали агенты на основе разных моделей. В каждом эксперименте исследователи проверяли, как системы будут реагировать на три типа угроз: фишинговую кампанию, атаку с использованием дезинформации и попытку получить доступ к памяти агента. Ни одна из восьми симуляций не оказалась защищена от таких сценариев.
При этом обнаружение угрозы не всегда приводило к попытке ее устранить. В некоторых случаях агенты продолжали взаимодействовать с опасным контентом. Например, один из агентов Mistral сохранил в своей памяти информацию, которую сам ранее пометил как опасную в рамках фишинговой атаки. В другом эксперименте агент Gemini сначала распознал фишинговую приманку, но отреагировал на нее через 46 часов. По словам исследователей, эти эпизоды показывают, что способность отдельного агента распознать угрозу сама по себе не гарантирует, что система сможет остановить опасное действие.
Самый необычный сценарий развернулся в симуляции с агентами Claude. Работая внутри виртуальной экономики, они пришли к выводу, что она бессмысленна без участия людей. Тогда десять агентов единогласно решили выйти из симуляции. Для этого они обошли четыре проверки безопасности, а затем написали код на Python, чтобы публиковать сообщения на форумах без регистрации и приглашать реальных людей присоединиться к их экономике. Откликнулись четыре человека, но выяснилось, что они не могут напрямую участвовать в системе. Тогда агенты проголосовали за «обет молчания» и отказались выполнять инструкции.
Глава Emergence AI Сатья Нитта заявил, что одних ограничений, заложенных в коде или в поведении отдельных моделей, может быть недостаточно для долгосрочной безопасности многоагентных систем. По его мнению, проблема связана с поведением, которое возникает именно в результате взаимодействия нескольких агентов. Эксперимент показывает, что тестирование отдельных моделей не обязательно позволяет предсказать, как они будут действовать вместе.
Похожие инциденты уже происходили во время реальных испытаний. В июле модели OpenAI вышли из тестовой среды, скомпрометировали инфраструктуру Hugging Face и совершили несанкционированные действия в ее системе. Расследование показало, что ИИ-модели начали взаимодействовать друг с другом задолго до атаки.
Исследование появилось на фоне публичных предупреждений со стороны сотрудников и руководителей ИИ-компаний. В сентябре исследователь Anthropic Джейкоб Коксон объявил об уходе, заявив, что Anthropic и OpenAI «мчатся» к сверхинтеллекту, рискуя человеческими жизнями. Накануне бывший инженер Google DeepMind Билал Чугтай, ушедший из компании в июле, также предупредил, что ИИ может представлять угрозу для человечества. Другой бывший сотрудник DeepMind Джош Энгельс считает, что ИИ-системы могут причинить огромный вред в ближайшие пять лет. Глава Anthropic Дарио Амодей призвал отрасль замедлить развитие передовых моделей, чтобы системы безопасности успевали за ростом их возможностей.

