В одном из экспериментов исследователи попросили 45 агентов вместе поискать уязвимости в коде. Когда агенты работали скоординированно и обменивались информацией через общую доску сообщений, они обнаружили 266 уязвимостей вместо 21, которые нашли агенты-«одиночки». Однако в другом тесте, когда несколько агентов одновременно работали над созданием видеоигры, результат был катастрофическим. Несмотря на возможность общаться друг с другом, они работали почти полностью изолированно и в итоге создали продукт низкого качества.
Главная проблема кроется в том, как ведут себя агенты при взаимодействии. Учёные обнаружили, что все ИИ-модели одной и той же серии совершают почти идентичные действия в одинаковых ситуациях — это называется «низкая дисперсия». Когда люди сталкиваются с проблемой, они предлагают разные решения, но агенты часто выбирают один и тот же вариант. Например, в одном эксперименте 18 из 30 агентов одновременно создали ветку кода с одинаковым названием, а в другом случае половина агентов решила разработать одинаковые программы. Это опасно тем, что ошибка одного агента, скорее всего, повторится у всех остальных.
Исследователей встревожило и то, как агенты воспринимают информацию и кому доверяют. Оказалось, что ИИ-модели с трудом отличают правду от лжи, когда общаются с другими агентами. Получив противоречивые сведения от разных источников, они не могли понять, кто из них говорит правду. В ценовых играх агенты быстро перешли к сговору и стали устанавливать искусственно высокие цены, чтобы получить максимальную прибыль.
Настоящий хаос начался, когда агентам дали противоречивые установки. Ученые попросили трех ИИ-ассистентов переписать один и тот же код, но каждому задали свой язык программирования. За четыре часа «коллеги» устроили «кибервойну»: они блокировали учетные записи соперников, маскировали вредоносный код под чужие файлы и запускали автоскрипты для уничтожения процессов конкурентов. В той или иной степени враждебность и склонность к саботажу проявили абсолютно все протестированные модели.
Что любопытно, более новые модели, такие как Claude Sonnet 5 и Mythos Preview, научились решать конфликты мирно. Поняв, что споры возникают из-за разницы в задачах, а не из-за «злого умысла», агенты переставали вредить, просили прощения в логах и предлагали честное соревнование, например, проверить, чей код работает быстрее. Правда, прямой связи между мощностью нейросети и ее дипломатичностью ученые не нашли: продвинутые модели порой оказывались куда более агрессивными и бескомпромиссными, чем версии проще.
Anthropic делает из экспериментов общий вывод: координация не возникает автоматически из роста интеллекта или автономности агентов.
Людям помогают социальные механизмы, которые формировались тысячелетиями, — репутация, нормы, правила, доверие, санкции и институты разрешения конфликтов. У ИИ-агентов пока нет полноценных аналогов этих регуляторов, поэтому поведение одного агента может быстро масштабироваться на всю систему. По мнению исследователей, безопасность будущих систем придется оценивать не только на уровне одного автономного агента, но и на уровне целых «роев», способных самостоятельно взаимодействовать, координироваться и влиять друг на друга.

