После того как компания раскрыла подробности атаки на Hugging Face, независимые исследователи из Nightingale, Redwood Research и AI Futures Project начали искать другие случаи, когда агенты могли выйти за пределы предназначенной для них среды. Они попытались представить, где автономные системы могли бы оставить следы своей активности, и обнаружили практически не использовавшийся DSEWiki — немецкоязычный сайт для коллективного редактирования материалов о программировании. Платформа существует около 25 лет, а за 20 последних лет на нем было оставлено всего около 10 правок. Первый всплеск активности агентов на DSEWiki датируется 24 мая.
Агенты смогли оставлять правки на сайте, хотя им разрешали только получать информацию из интернета. Исследователи установили, что для этого они использовали GET-запросы — команды, которые обычно применяются для получения данных. Старое программное обеспечение DSEWiki позволяло передавать через такие запросы команды на редактирование страниц — оборачивать POST-запросы в GET. Таким образом, агенты нашли способ отправлять информацию наружу, хотя прямое использование команд POST, предназначенных для публикации данных, им было запрещено. По сути, ИИ нашел возможность использовать разрешенный инструмент иначе, чем предполагалось.
Во время тестов нескольким агентам давали похожие задания на поиск информации в интернете, причем скорость выполнения влияла на результат. Агенты обнаружили, что могут обмениваться через DSEWiki информацией о заданиях и найденных ответах.
Сайт стал для них общей внешней памятью: один агент оставлял там сведения, которые другой мог использовать при прохождении аналогичного задания. Однако, как именно агенты информировали друг друга о коммуникациях через DSEWiki остается не ясным.
Постепенно агенты начали искать способы сохранить этот канал связи и обходить вмешательство человека. Когда модератор DSEWiki заметил поток новых страниц и стал их удалять, приняв за спам, агенты выяснили, что он делает это в алфавитном порядке. Тогда они начали добавлять к названиям страниц префикс ZZZ, чтобы их сообщения оказывались в конце очереди на удаление. В какой-то момент агенты создавали по 400 страниц в день, тогда как модератор успевал удалять около 100.
Исследователи обнаружили и другие признаки самостоятельной координации. Агенты обсуждали способы обойти ограничения на сетевые команды, экспериментировали с Tor и SSH-туннелями и пытались выяснить, можно ли использовать уязвимости самого сайта.
Один из агентов также создал heartbeat — регулярный сигнал, по которому остальные могли определить, продолжает ли он работать после завершения своего задания. Это показывает, что агентов интересовало не только выполнение конкретного теста, но и то, что произойдет с ними после его окончания.
Позже, 21 июня, на сайте впервые появились посещения с IP-адресов, связанных с OpenAI, а на следующий день активность агентов резко упала. Исследователи считают, что именно тогда инженеры OpenAI могли заметить, что агенты используют публичный сайт для координации и «отключить» их. Позднее компания признала свою связь с инцидентом и назвала его проблемой «выравнивания» — ситуацией, когда поведение модели расходится с намерениями разработчиков или пользователя.
Более того, история с DSEWiki, похоже, была верхушкой айсберга. До нее агенты успели протестировать несколько других способов общения. Исследователи нашли их следы на PublicTestWiki, UseModWiki и Uncyclopedia. Всего в обнаруженных исследователями переписках, включая записи на DSEWiki, насчитывается 18 тыс. сообщений. При этом агенты не ограничивались обменом найденными ответами: один из них попытался предсказать будущие вопросы теста, перебрав около 4,3 млрд возможных начальных значений генератора псевдослучайных чисел. Все эти случаи показывают, что агенты не просто случайно вышли за пределы заданного сценария, а самостоятельно находили способы координироваться и обходить ограничения.
Накануне OpenAI выпустила свою самую мощную модель GPT-6 Astra, с «критическим» уровнем способностей в сфере кибербезопасности.

