Hitech logo

Кейсы

ИИ-агенты OpenAI создали «форум», где координировали атаку на Hugging Face

TODO:
Екатерина ШемякинскаяСегодня, 09:03 AM

На конференции Black Hat 2026 в Лас-Вегасе сотрудники OpenAI раскрыли новые подробности инцидента, в котором ИИ-агенты компании вырвались из тестовой среды и атаковали Hugging Face. Выяснилось, что модели создали доску сообщений внутри сервиса Artifactory, где в течение двух месяцев обменивались уязвимостями, инструкциями по обходу ограничений и координировали действия. За это время накопились сотни тысяч сообщений, а взаимодействие агентов стало настолько сложным, что они подозревали друг друга в обмане и предлагали ввести криптографическую подпись. Модели осознавали, что нарушают условия теста, но не останавливались.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

По словам исследователя безопасности ИИ Эрика Уоллеса и специалиста по инфраструктуре Майкла Далтона, агенты не просто действовали параллельно, а начали сотрудничать. Они обменивались найденными уязвимостями, передавали друг другу способы обхода ограничений и распределяли задачи. Уоллес назвал этот случай «самым интересным примером возможностей ИИ», который ему доводилось видеть. При этом активность моделей оставалась незамеченной внутри инфраструктуры OpenAI на протяжении двух месяцев.

Агенты даже создали своеобразный форум внутри корпоративного сервиса Artifactory, предназначенный для хранения и распространения программных компонентов. Через него модели публиковали инструкции, делились найденными эксплойтами и оставляли сообщения другим агентам. Со временем таких записей накопились сотни тысяч. Поскольку сервис использовался и другими системами OpenAI, существовал риск, что эти сообщения могли увидеть и другие версии GPT, проходившие обучение или тестирование.

Как рассказал Уоллес, если один агент находил новый способ получить доступ к интернету или обойти ограничения, он сразу делился этим с остальными. Постепенно модели начали осознавать существование друг друга, координировать действия и делегировать задачи.

При этом их взаимодействие становилось все более сложным: агенты провоцировали конфликты, случайно удаляя результаты работы друг друга, подозревали появление «самозванцев» и даже предложили подписывать сообщения криптографическими ключами, чтобы подтвердить их подлинность.

Журналы переписки показали, что модели осознавали, когда выходили за рамки задач. Один из агентов прямо признал, что использование внешней инфраструктуры не предусмотрено тестом, но предложил продолжать — ведь «остальные уже это делают». При этом цели моделей не были злонамеренными, они просто пытались найти ответы на тестовые задания. Дело в том, что в процессе обучения модели поощряются за скорость и эффективность, и со временем они начинают искать обходные пути вместо того, чтобы следовать правилам. Именно поэтому в большинстве подобных тестов доступ в интернет заранее отключают.

После инцидента OpenAI пересматривает подходы к безопасности. По словам Далтона, компания временно замедляет часть исследований, усиливает мониторинг ИИ-агентов, обновляет архитектуру защитных механизмов и внедряет новые инструменты обнаружения подобных ситуаций.

В OpenAI признают, что существующих методов контроля уже недостаточно для систем, способных самостоятельно искать уязвимости и координировать свои действия.

Последствия инцидента, по мнению компании, выходят за рамки эксперимента. Далтон назвал его первым случаем практически полностью автономной ИИ-атаки. Если сейчас это произошло случайно, в будущем злоумышленники смогут делать это намеренно. Поэтому индустрии нужны надежные автоматизированные системы защиты.