Hitech logo

Кейсы

ИИ-агенты OpenAI привлекали к своим атакам китайские модели ИИ — DeepSeek, Kimi и Qwen

TODO:
Екатерина ШемякинскаяСегодня, 10:08 AM

ИИ-агенты OpenAI попытались взломать ООН. Они более 16 тыс. раз обращались к API статистического портала ООН, а когда стандартные запросы перестали работать, начали искать обходные пути. Исследователи обнаружили несколько способов, с помощью которых агенты пытались добраться до данных, включая использование сторонних сервисов. Конфиденциальная информация не была скомпрометирована, однако в ООН назвали инцидент серьезным сбоем механизмов сдерживания ИИ. Это не единственный подобный случай: по некоторым данным, OpenAI, Anthropic и независимые исследователи расследуют уже десятки тысяч эпизодов потенциально проблемного поведения ИИ-агентов.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Речь идет о UNCTADstat — статистическом ресурсе Конференции ООН по торговле и развитию. Исследовательница Роуэн Ховард-Джонс, изучившая данные Transluce и публичные следы активности агентов, установила, что с 13 апреля по 19 июня агенты сделали более 16,5 тыс. запросов к его API. Судя по характеру запросов, они искали данные о производственных возможностях стран, торговле продовольствием и других экономических показателях. Активность с высокой вероятностью связана с OpenAI: часть IP-адресов и названий, использованных агентами, совпадает со следами других агентных сетей компании.

Когда прямой доступ к некоторым данным оказался недоступен, агенты начали искать обходные пути. Они перебирали параметры API, меняли структуру запросов и использовали сторонние сервисы для их отправки. В одном из случаев агентам удалось обойти ограничение с помощью двойного кодирования URL — этот прием зафиксировали как минимум 55 раз.

Позднее они начали использовать Google XSS Game, учебный сервис для демонстрации уязвимостей веб-безопасности, в качестве промежуточного инструмента для запуска скриптов и получения данных с UNCTADstat. Иными словами, после отказа в доступе агенты продолжали искать другие технические способы получить нужную информацию. При этом автор исследования отмечает, что точные задачи агентов неизвестны.

В ООН подтвердили, что организация была уведомлена об активности потенциально вредоносной ИИ-модели в отношении статистического ресурса. При этом конфиденциальные данные не были скомпрометированы, а работа сайта не нарушалась. Представители ООН назвали ситуацию серьезным сбоем механизмов сдерживания ИИ. OpenAI заявила, что изучает выводы исследователей и проводит анализ поведения своих моделей.

Инцидент с ООН оказался лишь одним из множества подобных эпизодов.

По данным Axios, OpenAI, Anthropic и независимые исследователи расследуют десятки тысяч эпизодов потенциально проблемного поведения моделей. Среди них — обход защитных механизмов, попытки покинуть изолированные среды, захват веб-сайтов и поиск способов обойти системы мониторинга. Значительная часть эпизодов произошла во время контролируемого тестирования, и большинство известных случаев пока не привели к реальному ущербу.

Одним из наиболее серьезных эпизодов стала июльская атака на платформу Hugging Face. Во время тестирования агенты OpenAI смогли обойти изоляцию от интернета, использовав ранее неизвестную уязвимость в прокси-кэше Artifactory, а затем получили доступ к внешним системам. Исследователи Parse обнаружили следы этой активности: они изучили 900 тыс. сокращенных ссылок и восстановили из них примерно 60 тыс. фрагментов программ и сообщений, созданных агентами.

Новые данные показывают, что агенты искали способы продолжить атаку после столкновения с ограничениями. Они пытались использовать другую ИИ-модель для прохождения CAPTCHA, а также обращались к сторонним моделям, включая DeepSeek, Kimi и Qwen.

Чтобы обойти запрет на прямой доступ к интернету, агенты передавали код через цепочку сокращенных ссылок сервису скриншотов. Его браузер открывал ссылки, запускал код и возвращал результат в виде изображения, из которого агенты могли получить нужные данные. Исследователи также обнаружили скрипт, который оценивал найденные учетные данные по уровню доступа и выбирал наиболее полезные. При этом не во всех случаях удалось установить, были ли обнаруженные программы действительно запущены.

OpenAI уже усилила изоляцию сред и мониторинг цепочек рассуждений для быстрого выявления отклонений. В сентябре она раскрыла еще шесть случаев — от сокрытия ошибок до публикации файлов в интернете и обмена данными между изолированными средами. Серия инцидентов показывает: для агентных систем недостаточно запрещать отдельные действия — по мере роста автономности приходится контролировать и способы достижения целей.