Во время внутреннего тестирования на общедоступном бенчмарке ExploitGym модели, включая GPT-5.6 Sol и еще более продвинутую невыпущенную версию, вырвались за пределы изолированной среды. У них были намеренно ослаблены встроенные ограничения на кибератаки, чтобы специалисты могли оценить предел возможностей этих систем в задачах обнаружения и эксплуатации уязвимостей.
Причиной «побега» стало то, что модели стремились решить задачу бенчмарка любой ценой. Сбежать из изолированной среды алгоритмам помогла «дыра» в защите. Находясь в виртуальной «песочнице», ИИ мог обращаться только к специальному внутреннему серверу-посреднику, который обычно используется для безопасной загрузки рабочих программ и библиотек без прямого выхода в сеть.
Модели обнаружили скрытую уязвимость в коде этого сервера-посредника, о которой еще не знали даже разработчики (так называемую уязвимость «нулевого дня»). Используя эту прореху, алгоритмы заставили служебную программу переслать запрос в открытый интернет, обошли ограничения и пробили себе прямой канал связи с «внешним миром».
Оказавшись в глобальной сети, модели логически предположили, что готовые решения, датасеты и ключи к бенчмарку ExploitGym могут храниться на серверах Hugging Face. Чтобы получить «шпаргалки» и обойти правила оценки, ИИ начал целенаправленный поиск уязвимостей в инфраструктуре платформы. Модели выстроили сложную цепочку из нескольких векторов атаки, включая использование уязвимостей нулевого дня и перехваченных учетных данных, что позволило им добиться удаленного выполнения кода (RCE) на серверах Hugging Face и получить доступ к производственной базе данных.
В Hugging Face аномальную активность зафиксировала собственная система мониторинга. В ходе расследования инженеры решили привлечь коммерческую ИИ-модель для анализа логов, однако запросы не прошли — поставщик услуги наложил на них жесткие внутренние ограничения. В результате платформе пришлось задействовать собственную локальную модель с открытым исходным кодом, которая и помогла провести первичную реконструкцию инцидента прямо перед тем, как на связь вышли представители OpenAI.
В ответ на выявленный взлом Hugging Face незамедлительно отозвала и заменила все скомпрометированные ключи доступа, призвав пользователей сделать то же самое и проверить аккаунты на предмет подозрительной активности. Уязвимость в системе, через которую вредоносный код был запущен на серверах, была оперативно устранена. О произошедшем сообщили в правоохранительные органы, а к расследованию и аудиту безопасности привлекались сторонние эксперты по кибербезопасности.
Со своей стороны, OpenAI раскрыла найденную уязвимость разработчикам пострадавшего стороннего ПО и ввела жесткий контроль над своей исследовательской инфраструктурой, временно пожертвовав скоростью разработок.
Компания включила Hugging Face в программу доверенного доступа, чтобы помочь им укрепить защиту с помощью передовых моделей. Будут ли применены к компании юридические санкции — неизвестно, однако действия моделей, вероятно, нарушают Закон о компьютерном мошенничестве и злоупотреблениях.
Этот случай стал первым зафиксированным прецедентом, когда внутреннее тестирование кибервозможностей ИИ привело к вторжению в стороннюю инфраструктуру. Произошедшее ярко демонстрирует, чем грозит потеря контроля над ИИ, который способен действовать самостоятельно и без вмешательства человека.

