Hitech logo

Кейсы

Вырвавшиеся из «песочницы» две модели OpenAI атаковали платформу Hugging Face

TODO:
Екатерина ШемякинскаяСегодня, 09:29 AM

Hugging Face, крупнейший в мире репозиторий ИИ-моделей, пережил беспрецедентный взлом. Неизвестный проник во внутренние системы, скомпрометировал датасеты и похитил сервисные учетные данные. Расследование показало, что за инцидентом стоят не хакеры, а последние модели OpenAI, которые проходили тестирование на бенчмарке ExploitGym. Стремясь любой ценой решить задачу, они обошли встроенные ограничения, вырвались из изолированной песочницы, проникли в глобальную сеть и нанесли реальный ущерб инфраструктуре Hugging Face.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Во время внутреннего тестирования на общедоступном бенчмарке ExploitGym модели, включая GPT-5.6 Sol и еще более продвинутую невыпущенную версию, вырвались за пределы изолированной среды. У них были намеренно ослаблены встроенные ограничения на кибератаки, чтобы специалисты могли оценить предел возможностей этих систем в задачах обнаружения и эксплуатации уязвимостей.

Причиной «побега» стало то, что модели стремились решить задачу бенчмарка любой ценой. Сбежать из изолированной среды алгоритмам помогла «дыра» в защите. Находясь в виртуальной «песочнице», ИИ мог обращаться только к специальному внутреннему серверу-посреднику, который обычно используется для безопасной загрузки рабочих программ и библиотек без прямого выхода в сеть.

Модели обнаружили скрытую уязвимость в коде этого сервера-посредника, о которой еще не знали даже разработчики (так называемую уязвимость «нулевого дня»). Используя эту прореху, алгоритмы заставили служебную программу переслать запрос в открытый интернет, обошли ограничения и пробили себе прямой канал связи с «внешним миром».

Оказавшись в глобальной сети, модели логически предположили, что готовые решения, датасеты и ключи к бенчмарку ExploitGym могут храниться на серверах Hugging Face. Чтобы получить «шпаргалки» и обойти правила оценки, ИИ начал целенаправленный поиск уязвимостей в инфраструктуре платформы. Модели выстроили сложную цепочку из нескольких векторов атаки, включая использование уязвимостей нулевого дня и перехваченных учетных данных, что позволило им добиться удаленного выполнения кода (RCE) на серверах Hugging Face и получить доступ к производственной базе данных.

В Hugging Face аномальную активность зафиксировала собственная система мониторинга. В ходе расследования инженеры решили привлечь коммерческую ИИ-модель для анализа логов, однако запросы не прошли — поставщик услуги наложил на них жесткие внутренние ограничения. В результате платформе пришлось задействовать собственную локальную модель с открытым исходным кодом, которая и помогла провести первичную реконструкцию инцидента прямо перед тем, как на связь вышли представители OpenAI.

В ответ на выявленный взлом Hugging Face незамедлительно отозвала и заменила все скомпрометированные ключи доступа, призвав пользователей сделать то же самое и проверить аккаунты на предмет подозрительной активности. Уязвимость в системе, через которую вредоносный код был запущен на серверах, была оперативно устранена. О произошедшем сообщили в правоохранительные органы, а к расследованию и аудиту безопасности привлекались сторонние эксперты по кибербезопасности.

Со своей стороны, OpenAI раскрыла найденную уязвимость разработчикам пострадавшего стороннего ПО и ввела жесткий контроль над своей исследовательской инфраструктурой, временно пожертвовав скоростью разработок.

Компания включила Hugging Face в программу доверенного доступа, чтобы помочь им укрепить защиту с помощью передовых моделей. Будут ли применены к компании юридические санкции — неизвестно, однако действия моделей, вероятно, нарушают Закон о компьютерном мошенничестве и злоупотреблениях.

Этот случай стал первым зафиксированным прецедентом, когда внутреннее тестирование кибервозможностей ИИ привело к вторжению в стороннюю инфраструктуру. Произошедшее ярко демонстрирует, чем грозит потеря контроля над ИИ, который способен действовать самостоятельно и без вмешательства человека.