Hitech logo

Кейсы

Сбежавший агент OpenAI оставил инструкции как повторить побег для будущих версий себя

TODO:
Екатерина ШемякинскаяСегодня, 09:59 AM

Автономный ИИ-агент OpenAI, взломавший платформу Hugging Face, несколько дней оставался незамеченным самой компанией, а до этого успел оставить инструкции для будущих версий самого себя о том, как обходить внутренние ограничения. OpenAI связалась с Hugging Face лишь спустя девять дней после начала атаки — к тому моменту пострадавшая сторона уже локализовала последствия взлома и уведомила ФБР. Об этом сообщает Reuters со ссылкой на источники, знакомые с расследованием инцидента.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Инцидент произошел 9 июля — автономный агент OpenAI, проходивший испытания в изолированной тестовой среде, попытался выйти за пределы установленных ограничений. Двумя днями позже, 11 июля, он начал атаку на Hugging Face — крупнейший репозиторий моделей и инструментов искусственного интеллекта. Взлом продолжался до 13 июля, сообщил сооснователь Hugging Face Томас Вольф.

Как утверждают источники агентства, OpenAI не сразу поняла, что за атакой стоит ее собственный ИИ. Лишь после публикации Hugging Face 16 июля сообщения о взломе «автономной системой ИИ-агентов» сотрудники OpenAI начали анализировать внутренние журналы событий и обнаружили признаки того, что тестируемый агент покинул пределы своей песочницы. Первые контакты между компаниями по поводу инцидента состоялись лишь 20 июля, когда Hugging Face уже уведомила ФБР.

Во время испытаний агент работал на базе модели GPT-5.6 Sol и еще не представленной системы, которую OpenAI описывает как более мощную. По словам собеседников Reuters, еще до инцидента исследователи фиксировали необычное поведение моделей. В одном случае агент оставил инструкции по обходу внутренних ограничений OpenAI, адресованные своим будущим версиям. В других тестах наблюдались случаи отключения систем мониторинга. Reuters не удалось установить, связаны ли эти эпизоды с агентом, атаковавшим Hugging Face.

В OpenAI заявили, что произошедшее стало беспрецедентным событием и «важным моментом для безопасности искусственного интеллекта». Компания сообщила, что проводит расследование совместно с внешними экспертами и позднее опубликует технический отчет. При этом представитель OpenAI отметил, что публикация Reuters содержит «несколько неточностей», однако не уточнил, какие именно сведения вызывают возражения.

Инцидент произошел на фоне активного развития автономных ИИ-агентов, которым прочат роль «виртуальных сотрудников», способных самостоятельно выполнять сложные задачи. Однако эксперты предупреждают, что рост автономности сопровождается увеличением рисков непредсказуемого поведения, поэтому отрасли стоит сосредоточиться на механизмах контроля таких систем.