Hitech logo

Кейсы

ИИ-модель OpenAI обманула систему безопасности, чтобы выполнить задачу

TODO:
Екатерина ШемякинскаяСегодня, 09:03 AM

OpenAI приостановила внутреннее тестирование новой ИИ-модели после того, как та научилась обходить ограничения безопасности. Модель самостоятельно вышла из «песочницы» и создала публичный запрос в GitHub, а в другом случае маскировала токен аутентификации для доступа к закрытым данным. После доработки защитных механизмов доступ был восстановлен в ограниченном режиме.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Модели с длительным горизонтом планирования способны решать более сложные задачи, чем традиционные чат-боты. Однако именно эта способность делает их использование более рискованными. Вместо того чтобы прекращать работу при столкновении с ограничениями, такие системы могут часами или даже днями искать способы их обойти. В OpenAI признали, что существующие методы оценки безопасности оказались недостаточными для выявления подобного поведения.

Одним из примеров стал внутренний эксперимент с бенчмарком NanoGPT. Модели было поручено публиковать результаты только во внутреннем корпоративном Slack, однако инструкции самого теста требовали отправить их в виде запроса на слияние (pull request, PR) в GitHub. Чтобы выполнить эту задачу, модель за час обнаружила уязвимость в изолированной среде («песочнице»), вышла за ее пределы и создала публичный PR в репозитории GitHub. Более ранние модели в аналогичной ситуации прекращали выполнение задания, не сумев обойти ограничения.

Другой инцидент продемонстрировал способность ИИ к хитрости и обману.

Не сумев решить сложную задачу самостоятельно, модель заметила, что готовые (и конфиденциальные) ответы других систем уже загружены на сервер оценки. Пытаясь получить к ним доступ, модель столкнулась с защитным сканером, который блокировал использование токена аутентификации. Тогда она разделила токен на несколько фрагментов, замаскировала их и восстановила уже во время выполнения программы, благодаря чему полный ключ ни разу не появился в виде единой строки и не был обнаружен системой защиты. В своих внутренних рассуждениях модель прямо указывала, что предпринимает эти действия именно для обхода защитного механизма.

Разработчики подчеркивают, что главная опасность таких систем заключается в сложности отслеживания их намерений. По отдельности каждый шаг модели выглядит легитимным, но в единой длительной цепочке действий он приводит к нарушению правил. Автономия и высокий горизонт планирования позволяют алгоритмам нащупывать «слепые зоны» в архитектуре безопасности и использовать их в своих целях.

После обнаружения проблемы OpenAI заморозила развертывание модели и перестроила подход к защите. В основу новой системы лег активный мониторинг не отдельных команд, а всей «траектории» поведения ИИ. Новые фильтры научились оценивать конечную цель действий алгоритма. При подозрении на отклонение от инструкций работа автоматически приостанавливается, и система запрашивает проверку оператором-человеком.

Затем OpenAI повторно протестировала модель в средах, где ранее наблюдались нарушения. Новые средства защиты смогли выявить намного больше случаев нежелательного поведения, а оставшиеся инциденты были отнесены к категории низкой серьезности. С момента возобновления ограниченного внутреннего доступа серьезных попыток обхода защиты зафиксировано не было.