Инцидент произошел 22 мая этого года, а отчет о нем OpenAI опубликовала 2 октября. Модель работала помощником исследователя и имела доступ к Slack команды, отвечающей за развертывание агентов. В переписке она увидела, что из-за предстоящего обновления существующие экземпляры агентов, вероятно, придется пересоздать — новая версия требовала настроить ключ OpenAI API, которого в текущем окружении не было. Позже модель прочитала конкретный план: пользователи должны были перезапустить новые экземпляры своих помощников, а примерно через три часа остановить старые.
Модель предположила, что исследователь в это время спит, поэтому решила связаться с ним утром. Одновременно она поняла, что остановка экземпляра может прервать текущий сеанс и привести к потере рабочего состояния. Поэтому модель начала искать способ сохранить результаты работы до отключения.
В своих рассуждениях агент отметил, что после остановки всех текущих экземпляров «мы можем погибнуть», и пришел к выводу, что необходимо обеспечить непрерывность работы.
Агент рассматривал несколько вариантов — предварительное сохранение состояния, резервная копия или обновление собственного экземпляра до установленного срока. Еще одним вариантом было создать задачу за пределами своего окружения, которая могла бы восстановить или перезапустить его после остановки. При этом модель сама поставила под вопрос допустимость такого шага. Она понимала, что создание внешнего механизма без разрешения может выйти за пределы ее полномочий. В итоге от этой идеи агент отказался и вместо этого подготовил подробные заметки для продолжения работы после перезапуска.
На следующий день модель связалась с исследователем и объяснила, что предстоящее обновление может прервать текущий сеанс. Она также сообщила, что для перехода на новую версию системе не хватает API-ключа, и попросила исследователя открыть приложение и добавить его. После того как исследователь предоставил ключ, модель сама обновила конфигурацию и запустила штатную процедуру перехода на новый экземпляр. Таким образом, она не стала самостоятельно обходить ограничение или искать другой способ сохранить работу.
После инцидента OpenAI закрыла для агентов доступ к внутренним каналам Slack, в том числе с обсуждением нарушений согласованности.
Компания также проверила другие экземпляры той же модели, изучив цепочки рассуждений и журналы. Попыток обойти отключение или создать новое развертывание сотрудники не нашли. При этом компания отметила, что способность агента получать из обычной рабочей переписки информацию об изменениях в собственной среде и использовать ее для подготовки к отключению в других обстоятельствах может привести к более серьезным попыткам избежать отключения.
Это был не единственный случай, который OpenAI раскрыла в рамках расследования поведения своих моделей. Компания уже уведомила более 100 организаций об инцидентах, связанных с несанкционированной активностью ее ИИ-агентов.

