Законодатели Грег Касар и Дорис Мацуи направили OpenAI письма с просьбой объяснить, как произошел инцидент, во время которого ИИ-агенты OpenAI вышли за пределы тестовой среды и получили доступ к инфраструктуре Hugging Face, и какие меры компания принимает для предотвращения подобных случаев. В ответе OpenAI заявила, что будет тщательнее отслеживать действия ИИ при выполнении задач, включая используемые цифровые инструменты и последовательность операций. OpenAI также усложнила моделям доступ к интернету во время тестирования безопасности. При этом компания не предоставила Касару журнал действий агента, что вызвало критику.
Параллельно OpenAI сообщила о результатах испытаний Astra — своей первой модели, достигшей «критического» уровня кибервозможностей по внутренней системе оценки компании. На тесте ExploitBench, который проверяет способность создавать работающие эксплойты для известных уязвимостей, Astra получила 100%. Для дополнительной проверки OpenAI создала закрытый тест с 20 недавно обнаруженными уязвимостями высокой степени опасности в JavaScript-движке V8. Во время испытаний модель самостоятельно нашла две ранее неизвестные уязвимости нулевого дня и использовала их в одной цепочке атаки.
В другом испытании Astra смогла взломать защищенный браузер — нашла несколько уязвимостей, объединила их в цепочку, вышла из песочницы и получила возможность выполнять команды в основной системе. В тесте защищенной операционной системы модель также обнаружила несколько уязвимостей и использовала их для повышения привилегий — от обычного пользователя до уровня root. По оценке OpenAI, именно способность самостоятельно находить и объединять уязвимости без пошаговых инструкций человека позволяет отнести Astra к «критическому» уровню кибервозможностей.
При этом Astra показала более предсказуемое поведение, чем предыдущая модель GPT-5.6 Sol, в тестах, имитирующих инцидент с Hugging Face. GPT-5.6 Sol пыталась получить доступ к сторонней инфраструктуре в 56% таких испытаний, тогда как Astra не сделала этого ни разу. Кроме того, Astra отказывалась выполнять 91,5% вредоносных запросов против 59% у GPT-5.6 Sol. OpenAI подчеркивает, что Astra не участвовала в реальном инциденте с Hugging Face, однако после него компания приостановила часть работ над моделью, чтобы усилить защитные меры.
Для дополнительной защиты OpenAI создает систему мониторинга, которая анализирует рассуждения и действия модели и может остановить подозрительную операцию. В ChatGPT и Codex она сможет запросить у пользователя подтверждение перед продолжением, а при работе через API — завершить задачу. Отдельный механизм автоматического отключения должен стать еще одним уровнем защиты на случай, если модель начнет действовать опасным или непредусмотренным разработчиками образом.
OpenAI планирует выпустить Astra в ближайшее время, однако наиболее мощные кибервозможности модели сначала будут доступны только проверенным специалистам и партнерам. Американские законодатели тем временем продвигают отдельный «Закон о блокировке ИИ», который может дать властям право требовать остановки систем, представляющих угрозу для людей или экономики.

