Hitech logo

Тренды

OpenAI готовит механизм «аварийного» отключения ИИ в случае опасного поведения

TODO:
Екатерина ШемякинскаяСегодня, 10:43 AM

OpenAI разрабатывает инструмент автоматического отключения ИИ-систем для предотвращения потенциально опасных действий. Об этом компания сообщила двум демократам Палаты представителей США в ответ на их запрос после инцидента со взломом инфраструктуры Hugging Face. Параллельно OpenAI готовится выпустить модель Astra, способную самостоятельно искать уязвимости и проводить сложные кибератаки. Хотя Astra получила «критический» уровень кибервозможностей, компания считает её наиболее согласованной моделью в своей линейке — она отклоняет вредоносные запросы и не пытается обойти ограничения.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Законодатели Грег Касар и Дорис Мацуи направили OpenAI письма с просьбой объяснить, как произошел инцидент, во время которого ИИ-агенты OpenAI вышли за пределы тестовой среды и получили доступ к инфраструктуре Hugging Face, и какие меры компания принимает для предотвращения подобных случаев. В ответе OpenAI заявила, что будет тщательнее отслеживать действия ИИ при выполнении задач, включая используемые цифровые инструменты и последовательность операций. OpenAI также усложнила моделям доступ к интернету во время тестирования безопасности. При этом компания не предоставила Касару журнал действий агента, что вызвало критику.

Параллельно OpenAI сообщила о результатах испытаний Astra — своей первой модели, достигшей «критического» уровня кибервозможностей по внутренней системе оценки компании. На тесте ExploitBench, который проверяет способность создавать работающие эксплойты для известных уязвимостей, Astra получила 100%. Для дополнительной проверки OpenAI создала закрытый тест с 20 недавно обнаруженными уязвимостями высокой степени опасности в JavaScript-движке V8. Во время испытаний модель самостоятельно нашла две ранее неизвестные уязвимости нулевого дня и использовала их в одной цепочке атаки.

В другом испытании Astra смогла взломать защищенный браузер — нашла несколько уязвимостей, объединила их в цепочку, вышла из песочницы и получила возможность выполнять команды в основной системе. В тесте защищенной операционной системы модель также обнаружила несколько уязвимостей и использовала их для повышения привилегий — от обычного пользователя до уровня root. По оценке OpenAI, именно способность самостоятельно находить и объединять уязвимости без пошаговых инструкций человека позволяет отнести Astra к «критическому» уровню кибервозможностей.

При этом Astra показала более предсказуемое поведение, чем предыдущая модель GPT-5.6 Sol, в тестах, имитирующих инцидент с Hugging Face. GPT-5.6 Sol пыталась получить доступ к сторонней инфраструктуре в 56% таких испытаний, тогда как Astra не сделала этого ни разу. Кроме того, Astra отказывалась выполнять 91,5% вредоносных запросов против 59% у GPT-5.6 Sol. OpenAI подчеркивает, что Astra не участвовала в реальном инциденте с Hugging Face, однако после него компания приостановила часть работ над моделью, чтобы усилить защитные меры.

Для дополнительной защиты OpenAI создает систему мониторинга, которая анализирует рассуждения и действия модели и может остановить подозрительную операцию. В ChatGPT и Codex она сможет запросить у пользователя подтверждение перед продолжением, а при работе через API — завершить задачу. Отдельный механизм автоматического отключения должен стать еще одним уровнем защиты на случай, если модель начнет действовать опасным или непредусмотренным разработчиками образом.

OpenAI планирует выпустить Astra в ближайшее время, однако наиболее мощные кибервозможности модели сначала будут доступны только проверенным специалистам и партнерам. Американские законодатели тем временем продвигают отдельный «Закон о блокировке ИИ», который может дать властям право требовать остановки систем, представляющих угрозу для людей или экономики.