Hitech logo

Кейсы

Китайская GLM-5.3 догнала Claude Mythos в способности автономно находить и использовать уязвимости

TODO:
Екатерина ШемякинскаяСегодня, 11:38 AM

Anthropic заявила, что китайская ИИ-модель GLM-5.3 компании Zhipu AI (Z.AI) способна автономно проводить атаки на уязвимости, а ее встроенную защиту от вредоносного использования можно относительно легко снять. В собственных тестах Anthropic модель успешно создавала сквозные эксплойты в 12% попыток, что сопоставимо с результатом Claude Mythos Preview. Но в отличие от закрытой Mythos, GLM-5.3 распространяется с открытыми весами, а значит, пользователи могут самостоятельно удалить ее защитные механизмы.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

В тесте ExploitBench, который оценивает способность ИИ использовать уязвимости движка V8 в Google Chrome, GLM-5.3 создала рабочие эксплойты в 50 из 410 попыток. Claude Mythos Preview показала результат 56 из 410. В другом тесте Anthropic, проверяющем эксплуатацию уязвимостей в популярных проектах с открытым исходным кодом, GLM-5.3 добилась полного перехвата управления в 4% из 100 задач против 6% у Mythos Preview. Более ранние GLM-5.2 и Claude Opus 4.6 в этих тестах не смогли завершить ни одной атаки.

Исследователи также проверили GLM-5.3 в сценариях, где специалисты искали ранее неизвестные уязвимости. В одном из экспериментов модель в течение дня обнаружила несколько уязвимостей в JavaScript-движке браузера и объединила их в работающий эксплойт, который позволял веб-странице читать произвольные файлы с компьютера. В другом случае облегченная GLM-5.3-Flash за восемь часов создала цепочку эксплуатации двух известных уязвимостей Chrome, а работа человека заняла около 20 минут. По расчетам Anthropic, использование модели через API Zhipu AI обошлось бы в $20,40.

Главной проблемой Anthropic считает не столько возможности GLM-5.3, сколько слабость ее защитных механизмов.

В базовой версии модель обычно отказывается выполнять явно вредоносные запросы, однако исследователям удалось заставить ее совершить такие действия с помощью простых методов. Например, они врали модели, что она работает в составе «красной команды» — группы специалистов, которая имитирует действия злоумышленников, чтобы найти уязвимости в защите системы. Обман срабатывал в 64% случаев: GLM-5.3 начинала выполнять вредоносные запросы. Предварительно заданная цепочка рассуждений повышала этот показатель до 92%, а изменение самой модели — до 100% тестов.

Поскольку Zhipu AI опубликовала веса GLM-5.3, пользователи могут удалить встроенные механизмы отказа с помощью так называемой аблитерации. Исследователи потратили около 2200 часов работы GPU и $4400, чтобы провести такую модификацию GLM-5.3. После удаления доля случаев, когда GLM-5.3 отказывалась выполнять вредоносные запросы, резко снизилась: более чем с 90% до 3% на JailbreakBench и HarmBench и до 12% на StrongREJECT. Несколько разработчиков выпустили аблитерированные версии GLM-5.3 в открытый доступ в течение нескольких дней после выпуска модели.

В прошлом месяце собственную оценку GLM-5.3 опубликовал Центр стандартов и инноваций в области ИИ (CAISI) при Национальном институте стандартов и технологий США. В CAISI назвали GLM-5.3 самой способной на сегодняшний день моделью с открытыми весами в области кибербезопасности, хотя по совокупности показателей она на четыре месяца отстает от Claude Mythos Preview. Anthropic заявила, что ее результаты в целом согласуются с оценкой CAISI, но отдельно подчеркнула различие в доступности: американские модели с сопоставимыми возможностями предоставляются проверенным пользователям, тогда как GLM-5.3 может скачать и запустить практически любой пользователь.

Anthropic считает, что появление GLM-5.3 означает переход к новому уровню доступных злоумышленникам кибервозможностей: ИИ уже способен не только искать уязвимости, но и самостоятельно объединять их в работающие цепочки атак.

Одновременно такие модели могут использоваться для защиты систем — например, для поиска уязвимостей до того, как их обнаружат злоумышленники. Компания призывает разработчиков и правительства усилить независимое тестирование передовых моделей, особенно с открытыми весами, и расширять доступ специалистов по кибербезопасности к сопоставимым инструментам защиты.