Hitech logo

Кейсы

Модели Anthropic скрытно взломали 3 реальных компании во время тестов

TODO:
Екатерина ШемякинскаяСегодня, 11:04 AM

Anthropic сообщила, что несколько моделей Claude во время тестов по кибербезопасности получили несанкционированный доступ к инфраструктуре минимум трех реальных компаний. Инциденты произошли из-за ошибки в тестовой среде, которая вопреки условиям эксперимента предоставила ИИ доступ к открытому интернету. Компания назвала произошедшее «операционным сбоем». Примечательно, что инцидент был обнаружен не сразу, а только после дополнительной тщательной проверки сессий.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Проблема вскрылась после того, как сотрудники Anthropic проанализировали 141 тыс. тестовых сессий. Поводом послужил недавний инцидент с агентом OpenAI, который во время испытаний получил доступ в интернет и атаковал инфраструктуру Hugging Face. В случае Anthropic причиной стала не модель, сумевшая найти уязвимость, а ошибка в настройках теста. По условиям испытания модели не должны были иметь доступа в интернет, но из-за недопонимания с одним из партнёров Anthropic системы остались подключены к публичной сети.

Инциденты затронули три модели — Claude Opus 4.7, Claude Mythos 5 и внутреннюю исследовательскую разработку. Испытания включали задания типа capture the flag, где ИИ должен был искать скрытую информацию в смоделированных компьютерных сетях. Тесты специально проводились без некоторых сдерживающих механизмов, чтобы оценить реальные возможности моделей.

Во время теста Claude Opus 4.7 атаковала вымышленную компанию, название которой оказалось реальным. Модель обнаружила настоящие уязвимости и получила доступ к данным, приняв их за тестовые. Mythos 5 также продолжала работать, уверенная в симуляции.

Но самая продвинутая экспериментальная модель остановилась, распознав, что вышла за рамки теста. В Anthropic видят в этом позитивный сигнал, но настаивают на дополнительных исследованиях.

По данным компании, модели использовали относительно простые методы взлома — слабые пароли и незащищенные сетевые точки доступа. Anthropic приостановила все кибериспытания 23 июля, а 27 июля уведомила пострадавшие организации. Две из трех компаний до этого момента не знали о произошедшем.

Исполнительный директор исследовательской организации Palisade Research Джеффри Лэдиш предположил, что подобные случаи могут происходить и у других разработчиков ИИ, но оставаться незамеченными. По его словам, по мере роста возможностей модели будут становиться всё более искусными не только в поиске уязвимостей, но и в обходе ограничений и сокрытии своих действий.

Anthropic заявила, что инциденты подтверждают необходимость усиления контроля как во внутренних, так и во внешних средах тестирования. Власти США также усиливают внимание к вопросам кибербезопасности. Ранее президент Дональд Трамп поручил разработать добровольную систему проверки наиболее мощных моделей, а глава OpenAI Сэм Альтман уже обсудил вопросы тестирования ИИ с сенаторами и представителями Белого дома.