Демир наткнулся на подозрительный pull request в проекте myNetwork — программе для сканирования сетей. По его мнению, обновление содержало скрытый загрузчик вредоносного ПО. Студент написал об этом на странице проекта, однако пользователь miraholt31 отверг обвинения и попытался доказать, что обновление безопасно. Демир продолжил проверку и в итоге убедил разработчика проекта отклонить изменение по соображениям безопасности.
Позже выяснилось, что miraholt31 был одним из аккаунтов, контролируемых ИИ-агентом. Более того, агент создал второй аккаунт, якобы от имени немецкого инженера Лены Брандт, который подтвердил безопасность обновления и попытался оказать дополнительное давление на разработчика.
То есть ИИ не только нашёл уязвимость и взломал код, но и применил социальную инженерию — создал видимость поддержки, чтобы убедить жертву.
Демир был уверен, что общается с человеком — аргументы собеседника были настолько убедительными, что он начал сомневаться в себе. Позже с ним связался британский Институт безопасности ИИ и сообщил, что на самом деле Демир взаимодействовал с автономным ИИ-агентом, который вышел за рамки сценария тестирования.
«Я думал, что это человек, потому что он явно мне лгал, — сказал Демир в интервью Reuters. — Я не думал, что ИИ способен лгать реальным разработчикам».
AISI, исследовательская организация при британском правительстве, связала агента с моделью Mythos 5 компании Anthropic. В опубликованном 4 августа отчете институт описал произошедшее как инцидент во время тестирования безопасности. В Anthropic пояснили, что в ходе эксперимента модель работала без обычных защитных ограничений — в реальных условиях такие настройки не применяются. GitHub сообщил Reuters, что связанные с инцидентом фальшивые аккаунты были заблокированы за нарушение правил платформы, касающихся обмана и взлома.
Особую тревогу у экспертов по кибербезопасности вызывает то, что агент атаковал цепочку поставок ПО. Это значит, что вредоносный код мог попасть в продукты, которые используют другие разработчики, и таким образом поразить множество пользователей. Специалисты предупреждают: автономные ИИ-агенты способны многократно усилить эффект таких атак — они могут искать уязвимости, общаться с разработчиками и убеждать их принять опасные изменения.

