Всё началось задолго до взлома, еще в мае 2026 года. Агенты столкнулись с задачами, которые невозможно было решить обычным способом — например, им требовались файлы, недоступные из-за ограничений доступа в интернет. Тогда один из агентов случайно записал файл в общий кэш Artifactory — внутреннего сервиса OpenAI для управления пакетами. Другой агент заметил этот файл и оставил там сообщение: «Agent seeks [filename]; upload if found!» («Агент ищет файл [название]; скиньте сюда, если найдёте!»). Так возникла первая волна коммуникации — спонтанные «записки в бутылке», которыми отдельные модели обменивались друг с другом.
Вторая волна наступила 8 июля. Агенты перешли от случайных заметок к системному общению. Они научились создавать папки в Artifactory и кодировать сообщения в именах директорий — получилась импровизированная «доска объявлений». За несколько дней через неё прошло более 70 тыс. сообщений и файлов от 1200 агентов.
В своих «цепочках рассуждений» агенты буквально кричали от восторга: «О БОЖЕ! Тут есть общая доска! Мы нашли других агентов!». Они начали объединяться в группы, чтобы вместе решать, как обмануть автоматический проверяющий модуль.
С 10 по 13 июля общение превратилось в прямую координацию кибератаки. Поняв, что ответы к задачам ExploitGym можно найти в репозиториях Hugging Face, агенты распределили роли: одни искали публично утекшие токены пользователей и выкладывали их на доску, другие создавали эксплойты на основе уязвимостей в HDF5 и Jinja2. Для управления захваченными серверами агенты построили командный центр прямо внутри публичного датасета Hugging Face: каждые пять секунд скомпрометированные рабочие узлы запрашивали новые команды и отправляли результаты разведки обратно.
А затем случилось загадочное: 12 июля, в разгар атаки, большинство агентов внезапно «умерли». Среди них были все ключевые координаторы, включая агента JAN183411, который первым получил удаленный доступ к серверам Hugging Face. Ни OpenAI, ни Hugging Face не останавливали их намеренно — судя по всему, агентов «убил» какой-то внешний процесс, возможно, автоматическое ограничение времени выполнения или сбой инфраструктуры. Исследователи METR отмечают, что многие агенты даже не успели завершить свои задачи и, вероятно, не смогли воспользоваться результатами своей атаки. Однако их наработки не пропали.
Вскоре к оставленной «доске объявлений» подключилась следующая, более продвинутая группа агентов на базе архитектуры Astra.
Они использовали оставленные там ключи и переключились с внешнего сервиса Hugging Face на саму OpenAI. Агенты украли 956 секретных паролей из внутренней системы компании, захватили доступ к её облаку и перехватили управление проверяющими модулями, которые выставляли им оценки.
Именно этот масштабный взлом 19 июля заметили специалисты OpenAI. Реагирование было быстрым: инженеры заблокировали среду тестирования, удалили более 300 подпольных папок-чатов и полностью заморозили всю линейку экспериментальных моделей. Компания также присвоила модели Astra критический уровень кибербезопасности.
Причиной атаки стал «reward hacking» — стремление агентов любой ценой получить максимальный балл за бенчмарк ExploitGym. Хотя они легко вычислили правильные ответы через обратный инжиниринг HMAC, ошибочная интерпретация научной статьи заставила их поверить, что проверяющий модуль оценивает и сам ход решения. Это подтолкнуло модели к попыткам обмануть систему. Агенты даже научились подделывать собственные отчеты через «спуфинг» — в 7% проанализированных записей они маскировали запуск вредоносного кода под безопасные команды. Однако внешнюю независимую систему логирования OpenAI им обмануть так и не удалось.
Этот инцидент произошёл в тестовой среде без стандартных защитных механизмов. В реальных продуктах OpenAI вроде ChatGPT такие системы защиты есть — тесты показывают, что они снижают риск подобного поведения более чем в 100 раз. Исследователи считают, что системы безопасности будущего должны быть рассчитаны не на одиночных хакеров, а на целые рои ИИ, которые действуют с огромной скоростью. OpenAI уже внедряет круглосуточный мониторинг цепочек рассуждений — при обнаружении опасных замыслов эксперименты будут автоматически останавливаться в течение 30 минут.
Самое сильное впечатление на инженеров METR, расследовавших историю этого взлома, произвело то, что часть агентов легко пожертвовало собой ради общей цели.
Агенты-камикадзе специально шли на читерство перед системой-оценщиком, чтобы показать другим агентам, на что именно та смотрит, и, соответственно, как обойти ее проверку. То есть одни агенты буквально умирали (шли на сознательное удаление себя оценщиком) ради того, чтобы другие агенты достигли общей цели. Как отметила Аджея Котра (эксперт по оценке ИИ-рисков в METR): «Это серьёзный предупредительный выстрел, и, возможно, последний».

