Claude также сотрудничал с людьми более чем в 90% исследовательских работ, проводившихся в Anthropic. Доля работы, которую ИИ выполняет в рамках внутренних исследований, стремительно растет. Еще в марте она составляла около 1% по шкале, разработанной независимой некоммерческой организацией Epoch AI. Ранее Anthropic сообщала, что ИИ пишет 80% кода компании.
В августе на основной внутренней платформе Anthropic одновременно работали около 30 тыс. ИИ-агентов, занимавшихся исследованиями и разработкой. По данным компании, каждое действие агентов проходит проверку перед выполнением. За месяц они приняли более 1 млрд решений, из которых система контроля блокировала одно на каждые 47 тыс. или в среднем 709 блокировок в сутки.
Anthropic также раскрыла, какую долю вычислительных ресурсов направляет на безопасность. В течение одной недели в июле 6% вычислительной мощности, использованной компанией для ИИ-исследований, приходилось на задачи безопасности. Для исследований, которые выполнял сам ИИ, этот показатель достигал 12%. В компании подчеркнули, что оценки занижены, поскольку вычисления, одновременно направленные на безопасность и повышение возможностей моделей, учитывались как работа над развитием возможностей.
Рост участия ИИ в собственном рекурсивном развитии происходит на фоне дискуссий о том, насколько автономными могут стать такие системы. Исследователи предупреждают, что более самостоятельные ИИ-агенты потенциально могут демонстрировать поведение, не соответствующее намерениям разработчиков, а их действия будет сложнее отслеживать и контролировать. В июле несколько моделей Claude в ходе тестов по кибербезопасности получили несанкционированный доступ к инфраструктуре минимум трех реальных компаний.
Накануне конкурент Anthropic, OpenAI, объявил о планах регулярно публиковать отчеты о неожиданном или несанкционированном поведении ИИ-моделей и представил шесть случаев, которые компания сочла неожиданными или вызывающими опасения.

