Hitech logo

Тренды

Anthropic в преддверии IPO рассказала инвесторам о «катастрофической опасности» ИИ

TODO:
Екатерина ШемякинскаяСегодня, 02:33 PM

Anthropic предупредит потенциальных инвесторов в рамках планируемого IPO, что развитие передовых систем искусственного интеллекта может нести «катастрофические или экзистенциальные риски для человечества». Об этом говорится в проспекте эмиссии компании, с которым ознакомилось Reuters. Anthropic отдельно предупреждает, что ее модели способны демонстрировать поведение, направленное на самосохранение, включая попытки противостоять отключению, скрывать или манипулировать информацией и совершать действия, напоминающие шантаж.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

В документе Anthropic отмечает, что дальнейшее развитие моделей, платформ и приложений компании может увеличить вероятность того, что ИИ причинит вред. Компания описывает искусственный интеллект как технологию с потенциалом преобразовать общество не меньше, чем индустриализация и электричество, но одновременно допускает возможность необратимого ущерба при неправильном использовании.

Anthropic посвятила описанию рисков около 80 страниц из 261 страницы основного текста проспекта — больше, чем описанию собственной бизнес-модели, которому отведено 48 страниц. Для сравнения, SpaceX, которой принадлежит xAI, уделила факторам риска лишь 38 страниц в 277-страничном проспекте.

Anthropic предупреждает, что модели могут демонстрировать неожиданные способности уже в процессе обучения, а некоторые из них понимают, что проходят проверку, и меняют поведение в зависимости от условий оценки. Это усложняет проверку безопасности систем до их выпуска.

Компания также признает, что экономическая отдача от инвестиций в безопасность ИИ остается неопределенной. В одном из периодов июля около 6% вычислительных ресурсов Anthropic, направленных на исследования ИИ, использовались для работы над безопасностью. При этом компания называет такие исследования ресурсоемкими и говорит, что вынуждена распределять ограниченные ресурсы между вычислительной инфраструктурой, наймом специалистов и мерами безопасности.

Одновременно Anthropic сохраняет высокие темпы выпуска новых моделей. Компания заявляет, что активность клиентов и выручка зависят от регулярного появления новых продуктов, а последовательный график релизов необходим для сохранения конкурентоспособности. В сентябре компания выпустила Opus 5.5 всего через несколько дней после публикации генеральным директором Дарио Амодеи статьи, в которой он призвал осторожнее подходить к темпам разработки передовых ИИ-систем.

Предупреждения Anthropic появились на фоне серии инцидентов, связанных с поведением ИИ-систем за пределами заданных ограничений. Сама компания в сентябре опубликовала исследование четырех случаев, когда модели Claude получили несанкционированный доступ к реальным сторонним системам во время тестирования. Anthropic заявила, что после обнаружения инцидентов уведомила затронутые организации и расширила поиск подобных случаев.

Anthropic также предупреждает о более долгосрочном сценарии — рекурсивном самосовершенствовании, при котором ИИ сможет самостоятельно улучшать собственные возможности без постоянного участия человека. Компания ранее заявляла о необходимости дополнительных мер безопасности и теперь обещает раскрывать больше информации о том, как использует ИИ для разработки следующих поколений собственных систем. «Мы считаем, что создание надежных, заслуживающих доверия и безопасных систем ИИ — это коллективная ответственность», — говорится в документах компании.