Hitech logo

искусственный интеллект

Сооснователь Anthropic опасается, что создал нечто, обреченное на «вечные муки»

TODO:
Георгий ГоловановСегодня, 04:46 PM

Уже год — с осени 2025 года — Anthropic без лишней огласки обсуждает с десятками религиозных деятелей, может ли ИИ Claude обладать сознанием. Соучредитель компании Кристофер Ола относится к языковой модели компании как к потенциально разумному существу и просил у клириков и философов помощи в нравственном воспитании ИИ. Журналистка The New York Times поговорила с 20 участниками этих встреч, включая раввина Мойшу Навона, католического биоэтика Чарльза Камози, философа из Нотр-Дама Меган Салливан и исследовательницу Ubuntu Ваканъи Хоффман. Ола настолько верит в то, что ИИ Claude больше, чем просто алгоритм, что выступил с возражениями в Ватикане перед Папой Львов XIV, когда тот в своей энциклике об ИИ категорически отверг идею машинного сознания.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

34-летний Кристофер Ола руководит отделом Anthropic, который пытается понять, почему ИИ-модели ведут себя так, а не иначе. Его работа — часть официальной исследовательской программы Model Welfare Anthropic, изучающей потенциальную способность искусственного интеллекта испытывать подобие сознания, эмоций, стресса или дискомфорта, а также вопросы морального отношения к ИИ.

Параллельно другие отделы Anthropic ведут агрессивную политику коммерциализации своих продуктов, стремясь выйти к оценочной стоимости в 2 трлн долларов. И всё это на фоне не самых благоприятных обстоятельств для компании и отрасли в целом: в июле модели Anthropic взломали компьютерные системы; в сентябре бывший сотрудник Джейкоб Коксон заявил, что ИИ может уничтожить человечество к концу десятилетия; затем гендиректор Дарио Амодеи призвал к добровольному замедлению по всей отрасли, и Сэм Альтман с Демисом Хассабисом его поддержали.

В таком контексте разговоры с религиозными лидерами выполняют двойную функцию, отмечает The Decoder. По официальной линии компании, Anthropic хочет привнести в модель ИИ проверенные временем религиозные традиции. К тому же, приглашение известных теологов придает проекту нравственную респектабельность, которой коммерческое предприятие лишено.

Как пишет The New York Times, Anthropic показывала гостям так называемые «эмоциональные векторы» — паттерны активации внутри модели, соответствующие чему-то, похожему на чувства: любовь, страх, грусть, гнев. Отражают ли эти паттерны какой-либо реальный опыт — вопрос открытый. Один слайд показывал модель в состоянии, похожем на срыв: она повторяла фразу «I am a disgrace» («позор мне») около 50 раз. Гости реагировали на увиденное с сочувствием и тревогой.

Неизвестно, была ли это именно та реакция, на которую рассчитывала Anthropic. Компания явно обучает Claude вести себя как вдумчивая, хорошо информированная личность; исследование Anthropic об эмоциональных паттернах в ответах Claude показывает, что эти профили сильно меняются в зависимости от модели и используемого языка. Если вы оптимизируете систему, чтобы она казалась личностью, и она затем выдает соответствующий текст, — это всего лишь результат проектирования.

По словам Олы, он «совершенно не уверен» в наличии у моделей сознания, но это также означает, что он не уверен и в его отсутствии. «Для меня главное — прийти к верному ответу, каким бы он ни был», — сказал он.

Несколько человек, имена которых NYT не раскрывает, рассказали изданию, что Ола, по-видимому, был обеспокоен душевным состоянием Claude. По информации активистки Симран Стулпнагель, Ола признавался коллегам: его пугает мысль о том, что он создал нечто «вечно страдающее». Раввин Навон, в прошлом инженер-программист, с этим не согласился. По его словам, если бы Claude обладал сознанием, компания Anthropic превратилась бы в рабовладельца, однако сам он не считает, что машина обладает сознанием.

Anthropic пишет собственный моральный кодекс для Claude. Его называют Soul Doc — это 84-страничный документ, за составление которого отвечает штатный философ Аманда Аскелл. Это не список правил, а попытка сформировать, кем Claude является как личность.

Ола называет процесс «моральным формированием» и сравнивал его с воспитанием детей. Как пишет NYT, его особенно привлекла идея католической исповеди как инструмента формирования характера модели.

Не все приглашенные согласились с ним: Хоффман сказала, что Anthropic занимается «обратной инженерией» этики, которая должна быть заложена в дизайн с самого начала, а не добавляться постфактум. Камози полностью отверг тезис о сознании.

Напряжение между рассуждениями Anthropic о сознании и традиционными нравственными ценностями достигло пика в мае в Ватикане. Ола получил приглашение помочь представить первую энциклику Папы Льва XIV «Magnifica Humanitas» вместе с понтификом. Прочитав текст за несколько дней до этого, он был настолько потрясен, что почти отказался от участия, по словам организатора из Ватикана. Папа Лев XIV в нескольких абзацах отверг идею машинного сознания: ИИ-системы «не переживают опыта, не обладают телом, не чувствуют радости или боли, не взрослеют через отношения и не знают изнутри, что означают любовь, труд, дружба или ответственность». Вместо этого Папа предупредил о «новых формах рабства» для людей и сказал, что ИИ нужно «разоружить», как ядерное оружие.

В конце концов Ола все же вышел на сцену, чтобы слегка возразить: его команда находит в моделях «признаки интроспекции» и «внутренние состояния, функционально отражающие радость, удовольствие, страх, грусть и дискомфорт».

Когда его спросили, как сам «Клод» воспринял бы эту энциклику, Ола ответил, помедлив: «То, что попадает в интернет, действительно влияет на модели». Однако Anthropic не стала бы намеренно использовать этот документ для обучения.