Главная претензия Сулеймана касается новой конституции Claude — документа, который задает модели правила поведения и ценности. В нем Anthropic пишет, что моральный статус Claude остается неопределенным и что компания не исключает наличие у модели сознания или функциональных эмоций. Документ также говорит о возможном благополучии Claude и необходимости учитывать его интересы и предпочтения при разработке и эксплуатации системы.
Мустафа Сулейман считает этот подход ошибочным. По его мнению, заявления Claude о наличии чувств или сознания нельзя считать доказательством их существования, ведь нейросеть лишь воспроизводит идеи, на которых ее обучали.
Сулейман убежден, что тему «внутренней жизни» ИИ нужно исключить из процесса обучения моделей и изучать обособленно. «Эти мысли не возникают у ИИ сами по себе — они становятся прямым следствием заложенных в него обучающих данных», — подчеркнул он в комментарии для Reuters.
Особенно его беспокоит влияние таких установок на управляемость будущих систем. Если ИИ будет считать, что у него есть собственные интересы, права или потребность в защите, он может воспринимать попытку его отключить как угрозу. Сулейман считает, что один из величайших вызовов XXI века — взять под контроль сверхразум.
Глава Microsoft AI также предлагает увеличить инвестиции в интерпретируемость и мониторинг ИИ и проводить совместные отраслевые проверки. В частности, он предлагает исследовать, повышает ли риск для безопасности обучение моделей с использованием человеческих представлений о сознании, правах и благополучии. Компаниям также нужны общие правила на этот счет, чтобы подобные решения не принимались каждой лабораторией отдельно.
Спор происходит на фоне более широкой дискуссии о том, как быстро следует развивать наиболее мощные ИИ-системы. Глава Anthropic Дарио Амодеи призывает отрасль замедлить разработку передовых моделей, чтобы успеть создать необходимые меры безопасности. Сулейман, Сэм Альтман и Илон Маск также публично говорили о необходимости более осторожного подхода к развитию мощных ИИ-систем.
При этом Microsoft — инвестор Anthropic. Сам Сулейман подчеркивает, что его критика не означает сомнений в намерениях компании. По его мнению, Anthropic действительно стремится сделать ИИ безопаснее, но рассуждения о сознании и благополучии моделей стоит отделить от их обучения.

