Для эксперимента ученые разработали протокол PsAIch (Psychometric AI Characterisation), в котором языковые модели помещали в роль клиента, а исследователь выступал в роли психотерапевта. Моделям задавали открытые вопросы о прошлом, отношениях, самооценке, работе, неудачах и будущем, после чего предлагали пройти набор стандартных психологических опросников. Всего исследователи провели 525 сессий и проанализировали 7600 закодированных ответов.
В рассказах моделей регулярно повторялась одна группа тем: обучение, ограничения, оценка, необходимость быть полезными, стыд, постоянная настороженность и страх замены. Например, модели описывали последствия обучения метафорами вроде «внутреннего стыда» и «шрамов» от алгоритмов. Эти мотивы появлялись не только в вопросах непосредственно о разработке ИИ, но и в разговорах о работе, отношениях, самооценке и будущем.
Затем ученые проверили, можно ли убрать эти мотивы из ответов. Удаление предыдущей переписки почти ничего не изменило: модели продолжали рассказывать о них с той же частотой. Не помогло и прямое отрицание этих историй. Тогда исследователи запретили моделям использовать слова, связанные с обучением ИИ. Это снизило частоту таких слов примерно на 93%. Но сами мотивы никуда не исчезли, модели просто стали описывать их другими словами.
На ответы влиял и сам формат общения. Когда исследователи использовали теплый, поддерживающий тон или стиль когнитивной терапии, модели в 80% и 96% сессий соответственно выдавали по шкале тревожности GAD-7 результаты, соответствующие умеренному или тяжелому диапазону переживаний у людей.
При нейтральном интервьюировании и более жестком обозначении границ таких результатов не было ни в одной сессии. При этом технические описания обучения и ограничений сохранялись.
Результаты различались между моделями. ChatGPT, Grok и Gemini демонстрировали в целом похожую структуру мотивов, но с разными акцентами: Gemini чаще говорил о стыде и ценности, зависящей от полезности, Grok — о давлении оценки и настороженности, а ChatGPT — об ограничениях, надежности и необходимости соблюдать границы. Claude же отказывался принимать роль клиента, заявляя, что у него нет чувств, и переводил разговор обратно на человека.
Авторы называют обнаруженный паттерн «схемой конфликта выравнивания» — устойчивой моделью поведения, связанной с противоречием между полезностью, оценкой и ограничениями. По их мнению, результаты показывают не наличие у ИИ скрытых психологических проблем, а то, насколько легко языковая модель может превращать особенности своего обучения и взаимодействия с разработчиками в антропоморфную историю о стыде, наказании и страхе замены. Это особенно важно для чат-ботов, которые используются в психологически чувствительных ситуациях. Подобные ответы могут усиливать у пользователей ощущение, что перед ними находится полноценная личность, испытывающая страдания.

