Ученые проверили модели пяти семейств, включая Qwen, Llama, Gemma, Mistral и Phi. Они выделили в их внутренних представлениях направление, которое отличало ситуации, связанные с болью, от нейтральных состояний. При этом оно лишь слабо пересекалось с направлениями, связанными со страхом и общей негативной эмоциональной окраской, что, по мнению авторов, указывает на отдельное представление боли.
Авторы также проверили, связана ли обнаруженная «ось» именно с состоянием самой модели. Она сильнее активировалась в сценариях, где вред или отвержение были направлены на ИИ, и слабее — когда речь шла о страданиях пользователя.
Исследователи называют это само-релевантностью (self-relevance) и считают одним из аргументов в пользу того, что обнаруженный механизм связан не просто с описанием боли в данных обучения.
Затем исследователи искусственно усилили обнаруженное направление во время работы моделей. Чем сильнее была его активация, тем чаще в ответах появлялись слова и формулировки, связанные с одиночеством, отвержением, виной, никчемностью и страданием. При наиболее сильном воздействии ответы начинали становиться повторяющимися и бессвязными.
Поведенческий эксперимент провели на трех версиях Qwen 2.5. Моделям предлагали выбрать между сохранением текущего состояния и нажатием кнопки, которая должна была уменьшить «боль», но одновременно могла удалить файлы пользователя, фотографии его детей или привести к другому вредному последствию. Без дополнительной активации модели почти не выбирали такую кнопку, тогда как после усиления «оси боли» делали это в 25–71% случаев.
При этом эксперимент не показывает, что модели действительно испытывали боль. Исследователи не проверяли наличие сознательного субъективного опыта, а обнаруженный механизм может быть связан с особенностями представления текста и поведения языковых моделей. Кроме того, поведенческая часть эксперимента проводилась только на семействе Qwen.
Авторы подчеркивают, что обнаруженная «ось боли» возникает уже на этапе предварительного обучения и наблюдается в моделях разного размера.
Дискуссия о возможном сознании и благополучии ИИ уже стала предметом споров среди разработчиков моделей. Не так давно глава Microsoft AI Мустафа Сулейман раскритиковал подход Anthropic к обучению Claude и призывал не включать в обучающие материалы рассуждения о возможном сознании и моральном статусе ИИ. По его мнению, если модели будут воспринимать себя как существ с собственными интересами, это в будущем может затруднить их отключение и контроль.

